Назад
3 дня назад

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

500 000 - 1 000 000
Формат работы
hybrid/onsite
Тип работы
fulltime
Грейд
head
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat (Python/PyTorch): развитие методов online-RL и post-training для LLM с акцентом на проектирование экспериментов, reward-сигналы и надёжные пайплайны обучения. Фокус на distributed training, эффективном использовании GPU, воспроизводимости экспериментов и масштабировании улучшений качества моделей.

Локация: гибридный формат или офис

Зарплата: 500 000–1 000 000 ₽ в месяц на руки

Компания

Развитие GigaChat и инфраструктуры обучения больших языковых моделей в команде Сбера.

Что делать

  • Разрабатывать и улучшать методы online-RL и post-training для LLM.
  • Проектировать, запускать и анализировать ML-эксперименты от гипотезы до вывода о качестве и масштабируемости результата.
  • Строить пайплайны online-RL: от генерации rollout’ов и сбора reward-сигналов до обновления весов модели.
  • Развивать инфраструктуру обучения, оптимизировать throughput и использование GPU с применением distributed training и профилирования.
  • Обеспечивать воспроизводимость экспериментов, версионирование данных, конфигураций и чекпойнтов, а также контроль деградаций.
  • Взаимодействовать с исследователями, командами данных и инфраструктуры, брать ответственность за компоненты системы от идеи до выхода в продакшен.

Требования

  • Отличное владение Python и PyTorch.
  • Практический опыт в LLM post-training, RLHF, online-RL, DPO или смежных направлениях.
  • Опыт проведения ML-экспериментов от постановки гипотезы до реализации, анализа и выводов.
  • Понимание distributed training, включая Data Parallel, FSDP, DeepSpeed или аналоги.
  • Умение писать чистый, надёжный и production-ready код.
  • Способность самостоятельно разбираться в сложных системах и устранять узкие места.

Хорошо, если есть

  • Опыт работы с reward-моделями, process-reward-моделями и LLM-as-a-judge.
  • Опыт создания execution-сред, sandbox’ов и верификаторов для code- или STEM-задач.
  • Опыт large-scale inference и оптимизации генерации с vLLM или SGLang.
  • Знание современных open-source стеков для обучения LLM: verl, Megatron, TRL и других.
  • Публикации, вклад в open source или сильный прикладной track record.

Культура и преимущества

  • Возможность выбрать гибридный формат работы или офис.
  • Ежегодный пересмотр зарплаты и годовая премия.
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
  • Более 400 образовательных программ СберУниверситета.
  • Корпоративный спортзал, зоны отдыха, льготная ипотека и другие программы для сотрудников.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →