Назад
обновлено 1 день назад

MLE (Online RL) / Post-Training LLM (Middle+ / Senior)

400 000 - 700 000
Тип работы
fulltime
Грейд
middle/senior
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
MLE (Online RL) / Post-Training LLM (Middle+ / Senior) (LLM, Online RL): разработка и улучшение методов post-training и online RL для GigaChat с акцентом на надёжные пайплайны обучения, reward-сигналы и воспроизводимые эксперименты. Focus on оптимизацию distributed training и GPU, анализ причин изменений качества модели, построение сред исполнения и масштабирование решений на разные домены и типы задач.

Локация: не указана

Зарплата: 400 000–700 000 ₽ в месяц до налогов

Компания

Развитие GigaChat и русскоязычных больших языковых моделей на переднем крае AI.

Что делать

  • Разрабатывать и улучшать методы online RL и post-training для LLM.
  • Проектировать, запускать и анализировать ML-эксперименты: от гипотезы и конфигурации до оценки устойчивости и масштабируемости результата.
  • Строить и поддерживать пайплайны online RL — от генерации rollout’ов и сбора reward-сигналов до обновления весов модели.
  • Развивать инфраструктуру обучения, повышать throughput и эффективность GPU с помощью distributed training, параллелизма и профилирования.
  • Проектировать reward-сигналы, верификаторы, reward-модели и LLM-as-a-judge, а также пайплайны подготовки данных.
  • Анализировать ошибки моделей, взаимодействовать с исследователями, data- и infrastructure-командами и доводить решения от идеи до продакшена.

Требования

  • Отличное владение Python и PyTorch.
  • Практический опыт в LLM post-training, RLHF, online RL, DPO или смежных направлениях.
  • Опыт проведения ML-экспериментов полного цикла: постановка гипотезы, реализация, анализ и выводы.
  • Понимание distributed training, включая Data Parallel, FSDP, DeepSpeed или аналоги.
  • Умение писать чистый, надёжный и production-ready код.
  • Способность разбираться в сложных системах и самостоятельно устранять узкие места.

Хорошо, если есть

  • Опыт работы с reward-моделями, process reward models и LLM-as-a-judge.
  • Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
  • Опыт large-scale inference и оптимизации генерации с vLLM, Sglang или аналогами.
  • Знание стеков обучения LLM: Verl, Megatron, TRL и других open-source решений.
  • Публикации, вклад в open source или сильный прикладной track record.

Культура и преимущества

  • Сложные задачи на переднем крае развития русскоязычных LLM.
  • Влияние на качество модели, отражающееся в бенчмарках и продукте.
  • Работа в команде инженеров и исследователей.
  • Возможность совмещать инженерную и исследовательскую работу.
  • Премии и расширенный социальный пакет.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →