Назад
4 дня назад

MLE (Online RL) / Post-Training LLM (AI)

400 000 - 700 000
Формат работы
onsite
Тип работы
fulltime
Грейд
middle/senior
Страна
Russia

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/

TL;DR

MLE (Online RL) / Post-Training LLM (AI): Разработка и улучшение методов online RL и подходов post-training для GigaChat с акцентом на проектирование экспериментов и построение надежных пайплайнов обучения. Фокус на оптимизации использования GPU, внедрении distributed training и создании эффективных reward-сигналов.

Локация: Офис в Москве

Зарплата: 400 000 — 700 000 ₽/мес до налогов

Компания

Команда разработки GigaChat, создающая передовые русскоязычные большие языковые модели.

Что делать

  • Разрабатывать и улучшать методы online RL и подходы post-training.
  • Проектировать и проводить ML-эксперименты: от формулировки гипотез до глубокого анализа причин изменения качества модели.
  • Строить и развивать инфраструктуру обучения, включая пайплайны генерации rollout'ов и сбора reward-сигналов.
  • Оптимизировать throughput и эффективность GPU с использованием distributed training (FSDP, DeepSpeed).
  • Реализовывать reward-сигналы: rule-based верификаторы, reward-модели и LLM-as-a-judge.
  • Анализировать ошибки модели и формировать целевые обучающие выборки для их устранения.

Требования

  • Отличное владение Python и PyTorch.
  • Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.
  • Опыт проведения полных циклов ML-экспериментов (гипотеза → реализация → анализ → выводы).
  • Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.
  • Умение писать чистый, надежный и production-ready код.
  • Локация: работа в офисе в Москве.

Хорошо, если есть

  • Опыт работы с reward-моделями, process reward models или LLM-as-a-judge.
  • Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
  • Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang).
  • Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL).
  • Публикации или значимый вклад в open-source проекты.

Культура и преимущества

  • Работа над сложными задачами на переднем крае развития LLM.
  • Прямое влияние на качество продукта и результаты в бенчмарках.
  • Возможность совмещать инженерную деятельность с исследовательской работой.
  • Команда сильных инженеров и исследователей.
  • Конкурентная компенсация, премии и расширенный соцпакет.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →