обновлено 1 день назад
MLE (Online RL) / Post-Training LLM (Middle+ / Senior)
400 000 - 700 000₽
RUВакансия из Hirify RU, списка российских tech-компаний
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
MLE (Online RL) / Post-Training LLM (Middle+ / Senior) (LLM, Online RL): разработка и улучшение методов post-training и online RL для GigaChat с акцентом на надёжные пайплайны обучения, reward-сигналы и воспроизводимые эксперименты. Focus on оптимизацию distributed training и GPU, анализ причин изменений качества модели, построение сред исполнения и масштабирование решений на разные домены и типы задач.
Локация: не указана
Зарплата: 400 000–700 000 ₽ в месяц до налогов
Компания
Развитие GigaChat и русскоязычных больших языковых моделей на переднем крае AI.
Что делать
- Разрабатывать и улучшать методы online RL и post-training для LLM.
- Проектировать, запускать и анализировать ML-эксперименты: от гипотезы и конфигурации до оценки устойчивости и масштабируемости результата.
- Строить и поддерживать пайплайны online RL — от генерации rollout’ов и сбора reward-сигналов до обновления весов модели.
- Развивать инфраструктуру обучения, повышать throughput и эффективность GPU с помощью distributed training, параллелизма и профилирования.
- Проектировать reward-сигналы, верификаторы, reward-модели и LLM-as-a-judge, а также пайплайны подготовки данных.
- Анализировать ошибки моделей, взаимодействовать с исследователями, data- и infrastructure-командами и доводить решения от идеи до продакшена.
Требования
- Отличное владение Python и PyTorch.
- Практический опыт в LLM post-training, RLHF, online RL, DPO или смежных направлениях.
- Опыт проведения ML-экспериментов полного цикла: постановка гипотезы, реализация, анализ и выводы.
- Понимание distributed training, включая Data Parallel, FSDP, DeepSpeed или аналоги.
- Умение писать чистый, надёжный и production-ready код.
- Способность разбираться в сложных системах и самостоятельно устранять узкие места.
Хорошо, если есть
- Опыт работы с reward-моделями, process reward models и LLM-as-a-judge.
- Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
- Опыт large-scale inference и оптимизации генерации с vLLM, Sglang или аналогами.
- Знание стеков обучения LLM: Verl, Megatron, TRL и других open-source решений.
- Публикации, вклад в open source или сильный прикладной track record.
Культура и преимущества
- Сложные задачи на переднем крае развития русскоязычных LLM.
- Влияние на качество модели, отражающееся в бенчмарках и продукте.
- Работа в команде инженеров и исследователей.
- Возможность совмещать инженерную и исследовательскую работу.
- Премии и расширенный социальный пакет.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Похожие вакансии
Сбер
3 дня назад
Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat
500 000 - 1 000 000₽
Сбер
3 дня назад
Руководитель направления ML Pretrain Multimodal LLM
500 000 - 1 000 000₽
Сбер
3 дня назад
NLP-инженер (GigaChat)
300 000 - 700 000₽
Сбер
1 день назад
Senior DL (VLM, GigaChat Vision)
500 000 - 800 000₽
Сбер
2 дня назад
Senior ML Engineer (LLM)
300 000 - 400 000₽
Сбер
3 дня назад
Senior NLP, LLM Data Scientist
300 000 - 450 000₽