Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
TL;DR
MLE (Online RL) / Post-Training LLM (AI): Разработка и улучшение методов online RL и подходов post-training для GigaChat с акцентом на проектирование экспериментов и построение надежных пайплайнов обучения. Фокус на оптимизации использования GPU, внедрении distributed training и создании эффективных reward-сигналов.
Локация: Офис в Москве
Зарплата: 400 000 — 700 000 ₽/мес до налогов
Компания
Команда разработки GigaChat, создающая передовые русскоязычные большие языковые модели.
Что делать
- Разрабатывать и улучшать методы online RL и подходы post-training.
- Проектировать и проводить ML-эксперименты: от формулировки гипотез до глубокого анализа причин изменения качества модели.
- Строить и развивать инфраструктуру обучения, включая пайплайны генерации rollout'ов и сбора reward-сигналов.
- Оптимизировать throughput и эффективность GPU с использованием distributed training (FSDP, DeepSpeed).
- Реализовывать reward-сигналы: rule-based верификаторы, reward-модели и LLM-as-a-judge.
- Анализировать ошибки модели и формировать целевые обучающие выборки для их устранения.
Требования
- Отличное владение Python и PyTorch.
- Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.
- Опыт проведения полных циклов ML-экспериментов (гипотеза → реализация → анализ → выводы).
- Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.
- Умение писать чистый, надежный и production-ready код.
- Локация: работа в офисе в Москве.
Хорошо, если есть
- Опыт работы с reward-моделями, process reward models или LLM-as-a-judge.
- Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
- Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang).
- Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL).
- Публикации или значимый вклад в open-source проекты.
Культура и преимущества
- Работа над сложными задачами на переднем крае развития LLM.
- Прямое влияние на качество продукта и результаты в бенчмарках.
- Возможность совмещать инженерную деятельность с исследовательской работой.
- Команда сильных инженеров и исследователей.
- Конкурентная компенсация, премии и расширенный соцпакет.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →