3 дня назад
Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat
500 000 - 1 000 000₽
RUВакансия из Hirify RU, списка российских tech-компаний
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat (Python/PyTorch): развитие методов online-RL и post-training для LLM с акцентом на проектирование экспериментов, reward-сигналы и надёжные пайплайны обучения. Фокус на distributed training, эффективном использовании GPU, воспроизводимости экспериментов и масштабировании улучшений качества моделей.
Локация: гибридный формат или офис
Зарплата: 500 000–1 000 000 ₽ в месяц на руки
Компания
Развитие GigaChat и инфраструктуры обучения больших языковых моделей в команде Сбера.
Что делать
- Разрабатывать и улучшать методы online-RL и post-training для LLM.
- Проектировать, запускать и анализировать ML-эксперименты от гипотезы до вывода о качестве и масштабируемости результата.
- Строить пайплайны online-RL: от генерации rollout’ов и сбора reward-сигналов до обновления весов модели.
- Развивать инфраструктуру обучения, оптимизировать throughput и использование GPU с применением distributed training и профилирования.
- Обеспечивать воспроизводимость экспериментов, версионирование данных, конфигураций и чекпойнтов, а также контроль деградаций.
- Взаимодействовать с исследователями, командами данных и инфраструктуры, брать ответственность за компоненты системы от идеи до выхода в продакшен.
Требования
- Отличное владение Python и PyTorch.
- Практический опыт в LLM post-training, RLHF, online-RL, DPO или смежных направлениях.
- Опыт проведения ML-экспериментов от постановки гипотезы до реализации, анализа и выводов.
- Понимание distributed training, включая Data Parallel, FSDP, DeepSpeed или аналоги.
- Умение писать чистый, надёжный и production-ready код.
- Способность самостоятельно разбираться в сложных системах и устранять узкие места.
Хорошо, если есть
- Опыт работы с reward-моделями, process-reward-моделями и LLM-as-a-judge.
- Опыт создания execution-сред, sandbox’ов и верификаторов для code- или STEM-задач.
- Опыт large-scale inference и оптимизации генерации с vLLM или SGLang.
- Знание современных open-source стеков для обучения LLM: verl, Megatron, TRL и других.
- Публикации, вклад в open source или сильный прикладной track record.
Культура и преимущества
- Возможность выбрать гибридный формат работы или офис.
- Ежегодный пересмотр зарплаты и годовая премия.
- Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
- Более 400 образовательных программ СберУниверситета.
- Корпоративный спортзал, зоны отдыха, льготная ипотека и другие программы для сотрудников.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Похожие вакансии
NDA
1 день назад
MLE (Online RL) / Post-Training LLM (Middle+ / Senior)
400 000 - 700 000₽
Сбер
3 дня назад
Руководитель направления ML Pretrain Multimodal LLM
500 000 - 1 000 000₽
NDA
1 день назад
Стажёр в команду NLP / RL (GigaChat)
100 000₽
NDA
1 день назад
NLP Engineer (Reinforcement Learning)
300 000 - 500 000₽
Сбер
2 дня назад
Senior ML Engineer (Команда проактивного профиля B2C)
300 000 - 500 000₽
NDA
3 дня назад
Research LLM Engineer в команду ML Ops Platform (LLM)
300 000₽