обновлено 2 дня назад
NLP Engineer (Reinforcement Learning)
300 000 - 500 000₽
RUВакансия из Hirify RU, списка российских tech-компаний
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
NLP Engineer (Reinforcement Learning) (LLM/online RL): Разработка и улучшение методов post-training и online RL для GigaChat с акцентом на эксперименты, reward-сигналы и надёжные пайплайны обучения. Focus on оптимизацию distributed training, воспроизводимость экспериментов, анализ ошибок моделей и масштабирование решений на разные домены и типы задач.
Компания
Развитие GigaChat и передовых решений для русскоязычных больших языковых моделей.
Что делать
- Разрабатывать и улучшать методы online RL и post-training для LLM.
- Проектировать, запускать и анализировать ML-эксперименты: от формулировки гипотез до оценки устойчивости и масштабируемости результатов.
- Строить и поддерживать пайплайны online RL — от генерации rollout'ов и сбора reward-сигналов до обновления весов моделей.
- Развивать инфраструктуру обучения, оптимизировать throughput и использование GPU с помощью distributed training, параллелизма и профилирования.
- Проектировать reward-сигналы, верификаторы, reward-модели и execution-based проверки.
- Взаимодействовать с исследователями, инженерными, data- и инфраструктурными командами, отвечая за решения от идеи до продакшена.
Требования
- Отличное владение Python и PyTorch.
- Практический опыт в LLM post-training, включая RLHF, online RL, DPO или смежные направления.
- Опыт проведения ML-экспериментов полного цикла: постановка гипотезы, реализация, анализ и выводы.
- Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналогов.
- Умение писать чистый, надёжный и production-ready код, самостоятельно находить и устранять узкие места.
Хорошо, если есть
- Опыт работы с reward-моделями, process reward models и LLM-as-a-judge.
- Опыт создания сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
- Опыт large-scale inference и оптимизации генерации с использованием vLLM, Sglang или аналогов.
- Знание open-source стеков для обучения LLM, включая Verl, Megatron и TRL.
- Публикации, open-source вклад или сильный прикладной track record.
Культура и преимущества
- Сложные задачи на переднем крае развития русскоязычных LLM.
- Прямое влияние результатов работы на бенчмарки и продукт.
- Работа в команде инженеров и исследователей.
- Возможность совмещать инженерную и исследовательскую работу.
- Конкурентная компенсация, премии и расширенный социальный пакет.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Похожие вакансии
Сбер
4 дня назад
Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat
500 000 - 1 000 000₽
Сбер
4 дня назад
NLP-инженер (GigaChat)
300 000 - 700 000₽
Аналитические программные решения
11 дней назад
ML/NLP Engineer (AI)
150 000 - 250 000₽
Сбер
3 дня назад
ML-инженер (GenAI)
300 000 - 400 000₽
Yandex
10 дней назад
NLP Engineer (AI)
Сбер
3 дня назад
Senior ML Engineer (Команда проактивного профиля B2C)
300 000 - 500 000₽