Назад
обновлено 2 дня назад

NLP Engineer (Reinforcement Learning)

300 000 - 500 000₽
Тип работы
fulltime
Грейд
middle/senior
Страна
Russia/Belarus
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
NLP Engineer (Reinforcement Learning) (LLM/online RL): Разработка и улучшение методов post-training и online RL для GigaChat с акцентом на эксперименты, reward-сигналы и надёжные пайплайны обучения. Focus on оптимизацию distributed training, воспроизводимость экспериментов, анализ ошибок моделей и масштабирование решений на разные домены и типы задач.

Компания

Развитие GigaChat и передовых решений для русскоязычных больших языковых моделей.

Что делать

  • Разрабатывать и улучшать методы online RL и post-training для LLM.
  • Проектировать, запускать и анализировать ML-эксперименты: от формулировки гипотез до оценки устойчивости и масштабируемости результатов.
  • Строить и поддерживать пайплайны online RL — от генерации rollout'ов и сбора reward-сигналов до обновления весов моделей.
  • Развивать инфраструктуру обучения, оптимизировать throughput и использование GPU с помощью distributed training, параллелизма и профилирования.
  • Проектировать reward-сигналы, верификаторы, reward-модели и execution-based проверки.
  • Взаимодействовать с исследователями, инженерными, data- и инфраструктурными командами, отвечая за решения от идеи до продакшена.

Требования

  • Отличное владение Python и PyTorch.
  • Практический опыт в LLM post-training, включая RLHF, online RL, DPO или смежные направления.
  • Опыт проведения ML-экспериментов полного цикла: постановка гипотезы, реализация, анализ и выводы.
  • Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналогов.
  • Умение писать чистый, надёжный и production-ready код, самостоятельно находить и устранять узкие места.

Хорошо, если есть

  • Опыт работы с reward-моделями, process reward models и LLM-as-a-judge.
  • Опыт создания сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
  • Опыт large-scale inference и оптимизации генерации с использованием vLLM, Sglang или аналогов.
  • Знание open-source стеков для обучения LLM, включая Verl, Megatron и TRL.
  • Публикации, open-source вклад или сильный прикладной track record.

Культура и преимущества

  • Сложные задачи на переднем крае развития русскоязычных LLM.
  • Прямое влияние результатов работы на бенчмарки и продукт.
  • Работа в команде инженеров и исследователей.
  • Возможность совмещать инженерную и исследовательскую работу.
  • Конкурентная компенсация, премии и расширенный социальный пакет.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →