Назад
4 дня назад

ML-разработчик в команду алайнмента Alice AI

Формат работы
remote (только Russia)/hybrid/onsite
Тип работы
fulltime
Грейд
middle
Страна
Russia/Belarus

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
ML-разработчик в команду алайнмента Alice AI (ML/LLM): улучшение качества диалоговой модели после базового обучения с акцентом на RL-алгоритмы, интеграцию моделей и системные промпты. Фокус на проведении экспериментов, оценке поведения модели, reasoning, tool calling и переносе исследовательских решений в основной обучающий контур.

Локация: гибридный формат — удалённая работа или офис

Компания

Разработка и улучшение Alice AI — диалоговой модели, способной рассуждать, следовать инструкциям, искать информацию и пользоваться инструментами.

Что делать

  • Разрабатывать и исследовать RL-методы для обучения LLM, повышая качество и устойчивость обучения.
  • Работать с reward-сигналами, оценкой действий модели и регулированием обновлений.
  • Объединять результаты разных экспериментов в единую версию модели и собирать релизных кандидатов.
  • Развивать методы многостадийного обучения, включая единое обучение, последовательные стадии и On-Policy Distillation.
  • Проектировать системные промпты, методы обучения и оценку управляемости модели.
  • Формулировать гипотезы, проводить эксперименты, анализировать метрики и причины изменений качества.

Требования

  • От 3 лет опыта.
  • Хорошее знание классического ML и DL.
  • Понимание устройства современных LLM и методов их обучения.
  • Умение переводить исследовательскую задачу в проверяемую гипотезу, эксперимент и набор метрик.
  • Способность интерпретировать результаты и находить причины изменений качества моделей.
  • Интерес к моделям с reasoning и tool calling.

Хорошо, если есть

  • Опыт в online RL для LLM, многостадийном обучении, distillation, instruction following, reward modeling или оценке поведения языковых моделей.

Культура и преимущества

  • Возможность выбрать одно из трёх направлений с учётом опыта и интересов.
  • Непрерывный цикл постановки гипотез, экспериментов, оценки поведения модели и последующих итераций.
  • Работа с исследовательскими идеями и перенос работающих решений в основной обучающий контур.
  • Гибридный формат работы: удалённо или из офиса.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →