Назад
3 часа назад

Руководитель аналитики приёмки моделей в команду Alice AI (LLM)

Формат работы
remote (только Russia)/hybrid/onsite
Тип работы
fulltime
Грейд
head
Страна
Russia/Belarus

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Руководитель аналитики приёмки моделей в команду Alice AI (LLM): Руководство приёмкой новых версий моделей, развитием системы метрик и инструментов оценки качества с акцентом на статистическую значимость, покрытие сценариев и сопоставление офлайн-оценок с онлайн-метриками. Фокус на создании LLM-as-a-judge, сравнении моделей с продовой версией и управлении командой аналитиков.

Локация: гибридный формат, удалённая работа или офис.

Компания

Yandex развивает ассистента Алису и ключевую LLM-технологию, повышая качество, полезность и надёжность моделей.

Что делать

  • Полностью вести приёмку новых версий моделей: определять необходимые замеры, запускать оценки, объединять результаты и готовить заключения о качестве.
  • Развивать систему метрик, объединять независимые оценки, рассчитывать статистическую значимость и отделять реальные изменения от случайного шума.
  • Формировать оценочные наборы, контролировать покрытие сценариев, управлять версиями данных и обеспечивать воспроизводимость замеров.
  • Развивать инструменты оценки, включая автоматических оценщиков на базе LLM и гибридные методы.
  • Сравнивать новые модели с текущей продовой версией и сопоставлять офлайн-оценки с онлайн-метриками поведения пользователей.
  • Собрать и управлять командой аналитиков приёмки, распределять направления, наставлять специалистов и согласовывать единый процесс между командами.

Требования

  • От 3 лет опыта.
  • Опыт управления командой аналитиков не менее 2 лет.
  • Знание математической статистики и теории вероятностей.
  • Умение писать код на Python и знание алгоритмов.
  • Умение формулировать и защищать обоснованные заключения перед заказчиками в условиях неполных данных.
  • Интерес к развитию LLM и готовность глубоко погружаться в тему.

Хорошо, если есть

  • Опыт работы с NLP, краудсорсинговыми разметками и ML.
  • Опыт построения процессов оценки качества LLM, включая голденсеты, LLM-as-a-judge и контроль качества разметчиков.
  • Опыт оценки агентских сценариев и мультимодальных моделей.
  • Опыт работы на стыке офлайн-оценки и онлайн-экспериментов.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →