3 часа назад
Руководитель аналитики приёмки моделей в команду Alice AI (LLM)
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Руководитель аналитики приёмки моделей в команду Alice AI (LLM): Руководство приёмкой новых версий моделей, развитием системы метрик и инструментов оценки качества с акцентом на статистическую значимость, покрытие сценариев и сопоставление офлайн-оценок с онлайн-метриками. Фокус на создании LLM-as-a-judge, сравнении моделей с продовой версией и управлении командой аналитиков.
Локация: гибридный формат, удалённая работа или офис.
Компания
Yandex развивает ассистента Алису и ключевую LLM-технологию, повышая качество, полезность и надёжность моделей.
Что делать
- Полностью вести приёмку новых версий моделей: определять необходимые замеры, запускать оценки, объединять результаты и готовить заключения о качестве.
- Развивать систему метрик, объединять независимые оценки, рассчитывать статистическую значимость и отделять реальные изменения от случайного шума.
- Формировать оценочные наборы, контролировать покрытие сценариев, управлять версиями данных и обеспечивать воспроизводимость замеров.
- Развивать инструменты оценки, включая автоматических оценщиков на базе LLM и гибридные методы.
- Сравнивать новые модели с текущей продовой версией и сопоставлять офлайн-оценки с онлайн-метриками поведения пользователей.
- Собрать и управлять командой аналитиков приёмки, распределять направления, наставлять специалистов и согласовывать единый процесс между командами.
Требования
- От 3 лет опыта.
- Опыт управления командой аналитиков не менее 2 лет.
- Знание математической статистики и теории вероятностей.
- Умение писать код на Python и знание алгоритмов.
- Умение формулировать и защищать обоснованные заключения перед заказчиками в условиях неполных данных.
- Интерес к развитию LLM и готовность глубоко погружаться в тему.
Хорошо, если есть
- Опыт работы с NLP, краудсорсинговыми разметками и ML.
- Опыт построения процессов оценки качества LLM, включая голденсеты, LLM-as-a-judge и контроль качества разметчиков.
- Опыт оценки агентских сценариев и мультимодальных моделей.
- Опыт работы на стыке офлайн-оценки и онлайн-экспериментов.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Похожие вакансии
Т-Банк
4 дня назад
Продуктовый аналитик
VK
4 дня назад
Продуктовый аналитик в ОК, Москва
VK
4 дня назад
Старший продуктовый аналитик (AI)
ИНВИТРО
12 часов назад
Старший продуктовый аналитик цифровых витрин (MedTech)
Qnits
6 дней назад
Team Lead BI и аналитики
250 000 - 280 000₽
Островок
3 дня назад