Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
ML-аналитик (AI): Создание и развитие системы оценки качества AI-продукта «Моя Память» с акцентом на метрики, eval-наборы, анализ ошибок моделей и мониторинги. Focus on проектирование A/B-экспериментов, проверку LLM-as-a-judge, поиск проблем в пользовательских диалогах и подготовку данных для улучшения моделей.
Локация: Москва; доступны гибридный, удалённый и офисный форматы
Компания
Yandex развивает Алису и AI-продукт «Моя Память» — контекстный слой для хранения, поиска и использования пользовательских заметок, дел, списков, планов и файлов.
Что делать
- Создавать систему оценки качества AI-продукта: определять метрики для роутинга, поиска контекста, вызова инструментов, генерации ответа и доставки результата.
- Проектировать офлайн-оценки, мониторинги и дашборды, связывая качество моделей с поведением продукта в реальном пользовательском потоке.
- Проводить приёмку новых моделей, собирать eval-наборы, сравнивать версии, разбирать регрессии и проверять согласованность LLM-as-a-judge с человеческой оценкой.
- Анализировать пользовательские сценарии, текстовые логи, false positive и false negative, DSAT и проблемные диалоги; кластеризовать ошибки и искать точки роста.
- Формировать датасеты для обучения, валидации и приёмки, контролировать покрытие и смещения данных, оценивать качество разметки.
- Проектировать и анализировать A/B-эксперименты, интерпретировать продуктовые и качественные метрики и оценивать эффект изменений на реальных пользователях.
Требования
- От 3 лет опыта.
- Уверенное владение SQL и Python; способность самостоятельно проводить исследования от сырых данных до выводов.
- Опыт работы с большими объёмами событийных данных и текстовыми логами.
- Знание математической статистики и A/B-тестирования.
- Умение проектировать и валидировать метрики, находить причины за агрегатами и проверять гипотезы на данных.
- Понимание базовых принципов работы ML-моделей и готовность разбираться в сложных LLM-системах; способность ясно обсуждать выводы с разработчиками, инженерами, редакторами и менеджерами.
Хорошо, если есть
- Опыт работы с LLM-продуктами, NLP или голосовыми ассистентами.
- Опыт построения evals, LLM-as-a-judge или систем автоматической оценки моделей.
- Опыт оценки качества ранжирования, поиска или классификации.
- Навыки подготовки обучающих и приёмочных датасетов, аналитических дашбордов и мониторингов.
- Знание retrieval, RAG, tool calling, агентных систем и методов работы с неструктурированными данными.
Культура и преимущества
- Работа над продуктом Алисы, которым пользуются миллионы людей.
- Взаимодействие с ML-разработчиками, продуктовой командой, инженерами и редакторами.
- Возможность влиять на качество LLM-сценариев от офлайн-оценки до пользовательского результата.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →