Эта вакансия в архиве
Посмотреть похожие вакансии ↓Описание вакансии
Текст:
TL;DR
Аналитик-разработчик для оценки качества моделей в Алису (AI): Оценка внутренних и внешних больших языковых моделей на подготовленных наборах запросов с акцентом на поддержку инструментов, анализ данных и логов, а также воспроизведение и устранение сбоев. Focus on автоматизация процессов оценки, исследование поведения новых моделей, создание понятных баг-репортов и повышение предсказуемости запусков.
Локация: удалённая работа, офис или гибридный формат
Компания
Yandex развивает внутренние модели Алисы и инструменты для оценки качества больших языковых моделей.
Что делать
- Прокачивать наборы запросов через внутренние инструменты для оценки внутренних и внешних моделей.
- Настраивать и запускать инструменты оценки моделей, находить причины сбоев и устранять препятствия в работе.
- Развивать надстройки над инфраструктурой прокачки, чтобы аналитики могли самостоятельно проводить оценки.
- Исследовать поведение новых моделей, данные и непривычные форматы логов.
- Выявлять повторяющиеся ошибки, оформлять баг-репорты и предлагать улучшения инструментов и процесса оценки.
Требования
- От 3 лет опыта.
- Готовность быстро разбираться в незнакомых инструментах, данных и логах.
- Умение самостоятельно запускать и поддерживать технические процессы.
- Умение ясно описывать, воспроизводить и объяснять проблемы коллегам.
Хорошо, если есть
- Опыт работы с инструментами оценки моделей или качеством ответов AI-систем.
- Знакомство с v1, chat/completions и LLM-as-a-Judge.
- Опыт автоматизации процессов и поддержки внутренних инструментов для работы с данными.
Культура и преимущества
- Доступны удалённый, офисный и гибридный форматы работы.
- Задачи связаны с внутренними и внешними моделями, данными, логами и инструментами оценки.