Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
TL;DR
NLP-разработчик (AI/RL): Строим автономного computer-use-агента для Алисы, который взаимодействует с компьютерными средами как человек, с акцентом на RL-обучение, GUI grounding и VLM-компоненты. Фокус на проектировании reward-функций, пайплайнах обучения на траекториях, оптимизации инференса и доведении R&D до продакшена на платформе для миллионов пользователей.
Локация: Москва
Компания
Команда ML-исследователей и инженеров внутри Алисы (Яндекс) со работающим прототипом, GPU-кластерами, симуляторами и пайплайнами обучения.
Что делать
- Проектировать и запускать RL-эксперименты: формулировать reward-функции, строить пайплайны обучения на многошаговых траекториях, data flywheel от сбора данных до улучшения модели.
- Обучать и файнтюнить большие модели (LLM, VLM), оптимизировать инференс для продакшена (FP8, дистилляция, параллелизм).
- Улучшать GUI grounding, визуальное понимание экрана и архитектуру агента (memory, planning, оркестрация тулов).
- Обеспечивать safety и truthfulness, доводить R&D до продакшена на платформе для миллионов пользователей.
Требования
- Глубокий опыт с DL и RL: GRPO, GSPO, DAPO, Dr.GRPO, reward design, фикс обучения.
- Обучение больших моделей: файнтюнинг LLM и VLM в реальных задачах.
- Исследовательское мышление: анализ статей, проверка гипотез.
- Работа с задачей от эксперимента до продакшена.
- Python, PyTorch.
- Локация: Москва
Хорошо, если есть
- Опыт с VLM: обучение, файнтюнинг, инференс.
- Multi-turn RL на траекториях с инструментами и средой.
- Публикации на NeurIPS, ICML, ICLR, ACL.
- Опыт с computer use, web agents, GUI grounding.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →