обновлено 4 дня назад
Team Lead в команду ML-инфраструктуры R&D (LLM и VLM)
RUВакансия из Hirify RU, списка российских tech-компаний
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Team Lead в команду ML-инфраструктуры R&D (LLM и VLM): Развитие инфраструктуры для обучения и дообучения больших языковых и визуально-языковых моделей с акцентом на оптимизацию RL-обучения, диагностику и отказоустойчивость. Focus on распределённые вычисления, эффективное использование GPU-ресурсов, коммуникации между компонентами и внедрение новых решений.
Компания
Развитие ML-инфраструктуры для обучения и дообучения больших языковых и визуально-языковых моделей, используемых в сервисах Yandex.
Что делать
- Оптимизировать инфраструктуру обучения с подкреплением: доставку и сохранение данных, коммуникации между блоками и внутреннюю эффективность компонентов.
- Создавать и развивать инструменты диагностики для быстрого поиска и устранения инфраструктурных проблем.
- Реализовывать подходы к повышению отказоустойчивости инфраструктуры обучения.
- Исследовать современные решения для инфраструктуры RL-обучения, оценивать их эффективность и внедрять в проекты.
- Работать с системами, включающими десятки тысяч серверов, GPU, сети, шины данных, диски и память.
Требования
- От 3 лет опыта.
- Знание Python и опыт системного программирования, разработки библиотек или фреймворков.
- Опыт работы с PyTorch и распределённым обучением через torch.distributed.
- Понимание Data Parallelism, Tensor Parallelism, Pipeline Parallelism и Expert Parallelism.
- Интерес к LLM и MLOps, понимание задач эксплуатации больших моделей в продакшене.
- Умение работать в команде и делиться знаниями.
Хорошо, если есть
- Опыт создания инфраструктуры обучения ML-моделей и оптимизации RL-решений.
- Опыт работы с veRL, slime, NeMo-RL, SkyRL, vLLM, SGLang или TRT-LLM.
- Знание архитектуры GPU NVIDIA и опыт оптимизации алгоритмов с использованием CUDA или Triton.
- Знание C++ и опыт низкоуровневого программирования и оптимизации.
Культура и преимущества
- Работа на стыке ML-математики и аппаратной инфраструктуры.
- Возможность развивать решения для обучения моделей, применяемых в Алисе, Поиске, Рекламе и других сервисах Yandex.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Похожие вакансии
Яндекс
11 дней назад
Инженер по производительности GPU (AI)
Aston
6 дней назад
MLOps Engineer/Лидер команды (ИТ-лидер команды)
NDA
4 дня назад
Старший ML-инженер
300 000₽
Сбер
5 дней назад
Инженер по внедрению ИИ
300 000 - 550 000₽
СОГАЗ
5 дней назад
MLOps-инженер (AI)
Контур
6 дней назад