Назад
обновлено 4 дня назад

Team Lead в команду ML-инфраструктуры R&D (LLM и VLM)

Тип работы
fulltime
Грейд
lead
Страна
Russia/Belarus
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Team Lead в команду ML-инфраструктуры R&D (LLM и VLM): Развитие инфраструктуры для обучения и дообучения больших языковых и визуально-языковых моделей с акцентом на оптимизацию RL-обучения, диагностику и отказоустойчивость. Focus on распределённые вычисления, эффективное использование GPU-ресурсов, коммуникации между компонентами и внедрение новых решений.

Компания

Развитие ML-инфраструктуры для обучения и дообучения больших языковых и визуально-языковых моделей, используемых в сервисах Yandex.

Что делать

  • Оптимизировать инфраструктуру обучения с подкреплением: доставку и сохранение данных, коммуникации между блоками и внутреннюю эффективность компонентов.
  • Создавать и развивать инструменты диагностики для быстрого поиска и устранения инфраструктурных проблем.
  • Реализовывать подходы к повышению отказоустойчивости инфраструктуры обучения.
  • Исследовать современные решения для инфраструктуры RL-обучения, оценивать их эффективность и внедрять в проекты.
  • Работать с системами, включающими десятки тысяч серверов, GPU, сети, шины данных, диски и память.

Требования

  • От 3 лет опыта.
  • Знание Python и опыт системного программирования, разработки библиотек или фреймворков.
  • Опыт работы с PyTorch и распределённым обучением через torch.distributed.
  • Понимание Data Parallelism, Tensor Parallelism, Pipeline Parallelism и Expert Parallelism.
  • Интерес к LLM и MLOps, понимание задач эксплуатации больших моделей в продакшене.
  • Умение работать в команде и делиться знаниями.

Хорошо, если есть

  • Опыт создания инфраструктуры обучения ML-моделей и оптимизации RL-решений.
  • Опыт работы с veRL, slime, NeMo-RL, SkyRL, vLLM, SGLang или TRT-LLM.
  • Знание архитектуры GPU NVIDIA и опыт оптимизации алгоритмов с использованием CUDA или Triton.
  • Знание C++ и опыт низкоуровневого программирования и оптимизации.

Культура и преимущества

  • Работа на стыке ML-математики и аппаратной инфраструктуры.
  • Возможность развивать решения для обучения моделей, применяемых в Алисе, Поиске, Рекламе и других сервисах Yandex.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →