Назад
обновлено 3 дня назад

ML Engineer в команду Disrupt (LLM)

300 000₽
Формат работы
onsite
Тип работы
fulltime
Грейд
middle
Страна
Russia
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
ML Engineer в команду Disrupt (LLM): Запуск и ускорение больших языковых моделей в продакшене на NVIDIA GPU с акцентом на распределённый инференс, производительность и эффективное использование памяти и сети. Focus on оптимизации vLLM, SGLang и TensorRT-LLM, квантизации, работы с MoE-моделями, масштабирования Kubernetes-сервисов и мониторинга задержек и стоимости вывода.

Локация: офис рядом с м. Кутузовская, Москва

Зарплата: от 300 000 ₽ в месяц на руки

Компания

Команда Disrupt в Сбере входит в блок ГенИИ и запускает новые продукты и сценарии на основе генеративного искусственного интеллекта.

Что делать

  • Запускать и поддерживать распределённый инференс LLM на GPU-кластере NVIDIA.
  • Настраивать vLLM, SGLang, TensorRT-LLM и аналогичные движки для повышения скорости и утилизации оборудования.
  • Снижать задержки, увеличивать пропускную способность и оптимизировать работу с длинным контекстом и MoE-моделями.
  • Применять FP8/INT8-квантизацию, speculative decoding и другие методы оптимизации без потери качества.
  • Разворачивать сервисы в Kubernetes и Docker, настраивать автоскейлинг, выкаты и откаты.
  • Строить мониторинг, проводить нагрузочное тестирование и планировать мощности.

Требования

  • От двух лет опыта в ML Engineering, MLOps или высоконагруженном бэкенде; минимум один собственный GPU-сервис должен быть доведён до продакшена.
  • Уверенное владение Python и Linux, знание Docker, Git, CI/CD и базовый опыт работы с Kubernetes.
  • Практический опыт запуска моделей на PyTorch под NVIDIA GPU.
  • Опыт работы хотя бы с одним production-стеком инференса: vLLM, Triton, TensorRT-LLM, SGLang, TGI или аналогами.
  • Понимание памяти GPU, mixed precision, батчинга, KV-кэша, параллелизма моделей и распределённых систем.
  • Навыки профилирования производительности с PyTorch Profiler, Nsight или DCGM, а также поиска баланса между скоростью, качеством и стоимостью вывода.

Хорошо, если есть

  • Навыки написания CUDA/Triton kernels, работы с NCCL, NVLink, InfiniBand, GPUDirect или RDMA.
  • Опыт запуска MoE-моделей с экспертным параллелизмом и очень длинным контекстом.
  • Знакомство с KServe, Ray Serve, Prometheus, Grafana, GPU Operator или DCGM Exporter.
  • Опыт конвертации весов, quantization-aware evaluation и сравнения движков инференса.
  • Базовое владение C++ или Go для разработки быстрых компонентов control/data plane.

Культура и преимущества

  • Современный офис и корпоративный спортзал с зонами отдыха.
  • Ежегодный пересмотр зарплаты и годовая премия.
  • Расширенный полис ДМС с первого дня работы и страхование для семьи.
  • Система обучения для профессионального и карьерного развития.
  • Льготная ипотечная программа, подписка СберПрайм+ и скидки компаний-партнёров.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →