Назад
обновлено 2 дня назад

Senior MLOps/DevOps Engineer (LLM)

300 000 - 500 000₽
Формат работы
hybrid
Тип работы
fulltime
Грейд
senior
Страна
Russia
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Senior MLOps/DevOps Engineer (LLM) (LLM-инференс и Kubernetes): Разработка и оптимизация инфраструктуры инференса и SFT open-source LLM с акцентом на минимальную задержку, высокую пропускную способность и надежность LLM-serving. Focus on настройку sglang и vLLM, масштабирование сервисов, observability, управление доступами к API и вывод моделей в продакшен.

Локация: гибридный формат, 2–3 дня в офисе на Кутузовской в Москве

Зарплата: 300 000–500 000 ₽ в месяц на руки

Компания

Сбер развивает платформу для инференса и SFT open-source LLM с использованием производительных движков и инфраструктуры для высоких нагрузок.

Что делать

  • Разрабатывать и оптимизировать инфраструктуру инференса LLM-моделей для минимальной задержки и высокой пропускной способности.
  • Обеспечивать масштабируемость и надежность LLM-serving-инфраструктуры, настраивая sglang, vLLM и llama.cpp.
  • Разрабатывать механизмы разграничения доступов к API-сервисам моделей.
  • Строить observability и мониторинг LLM-инференса.
  • Собирать модели в сервисы и интерфейсы на базе FastAPI, Flask, Tornado, Streamlit и Chainlit.
  • Выводить решения в продуктивный контур и развивать CI/CD и оркестрацию моделей.

Требования

  • От 5 лет опыта в аналогичной роли.
  • Опыт работы с Linux: сетью, storage, ролями и пользователями, управлением процессами.
  • Уверенное владение Kubernetes и Istio Service Mesh.
  • Опыт построения высокопроизводительных LLM-сервисов с использованием sglang и vLLM.
  • Опыт настройки высоконагруженных прокси-серверов nginx, Envoy или HAProxy: балансировка, rate limiting, SSL termination и health checks.
  • Владение Bash, Python и Groovy, а также продвинутые навыки CI/CD и оркестрации моделей.

Хорошо, если есть

  • Понимание распределенных систем и GPU-коммуникации: NCCL, MPI, RDMA и InfiniBand.
  • Знание токенизаторов, KV-cache и контекстного окна в LLM-пайплайне.
  • Понимание архитектуры GPU, CUDA, cuDNN и Tensor Cores.
  • Опыт работы с векторными базами данных OpenSearch, Qdrant, FAISS или pgvector для RAG и других задач.

Культура и преимущества

  • Гибридный формат работы с посещением офиса 2–3 дня в неделю.
  • Годовой бонус и ежегодный пересмотр условий.
  • Расширенный ДМС с первого дня, стоматология и льготное страхование для семьи.
  • Доступ к корпоративному университету Сбера, внутренней образовательной платформе и IT-конференциям.
  • Офис на Кутузовской с зонами отдыха и спортзалом, а также льготная ипотека, корпоративная пенсионная программа и другие программы группы компаний.

Процесс найма

  • Первый этап — короткое первичное интервью с AI-рекрутером в Telegram.
  • Диалог занимает около 10 минут и помогает уточнить недостающие детали перед рассмотрением кандидатуры.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →