Назад

Не получаете ответ?

Вакансия опубликована 27 дн. назад - шансы на ответ снижаются.

27 дней назад

Разработчик Inference Server На C++ В Отдел ML-Инфраструктуры (AI)

Формат работы
hybrid
Тип работы
fulltime
Грейд
senior
Страна
Russia/Belarus

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Разработчик Inference Server на C++ в отдел ML-инфраструктуры (AI): развитие сервисов для высокопроизводительного инференса нейронных моделей и их запуска в продакшне с акцентом на масштабирование, кеширование и эффективное использование CPU/GPU. Фокус на создании динамической балансировки, многоуровневого кеширования, облачных инструментов развёртывания и поддержке высоких нагрузок до сотен тысяч RPS.

Локация: гибридный формат с офисами в Москве и Минске; большая часть команды работает из офиса в Москве.

Компания

Yandex развивает крупные технологические продукты и внутреннюю ML-инфраструктуру для эксплуатации нейронных моделей и рекламных сервисов.

Что делать

  • Развивать коробочное решение для инференса нейронных моделей.
  • Реализовывать динамическую балансировку, многоуровневое in-memory, disk и remote-кеширование, а также динамические конфигурации.
  • Развивать инструменты развёртывания инференс-сервисов в облаке и поддерживать новые ML-инсталляции.
  • Взаимодействовать как минимум с 20 командами, эксплуатирующими ML-модели, и реализовывать необходимые им функции и backend-ы.
  • Анализировать Triton Inference Server, KServe, Seldon Core и Kubeflow, отслеживать тренды инференса и готовить инфраструктуру для новых типов и размеров моделей.

Требования

  • Опыт программирования от двух лет.
  • Уверенное владение C++ или готовность быстро его освоить.
  • Знание concurrency в C++ или Linux.
  • Готовность работать над высоконагруженными сервисами инференса и взаимодействовать с внутренними заказчиками.

Хорошо, если есть

  • Опыт разработки высоконагруженных сервисов на C++.
  • Опыт развёртывания и эксплуатации ML Inference-сервисов на CPU/GPU.
  • Знание Triton и TRT-LLM.
  • Понимание устройства нейронных моделей и интерес к новым разработкам в этой области.
  • Знание Unix/Linux, включая процессы, файловую систему и системные вызовы.

Культура и преимущества

  • Команда из 10 специалистов, масштабируемая для реализации амбициозных инфраструктурных задач.
  • Работа над сервисами с нагрузкой в сотни тысяч RPS, сотнями тысяч ядер и сотнями GPU.
  • Возможность влиять на ML-инфраструктуру и рекламные сервисы компании.
  • Совместные технологические обсуждения, поездки в кампусы и командные активности.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →