Назад

Не получаете ответ?

Вакансия опубликована 11 дн. назад - шансы на ответ снижаются.

обновлено 11 дней назад

GPU Performance Engineer (AI)

Формат работы
remote (только Russia)/hybrid/onsite
Тип работы
fulltime
Грейд
senior
Страна
Russia/Belarus
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
GPU Performance Engineer (AI): Повышение эффективности использования GPU-инфраструктуры Яндекса и оптимизация вычислений для обучения и инференса с акцентом на профилирование, CUDA, распределённое обучение и масштабируемость. Focus on выявлении узких мест, разработке диагностических инструментов, построении бенчмарков и внедрении решений для высоконагруженных ML-систем.

Локация: гибридный формат, удалённая работа или офис

Компания

Яндекс развивает ключевые AI-продукты и инфраструктуру, использующую GPU для Поиска, Рекламы, Алисы, Такси, Музыки и других сервисов.

Что делать

  • Исследовать и внедрять решения для повышения эффективности утилизации GPU в 150+ продуктах.
  • Находить и устранять узкие места в доступе к памяти, работе ядер, latency и throughput с помощью профилировщиков.
  • Создавать инструменты диагностики инфраструктурных проблем для обучения и инференса.
  • Изучать современные подходы к инфраструктуре ML, оценивать их эффективность и внедрять в реальные проекты.
  • Разрабатывать планы тестирования и бенчмарки, анализировать регрессии производительности и оценивать аппаратные решения.
  • Взаимодействовать с разработчиками, ML-инженерами и системными архитекторами, формируя рекомендации и лучшие практики.

Требования

  • От 5 лет опыта.
  • Знание Python и опыт системного программирования, разработки библиотек или фреймворков.
  • Опыт работы с PyTorch и распределённым обучением через torch.distributed.
  • Знание data parallelism, tensor parallelism, pipeline parallelism и expert parallelism.
  • Опыт работы с NVIDIA GPU и CUDA, понимание архитектуры GPU и использование Nsight, nvprof или аналогов.
  • Умение оптимизировать GPU-приложения, анализировать профили и метрики производительности.

Хорошо, если есть

  • Уверенное владение C/C++ или аналогичными низкоуровневыми языками.
  • Опыт работы с RL-библиотеками для LLM: veRL, slime, NeMo-RL, SkyRL и другими.
  • Опыт работы с библиотеками инференса vLLM, SGLang или TRTLLM.
  • Опыт оптимизации систем под production-нагрузки, low-latency или real-time-системы.

Культура и преимущества

  • Быстрое принятие решений и минимум бюрократии.
  • Возможность влиять на эффективность GPU-инфраструктуры ключевых продуктов.
  • Работа на стыке технической экспертизы и бизнес-ориентированных решений.
  • Обмен знаниями и взаимодействие с инженерными, ML- и архитектурными командами.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →