Назад
4 дня назад

Lead ML Engineer (LLM Inference & Architecture)

Формат работы
remote (Global)
Тип работы
fulltime
Грейд
lead
Английский
b2
Страна
Russia
vacancy_detail.hirify_telegram_tooltipВакансия из Telegram канала -

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

TL;DR
Lead ML Engineer (LLM Inference & Architecture) (LLM/GenAI): Ускорение и масштабирование инференса гигантских языковых моделей в продакшене с акцентом на SGLang, KV-cache, speculative decoding, квантизацию и распределённые multi-node/multi-GPU кластеры. Фокус на постобучении моделей компаньонов, развитии агентных архитектур, профилировании GPU и техническом лидерстве команды NLP/CV.
#вакансия #job #ML #Lead #LeadML #LLM #GenerativeAI #GenAI #AI


🔥 Lead ML Engineer (LLM Inference & Architecture)
Формат: B2B, Remote (приоритет — CET ±2 часа)
Занятость: Full-time
Вилка: обсуждается по итогам тех. Интервью

Ищем Lead ML Engineer, который возглавит техническое направление наших языковых моделей и возьмет на себя производительность LLM в продакшене.
Мы делаем персонализированных, эмоционально сложных AI-компаньонов (Her-style AI) с подлинной агентностью: памятью, самоизменением и эмоциональной гибкостью. Работаем с открытым сорсом (open-weights/data), развиваем собственные агентные архитектуры и обслуживаем десятки миллионов диалогов.

📌 Что предстоит делать (70% Hands-on / 30% Tech Leadership):
• Ускорять и масштабировать LLM в проде: оптимизация инференса очень больших моделей (до 1T+ параметров), SGLang, KV/prefix caching, speculative decoding, квантизация.
• Разворачивать распределенный инференс: MoE, tensor/expert/pipeline parallelism на multi-node / multi-GPU кластерах (32x H200 + AWS).
• Заниматься Post-Training: обучать и дообучать модели компаньонов (SFT, DPO/RLHF), улучшать агентные каркасы и алгоритмы чата.
• Осуществлять техлидство (без бюрократии и PM): ревью экспериментов команды NLP/CV (7 инженеров), выбор направлений и оценка гипотез.

🎯 Чего мы ждем: • Глубокий опыт оптимизации LLM в проде (SGLang, vLLM или TensorRT-LLM).
• Опыт распределенного инференса/обучения гигантских моделей (MoE, multi-node clusters). • Понимание профилирования GPU, работы attention-кернелов и KV-cache.
• Практика дообучения моделей (RLHF, DPO или аналоги).
• Сильный бэкграунд на PyTorch / Transformers.
• Английский или русский язык на профессиональном уровне.

➕ Будет плюсом: • Опыт разработки CUDA / Triton кернелов.
• Бэкграунд в CV (если есть опыт ускорения инференса гигантских GenAI моделей).
• Опыт работы в AI-стартапах (, Replika, OpenAI и др.) или BigTech (Яндекс, Сбер, T-Bank, Nebius, Meta, Mistral).
• Профильное математическое / CS образование (МГУ, МФТИ, ВШЭ, Бауманка или топовые зарубежные вузы).

🎁 Что предлагаем:
• Полный Remote и максимум свободы без корпоративного gatekeeping.
• Скорость: идеи становятся live-экспериментами за дни, а не quarters.
• 28 дней отпуска + 7 wellness-дней в год без больничных листов.
• $1,000 на обустройство хоум-офиса раз в 3 года.
• Софинансирование обучения, конференций (50%) и медицинских расходов (до $1,000/год).
• Доступ к опциональной A-team программе (опционы / % от выручки) после 1 года работы.

📥 Контакты для отклика:

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →

Текст вакансии взят без изменений

Источник -