Вакансия из Telegram канала - Название доступно после авторизации
Пожаловаться
Зарплата и рынок
ЗП не указана
На похожих ролях по рынку
$5.3к$5.7кмедиана$7.1к
15 в выборке
На международном рынке: $205к/год ($175к - $249к)
84
Хорошая вакансия
развернуть
Здесь редкие по глубине задачи с LLM-инфраструктурой и понятные бонусы, но без зарплатной вилки и названия компании сложнее оценить условия и надежность предложения.
Кликните для подробной информации
Зарплата скрытаПередовой стекПерспективная сфераХорошие бонусыПонятная роль
Оценка от Hirify AI
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Создать профиль и узнать мэтч
Описание вакансии
TL;DR
Lead ML Engineer (LLM Inference & Architecture) (LLM/GenAI): Ускорение и масштабирование инференса гигантских языковых моделей в продакшене с акцентом на SGLang, KV-cache, speculative decoding, квантизацию и распределённые multi-node/multi-GPU кластеры. Фокус на постобучении моделей компаньонов, развитии агентных архитектур, профилировании GPU и техническом лидерстве команды NLP/CV.
🔥 Lead ML Engineer (LLM Inference & Architecture) Формат: B2B, Remote (приоритет — CET ±2 часа) Занятость: Full-time Вилка: обсуждается по итогам тех. Интервью
Ищем Lead ML Engineer, который возглавит техническое направление наших языковых моделей и возьмет на себя производительность LLM в продакшене.
Мы делаем персонализированных, эмоционально сложных AI-компаньонов (Her-style AI) с подлинной агентностью: памятью, самоизменением и эмоциональной гибкостью. Работаем с открытым сорсом (open-weights/data), развиваем собственные агентные архитектуры и обслуживаем десятки миллионов диалогов.
📌 Что предстоит делать (70% Hands-on / 30% Tech Leadership):
• Ускорять и масштабировать LLM в проде: оптимизация инференса очень больших моделей (до 1T+ параметров), SGLang, KV/prefix caching, speculative decoding, квантизация.
• Разворачивать распределенный инференс: MoE, tensor/expert/pipeline parallelism на multi-node / multi-GPU кластерах (32x H200 + AWS).
• Заниматься Post-Training: обучать и дообучать модели компаньонов (SFT, DPO/RLHF), улучшать агентные каркасы и алгоритмы чата.
• Осуществлять техлидство (без бюрократии и PM): ревью экспериментов команды NLP/CV (7 инженеров), выбор направлений и оценка гипотез.
🎯 Чего мы ждем: • Глубокий опыт оптимизации LLM в проде (SGLang, vLLM или TensorRT-LLM).
• Опыт распределенного инференса/обучения гигантских моделей (MoE, multi-node clusters). • Понимание профилирования GPU, работы attention-кернелов и KV-cache.
• Практика дообучения моделей (RLHF, DPO или аналоги).
• Сильный бэкграунд на PyTorch / Transformers.
• Английский или русский язык на профессиональном уровне.
➕ Будет плюсом: • Опыт разработки CUDA / Triton кернелов.
• Бэкграунд в CV (если есть опыт ускорения инференса гигантских GenAI моделей).
• Опыт работы в AI-стартапах (, Replika, OpenAI и др.) или BigTech (Яндекс, Сбер, T-Bank, Nebius, Meta, Mistral).
• Профильное математическое / CS образование (МГУ, МФТИ, ВШЭ, Бауманка или топовые зарубежные вузы).
🎁 Что предлагаем:
• Полный Remote и максимум свободы без корпоративного gatekeeping.
• Скорость: идеи становятся live-экспериментами за дни, а не quarters.
• 28 дней отпуска + 7 wellness-дней в год без больничных листов.
• $1,000 на обустройство хоум-офиса раз в 3 года.
• Софинансирование обучения, конференций (50%) и медицинских расходов (до $1,000/год).
• Доступ к опциональной A-team программе (опционы / % от выручки) после 1 года работы.
📥 Контакты для отклика:Показать контакты
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Текст вакансии взят без изменений
Источник - Telegram канал. Название доступно после авторизации