Назад

Junior+ / Middle- AI Engineer (On-Premise LLM)

100 000 - 200 000
Формат работы
remote (только Russia)
Тип работы
fulltime
Грейд
junior/middle
Страна
Russia
hhВакансия с HeadHunter. Контакт ведёт на hh.ru

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Инженер по AI (On-Premise LLM): Разработка и внедрение локального инференса открытых LLM, RAG-систем и интеграций с облачными API для коробочного enterprise-продукта с акцентом на изолированные air-gapped-развертывания, квантование и производительность. Focus on самостоятельном чтении исследований, тестировании гипотез, бенчмаркинге моделей и доведении AI-сервисов до стабильной работы в продакшене.

Локация: Удалённая работа; регион — Самара, Россия

Зарплата: 100 000–200 000 ₽ на руки в месяц

Компания

Компания развивает Business Studio — тиражируемую систему бизнес-моделирования для enterprise-клиентов и внедряет в продукт генеративный AI.

Что делать

  • Поднимать и оптимизировать открытые модели Qwen, DeepSeek, Llama и другие для on-premise-инференса через vLLM, llama.cpp, Ollama и TensorRT-LLM.
  • Выполнять квантование весов в форматах GGUF, AWQ и GPTQ, измерять скорость генерации и деградацию качества.
  • Развёртывать локальный RAG с self-hosted векторными базами Qdrant и pgvector, эмбеддингами и реранкерами.
  • Разрабатывать модульные коннекторы к API YandexGPT и GigaChat в рамках единого интерфейса продукта.
  • Контейнеризировать AI-сервисы в Docker для установки на клиентских серверах без доступа к интернету.

Требования

  • Оконченное высшее техническое образование в области прикладной математики, информатики, программной инженерии или Computer Science.
  • Красный диплом или подтверждённый средний балл GPA от 4.8.
  • Уверенный Python: структуры данных, Big O, чистый код и AsyncIO.
  • Понимание основ deep learning и математики трансформеров: self-attention, токенизация, контекстное окно, квантование и функции потерь.
  • Уверенная работа в Linux CLI, Docker и понимание архитектуры оборудования: RAM, VRAM и пропускная способность PCIe.
  • Способность самостоятельно разворачивать фреймворки и решения по техническому заданию, измерять метрики и интегрировать результат.

Хорошо, если есть

  • Работающие pet-проекты на GitHub с RAG, парсерами, ботами или инференсом моделей.
  • Базовое понимание C/C++ для отладки низкоуровневых компонентов, например llama.cpp.
  • Участие в олимпиадах по программированию, хакатонах или Kaggle.

Культура и преимущества

  • Чёткие технические задачи и требования к результату от системных архитекторов.
  • Доступ к серверам и GPU-мощностям для тестирования и бенчмаркинга.
  • Возможность напрямую влиять на ключевую AI-функцию продукта.
  • Гибкий график и прозрачный пересмотр дохода после внедрения работающих решений.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →