Назад

Не получаете ответ?

Вакансия опубликована 7 дн. назад - шансы на ответ снижаются.

8 дней назад

Data Scientist / ML Engineer в NLP-направление ML-команды (NLP)

Формат работы
remote (Global)
Тип работы
fulltime
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Data Scientist / ML Engineer в NLP-направление ML-команды (LLM/NLP): разработка и внедрение решений на базе LLM, NLP- и мультимодальных моделей с акцентом на оценку качества, многоязычные данные и оптимизацию inference. Focus on построении validation datasets, error analysis, prompt engineering, production ML-пайплайнов и мониторинге деградаций моделей.

Локация: удалённо из любой точки мира; компания нанимает специалистов, которые уже переехали из России

Компания

ML-команда, развивающая решения на базе LLM, NLP- и мультимодальных моделей.

Что делать

  • Разрабатывать и улучшать решения на базе LLM, NLP- и VLM-моделей для классификации, скоринга, extraction и анализа текстовых данных.
  • Создавать пайплайны обработки больших объёмов неструктурированных данных, включая тексты, web-контент, OCR и результаты анализа изображений.
  • Формировать validation и evaluation datasets, разрабатывать метрики, пороги, error analysis и post-hoc проверки для оценки качества LLM.
  • Работать с prompt engineering и системными промптами, снижая количество false positive и false negative срабатываний.
  • Оптимизировать inference с помощью batching, quantization и эффективного использования GPU-ресурсов.
  • Интегрировать модели в production-пайплайны, поддерживать их качество и переводить успешные исследования в стабильные решения.

Требования

  • Хорошее знание Python и уверенное знание SQL.
  • Практический опыт работы с LLM, NLP, VLM и мультимодальными моделями; понимание Transformer-моделей.
  • Опыт работы с open-source LLM, включая Qwen, Llama, Mistral или аналоги, а также Hugging Face и Transformers.
  • Опыт построения validation datasets, проведения error analysis и оценки LLM-систем с использованием метрик помимо accuracy.
  • Опыт работы с Airflow, production ML/data pipelines, ClickHouse и S3-совместимыми хранилищами.
  • Умение самостоятельно проводить исследования и превращать исследовательский код в воспроизводимое production-решение; знание Git и Linux.

Хорошо, если есть

  • Опыт работы с vLLM, quantization 4-bit/8-bit, PyTorch, embedding-моделями и RAG.
  • Опыт построения LLM evaluation framework, работы с multilingual NLP и fine-tuning через LoRA/PEFT.
  • Опыт работы с OCR, Docker, Slurm и GPU-инфраструктурой.

Культура и преимущества

  • Полностью удалённый формат из любой точки мира.
  • К участию допускаются специалисты, уже переехавшие из России.
  • Работа с современными LLM, мультимодальными моделями и большими объёмами данных.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →