Назад
4 дня назад

Middle Data Scientist, NLP

365 000 - 365 000
Тип работы
fulltime
Грейд
middle
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Middle Data Scientist, NLP (LLM/RAG): Разработка NLP-решений для чат-бота поддержки, обработки звонков и других бизнес-задач с акцентом на RAG, трансформерные модели, STT/TTS и OCR с использованием LLM. Фокус на переходе от поддержки операторов к полной автоматизации, запуске моделей в production и оптимизации обработки запросов.

Компания

Ozon Банк развивает финансовые и IT-продукты и сервисы для физических и юридических лиц.

Что делать

  • Участвовать в NLP-проектах компании и решать задачи для чат-бота поддержки.
  • Разрабатывать решения для суммаризации, парафраза и RAG, сначала поддерживая операторов, а затем автоматизируя поддержку с помощью LLM.
  • Развивать STT- и TTS-направления для обработки телефонных звонков.
  • Создавать и запускать в production решения для работы с текстовыми данными.
  • Работать с RAG, чат-ботами, speech-to-text, OCR на базе LLM и кодогенерацией.

Требования

  • От 2 лет опыта в Data Science.
  • Уверенный Python и способность разбираться в чужом коде.
  • Понимание принципов, алгоритмов и метрик классического ML.
  • Опыт решения бизнес-задач с использованием классических и трансформерных NLP-моделей.
  • Понимание принципов работы LLM, ограничений моделей и выбора подходящей NLP-модели для разных задач.
  • Умение ясно излагать мысли и представлять результаты работы.

Хорошо, если есть

  • Навыки prompt engineering, Structured Outputs и function calling.
  • Опыт работы с агентскими фреймворками, например smolagents.
  • Опыт деплоя трансформерных моделей с использованием vLLM или SGLang.
  • Понимание обработки и ускорения запросов во фреймворках инференса.
  • Опыт работы с tritonserver и TensorRT-LLM.

Культура и преимущества

  • Работа в команде, отвечающей за NLP-задачи всей компании.
  • Возможность влиять на развитие решений и запускать прикладные и исследовательские проекты в production.
  • Модели напрямую влияют на доходность и итоговую прибыль компании.
  • Развитие вычислительных мощностей собственного ЦОД.
  • Стек включает Vertica, PostgreSQL, ClickHouse, Label Studio, PyTorch, Accelerate, tritonserver в Kubernetes, Qdrant, Elasticsearch и LangChain.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →