Назад
15 часов назад

Data Engineer (AI/LLM Data & Infrastructure)

180 000
Формат работы
onsite
Тип работы
fulltime
Грейд
middle
Страна
Russia
hhВакансия с HeadHunter. Контакт ведёт на hh.ru

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Data Engineer (AI/LLM Data & Infrastructure) (Python/SQL, NLP): разработка и поддержка ETL-пайплайнов для сбора, очистки, дедупликации и подготовки корпусов данных для обучения языковых моделей с акцентом на парсинг документов, обработку больших объемов данных и качество обучающих датасетов. Focus on кастомизации токенизаторов для русского языка, автоматизации evaluation-пайплайнов и выводе data-пайплайнов NLP/LLM в production.

Локация: офис в Москве, метро Нагатинская или Верхние Котлы. График 5/2, с 9:00 до 18:00.

Зарплата: от 180 000 рублей на руки в месяц.

Компания

Актив-М развивает проекты в области данных и обучения AI/LLM-моделей.

Что делать

  • Разрабатывать, тестировать и поддерживать ETL-пайплайны для сбора, очистки, дедупликации и фильтрации обучающих корпусов.
  • Парсить разнородные документы и преобразовывать их в структурированные форматы для обучения языковых моделей.
  • Анализировать большие объемы текстовых и структурированных данных, писать и оптимизировать скрипты на Python и SQL.
  • Вести полный цикл поддержки данных: от исследования источников и прототипирования парсеров до production-эксплуатации и мониторинга качества.
  • Исследовать и внедрять методы обработки данных для LLM, включая фильтрацию шумов, оптимизацию словарей и автоматизацию evaluation-пайплайнов.

Требования

  • От 1 года до 3 лет опыта в data engineering.
  • Глубокое понимание архитектуры данных, ETL/ELT-пайплайнов и жизненного цикла данных для обучения AI-моделей.
  • Свободное владение Python и инструментами обработки данных: Polars, Pandas, PyArrow, Dask или Spark.
  • Опыт веб-скрапинга и парсинга с использованием Scrapy, Playwright, BeautifulSoup и инструментов разбора документов.
  • Знание NLP-инструментов Hugging Face Datasets, Tokenizers, NLTK и spaCy, а также принципов работы токенизаторов и архитектур LLM.
  • Опыт разработки или кастомизации токенизаторов, работы с BPE, Unigram и SentencePiece, оптимизации словаря под русский язык и внедрения data-пайплайнов для NLP/LLM в production.

Хорошо, если есть

  • Знание открытых и корпоративных источников данных.
  • Опыт работы с лицензиями, авторскими правами и compliance при сборе обучающих корпусов.

Культура и преимущества

  • Официальное оформление с первого рабочего дня.
  • Полный социальный пакет.
  • Компенсация питания.
  • Фиксированный офисный график 5/2.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →