15 часов назад
Data Engineer (AI/LLM Data & Infrastructure)
180 000₽
hhВакансия с HeadHunter. Контакт ведёт на hh.ru
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Data Engineer (AI/LLM Data & Infrastructure) (Python/SQL, NLP): разработка и поддержка ETL-пайплайнов для сбора, очистки, дедупликации и подготовки корпусов данных для обучения языковых моделей с акцентом на парсинг документов, обработку больших объемов данных и качество обучающих датасетов. Focus on кастомизации токенизаторов для русского языка, автоматизации evaluation-пайплайнов и выводе data-пайплайнов NLP/LLM в production.
Локация: офис в Москве, метро Нагатинская или Верхние Котлы. График 5/2, с 9:00 до 18:00.
Зарплата: от 180 000 рублей на руки в месяц.
Компания
Актив-М развивает проекты в области данных и обучения AI/LLM-моделей.
Что делать
- Разрабатывать, тестировать и поддерживать ETL-пайплайны для сбора, очистки, дедупликации и фильтрации обучающих корпусов.
- Парсить разнородные документы и преобразовывать их в структурированные форматы для обучения языковых моделей.
- Анализировать большие объемы текстовых и структурированных данных, писать и оптимизировать скрипты на Python и SQL.
- Вести полный цикл поддержки данных: от исследования источников и прототипирования парсеров до production-эксплуатации и мониторинга качества.
- Исследовать и внедрять методы обработки данных для LLM, включая фильтрацию шумов, оптимизацию словарей и автоматизацию evaluation-пайплайнов.
Требования
- От 1 года до 3 лет опыта в data engineering.
- Глубокое понимание архитектуры данных, ETL/ELT-пайплайнов и жизненного цикла данных для обучения AI-моделей.
- Свободное владение Python и инструментами обработки данных: Polars, Pandas, PyArrow, Dask или Spark.
- Опыт веб-скрапинга и парсинга с использованием Scrapy, Playwright, BeautifulSoup и инструментов разбора документов.
- Знание NLP-инструментов Hugging Face Datasets, Tokenizers, NLTK и spaCy, а также принципов работы токенизаторов и архитектур LLM.
- Опыт разработки или кастомизации токенизаторов, работы с BPE, Unigram и SentencePiece, оптимизации словаря под русский язык и внедрения data-пайплайнов для NLP/LLM в production.
Хорошо, если есть
- Знание открытых и корпоративных источников данных.
- Опыт работы с лицензиями, авторскими правами и compliance при сборе обучающих корпусов.
Культура и преимущества
- Официальное оформление с первого рабочего дня.
- Полный социальный пакет.
- Компенсация питания.
- Фиксированный офисный график 5/2.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →