20 часов назад
Data Engineer
hhВакансия с HeadHunter. Контакт ведёт на hh.ru
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Data Engineer: Разработка и оптимизация слоев данных (Raw, Clean, Enriched) с акцентом на моделирование данных, алгоритмы дедупликации и качество данных. Фокус на проектировании data pipelines, реализации алгоритмов fuzzy matching и автоматизации тестирования данных.
Компания
HeadHunter — крупная платформа для поиска работы и подбора персонала.
Что делать
- Проектирование и разработка слоев данных с использованием Data Vault 2.0, 3NF и Star Schema.
- Разработка и внедрение алгоритмов дедупликации и Entity Resolution на Python.
- Формализация бизнес-правил качества данных и настройка уровней доверия к источникам.
- Внедрение Data Contracts и механизмов карантина для некачественных данных.
- Настройка автоматизированного тестирования данных в пайплайнах.
Требования
- Продвинутый уровень SQL и опыт работы с dbt или аналогами.
- Уверенное владение Python, PySpark и/или pandas для обработки больших данных.
- Практический опыт fuzzy matching и алгоритмов сравнения строк.
- Глубокое понимание моделирования данных (2-3NF, Data Vault 2.0).
- Опыт внедрения инструментов Data Quality (Great Expectations, Soda, dbt tests и др.).
- Опыт работы с оркестраторами (Airflow, Dagster, Prefect) и базовые навыки CI/CD.
Хорошо, если есть
- Опыт обучения простых ML-моделей и использования Active Learning.
- Понимание вероятностного связывания записей.
- Опыт работы с графовыми базами данных и алгоритмами.
- Знание Greenplum и stream lakehouse.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →