Эта вакансия в архиве
Посмотреть похожие вакансии ↓Описание вакансии
TL;DR
Data инженер (Big Data): проектирование и поддержка масштабируемых data-пайплайнов с акцентом на обработку больших объемов данных. Фокус на оптимизации Spark-задач, обеспечении качества данных и работе с Hadoop-экосистемой.
Data инженер
Локация: РФ
Обязательно
- Уверенное владение SQL: написание и оптимизация сложных запросов, понимание нормализации и денормализации данных;
- Практический опыт работы с Big Data: Spark / PySpark;
- Опыт разработки и поддержки Spark-приложений для обработки больших объёмов данных;
- Опыт работы с Hadoop-экосистемой: Hadoop, YARN, Hive;
- Опыт проектирования, разработки и поддержки data-пайплайнов;
- Опыт работы с оркестраторами данных, например Airflow или аналогами;
- Понимание принципов оптимизации SQL-запросов и Spark-задач: планы выполнения, join'ы, partitioning, работа с data skew;
- Опыт работы с форматами хранения данных: Parquet, Avro и/или аналогами;
- Понимание внутреннего устройства Spark: Catalyst, Tungsten, CBO, AQE;
- Понимание принципов Data Quality и опыт контроля качества данных;
- Навыки мониторинга и диагностики работы data-пайплайнов;
- Умение взаимодействовать со смежными техническими и бизнес-командами.
Желательно
- Опыт работы с Data Lake / Lakehouse: Delta Lake, Iceberg, ACID-транзакции, time travel;
- Опыт глубокой оптимизации Spark: настройка параметров, устранение data skew, оптимизация join'ов и производительности;
- Опыт работы с несколькими оркестраторами и проектирования сложных масштабируемых data-пайплайнов;
- Опыт с инструментами мониторинга и логирования: Prometheus, Grafana, ELK, Grafana Loki;
- Опыт работы с Data Quality-инструментами и участие в процессах Data Governance;
- Опыт менторства или участия в принятии технических/архитектурных решений.
Вакансия размещена на Hirify напрямую от HR/нанимающего менеджера