Назад
5 дней назад

Tech Lead Data Engineer (Apache Spark)

500 000₽
Формат работы
onsite
Тип работы
fulltime
Грейд
lead
Страна
Russia
hhВакансия с HeadHunter. Контакт ведёт на hh.ru

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Tech Lead Data Engineer (Apache Spark): Построение единого хранилища данных блока B2C и развитие Data Lakehouse на Apache Iceberg и Data Streamhouse на Kafka и Apache Flink с акцентом на потоковую обработку, высоконагруженные системы и отказоустойчивые пайплайны. Focus on оптимизацию Spark-приложений, проектирование Kafka2Iceberg и Kafka2Kafka, реализацию Data Quality и развитие архитектуры платформы.

Локация: Москва, офисный формат работы на месте работодателя — м. Кутузовская, ул. Поклонная, 3

Зарплата: до 500 000 ₽ в месяц до вычета налогов

Компания

СБЕР развивает централизованное единое хранилище данных блока B2C и платформы Data Lakehouse и Data Streamhouse.

Что делать

  • Проектировать и оптимизировать витрины данных, ETL- и ELT-пайплайны на Apache Spark и Greenplum.
  • Разрабатывать потоковые RT- и NRT-пайплайны Kafka2Iceberg и Kafka2Kafka с использованием Apache Flink и Spark Structured Streaming.
  • Участвовать в развитии архитектуры Data Lakehouse и Data Streamhouse, включая партиционирование, compaction и time travel в Apache Iceberg.
  • Реализовывать инкрементальную загрузку, API доступа к витринам и сервисам семантического слоя на Java или Scala.
  • Оптимизировать Spark-приложения с использованием Gluten/Velox, а также разрабатывать механизмы сверки и контроля качества данных.
  • Внедрять решения в продуктивную среду, настраивать CI/CD в Jenkins и управлять зависимостями задач в Oozie или современных оркестраторах.

Требования

  • Более 6 лет опыта в разработке и эксплуатации высоконагруженных систем.
  • Уверенное владение SQL, Java или Scala и Python для ad-hoc-анализа и Data Quality.
  • Глубокое понимание Apache Hadoop, включая HDFS и YARN, и опыт промышленной эксплуатации.
  • Опыт разработки пайплайнов на Apache Spark Core, Spark SQL и Structured Streaming не ниже middle-уровня.
  • Опыт работы с Apache Kafka и Apache Flink или Spark Streaming.
  • Знание Parquet, ORC, Avro, Apache Iceberg и методов оптимизации Spark: настройка ресурсов, устранение перекосов данных, работа с памятью и shuffle.

Хорошо, если есть

  • Опыт внедрения промышленных пакетных и потоковых пайплайнов передачи данных.
  • Опыт работы с Gluten/Velox или аналогичными векторизованными движками.
  • Навыки сборки и развертывания Docker-образов приложений.

Культура и преимущества

  • Годовая премия и расширенный ДМС, включая льготное страхование для семьи.
  • Корпоративная пенсионная программа, спортзал и зоны отдыха в офисе.
  • Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития.
  • Регулярные митапы и развитое DS-сообщество.
  • Льготный дисконт по ипотечному кредиту, подписка Прайм и вознаграждение за рекомендации.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →