Назад
4 дня назад

Senior/TL Data Engineer (Data Lakehouse)

540 000
Формат работы
onsite
Тип работы
fulltime
Грейд
senior/lead
Страна
Russia
hhВакансия с HeadHunter. Контакт ведёт на hh.ru

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Senior/TL Data Engineer (Data Lakehouse): Построение единого хранилища данных блока B2C и развитие высоконагруженных ETL/ELT-пайплайнов на базе Hadoop, Spark и Iceberg с акцентом на потоковую обработку и Data Lakehouse. Focus on оптимизацию Spark-приложений, инкрементальные загрузки, Data Quality, разработку API и внедрение решений через CI/CD.

Локация: Москва, офисный формат работы на месте работодателя, м. Кутузовская

Зарплата: до 540 000 ₽ в месяц до вычета налогов

Компания

СБЕР развивает централизованное единое хранилище данных блока B2C и платформу на базе Data Lakehouse и Data Streamhouse.

Что делать

  • Проектировать и реализовывать производительные ETL- и ELT-процессы для витрин данных на Apache Spark и Greenplum.
  • Развивать пайплайны обработки данных на Hadoop и участвовать в развитии Data Lakehouse на Apache Iceberg.
  • Реализовывать инкрементальные загрузки, оптимизировать партиционирование, compaction и time travel.
  • Разрабатывать и документировать API на Java или Scala для доступа к витринам и сервисам семантического слоя.
  • Оптимизировать Spark-приложения с использованием Gluten и Velox, а также разрабатывать решения для контроля качества данных на Spark и Python.
  • Внедрять решения в продуктовую среду, настраивать CI/CD-пайплайны в Jenkins и управлять зависимостями задач в Oozie или современных оркестраторах.

Требования

  • Более 6 лет опыта в разработке и эксплуатации инженерных решений для данных.
  • Уверенное владение SQL, Java или Scala и Python для ad-hoc-анализа и Data Quality.
  • Глубокое понимание Apache Hadoop, включая HDFS и YARN, и опыт работы с экосистемой в production.
  • Опыт разработки пайплайнов на Apache Spark Core, Spark SQL и Structured Streaming не ниже middle.
  • Знание форматов Parquet, ORC и Avro, а также Apache Iceberg.
  • Опыт оптимизации Spark: настройка ресурсов, устранение перекосов данных, работа с memory и оптимизация shuffle.

Хорошо, если есть

  • Опыт внедрения промышленных пайплайнов пакетной передачи данных.
  • Опыт работы с Gluten, Velox или аналогичными векторизованными движками.
  • Навыки сборки и развертывания Docker-образов приложений.

Культура и преимущества

  • Корпоративный спортзал и зоны отдыха.
  • Более 400 образовательных программ СберУниверситета, регулярные митапы и развитое DS-сообщество.
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
  • Льготные условия по ипотечному кредиту и подписка Прайм с возможностью совместного использования.
  • Вознаграждение за рекомендации кандидатов в команду.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →