5 дней назад
Tech Lead Data Engineer (Apache Spark)
500 000₽
hhВакансия с HeadHunter. Контакт ведёт на hh.ru
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Tech Lead Data Engineer (Apache Spark): Построение единого хранилища данных блока B2C и развитие Data Lakehouse на Apache Iceberg и Data Streamhouse на Kafka и Apache Flink с акцентом на потоковую обработку, высоконагруженные системы и отказоустойчивые пайплайны. Focus on оптимизацию Spark-приложений, проектирование Kafka2Iceberg и Kafka2Kafka, реализацию Data Quality и развитие архитектуры платформы.
Локация: Москва, офисный формат работы на месте работодателя — м. Кутузовская, ул. Поклонная, 3
Зарплата: до 500 000 ₽ в месяц до вычета налогов
Компания
СБЕР развивает централизованное единое хранилище данных блока B2C и платформы Data Lakehouse и Data Streamhouse.
Что делать
- Проектировать и оптимизировать витрины данных, ETL- и ELT-пайплайны на Apache Spark и Greenplum.
- Разрабатывать потоковые RT- и NRT-пайплайны Kafka2Iceberg и Kafka2Kafka с использованием Apache Flink и Spark Structured Streaming.
- Участвовать в развитии архитектуры Data Lakehouse и Data Streamhouse, включая партиционирование, compaction и time travel в Apache Iceberg.
- Реализовывать инкрементальную загрузку, API доступа к витринам и сервисам семантического слоя на Java или Scala.
- Оптимизировать Spark-приложения с использованием Gluten/Velox, а также разрабатывать механизмы сверки и контроля качества данных.
- Внедрять решения в продуктивную среду, настраивать CI/CD в Jenkins и управлять зависимостями задач в Oozie или современных оркестраторах.
Требования
- Более 6 лет опыта в разработке и эксплуатации высоконагруженных систем.
- Уверенное владение SQL, Java или Scala и Python для ad-hoc-анализа и Data Quality.
- Глубокое понимание Apache Hadoop, включая HDFS и YARN, и опыт промышленной эксплуатации.
- Опыт разработки пайплайнов на Apache Spark Core, Spark SQL и Structured Streaming не ниже middle-уровня.
- Опыт работы с Apache Kafka и Apache Flink или Spark Streaming.
- Знание Parquet, ORC, Avro, Apache Iceberg и методов оптимизации Spark: настройка ресурсов, устранение перекосов данных, работа с памятью и shuffle.
Хорошо, если есть
- Опыт внедрения промышленных пакетных и потоковых пайплайнов передачи данных.
- Опыт работы с Gluten/Velox или аналогичными векторизованными движками.
- Навыки сборки и развертывания Docker-образов приложений.
Культура и преимущества
- Годовая премия и расширенный ДМС, включая льготное страхование для семьи.
- Корпоративная пенсионная программа, спортзал и зоны отдыха в офисе.
- Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития.
- Регулярные митапы и развитое DS-сообщество.
- Льготный дисконт по ипотечному кредиту, подписка Прайм и вознаграждение за рекомендации.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Похожие вакансии
Профи.ру
11 дней назад
Data Engineering Team Lead (BI Platform)
400 000 - 600 000₽
Сбер
9 дней назад
Data Engineer в сеть продаж
200 000 - 235 000₽
SimbirSoft
7 дней назад
Data Engineer (Data Warehouse)
Rubytech
7 дней назад
Data Analyst (Big Data, ETL, Python, SQL)
Lamoda Tech
4 дня назад
Senior Big Data Engineer (Data Platform)
Сбер
8 дней назад
Data Engineer (фулл-тайм офис, со знанием англ. яз.)
220 000₽