pythonsqldwhetlairflowsparkpysparkdata pipelinesdata lakedistributed data processing
Вакансия из Telegram канала - Название доступно после авторизации
Пожаловаться
Зарплата и рынок
ЗП не указана
На похожих ролях по рынку
$1.9к$3кмедиана$3.5к
50 в выборке
На международном рынке: $150к/год ($96к - $200к)
70
Хорошая вакансия
развернуть
Роль четко связана с инженерией данных на больших объемах и развитием платформы, но без зарплаты и информации о компании сложнее оценить привлекательность предложения.
Кликните для подробной информации
Зарплата не указанаАктуальный стекПонятные задачиКрупные объемы
Оценка от Hirify AI
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Создать профиль и узнать мэтч
Описание вакансии
TL;DR
Data Engineer (Spark): Развитие платформы данных для обработки петабайтных объёмов телеметрии автономного транспорта Москвы с акцентом на Spark-пайплайны, интеграцию источников и архитектуру Data Lake/DWH. Focus on проектирование преобразований и проверок качества, повышение производительности и стабильности платформы, а также построение распределённых процессов обработки данных.
Всем привет!
Мы ищем талантливого Data Engineer, который готов столкнуться с непростыми задачами в области хранения и обработки больших данных в масштабах петабайт!
У вас будет уникальная возможность поучаствовать в развитии платформы данных для работы с телеметрией автономного транспорта Москвы - трамваев и метро, в том числе: в разработке архитектуры DWH, подключении новых сервисов, повышении производительности и стабильности работы платфонмы.
Что предстоит делать:
- Превращать телеметрию автономного транспорта в данные, удобные для анализа: разрабатывать и запускать Spark-пайплайны, продумывать преобразования и проверки качества
- Подключать новые источники данных: разрабатывать интеграции с различными системами и обеспечивать надёжную загрузку данных в хранилище
- Развивать архитектуру Data Lake / DWH
- Вместе с командой формировать общие подходы к разработке, мониторингу и сопровождению пайплайнов
Что ожидаем:
- Практический опыт разработки и сопровождения пайплайнов данных
- Опыт работы с PySpark, Python и SQL
- Опыт работы с Data Lake / DWH и понимание принципов построения ETL/ELT-процессов
- Понимание принципов распределённой обработки данных
Будет плюсом:
- Опыт работы с Trino+S3
- Опыт оркестрации пайплайнов с помощью Airflow
- Знакомство с Data Vault 2.0
- Знание Scala и опыт её использования для обработки данных
- Опыт развития платформы данных на ранних этапах: от выбора решений до их внедрения и сопровождения
Контакт для связи: Показать контакты
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Текст вакансии взят без изменений
Источник - Telegram канал. Название доступно после авторизации