Назад
2 дня назад

Data Engineer (AI)

Формат работы
hybrid/onsite
Тип работы
fulltime
Грейд
middle/senior
Английский
b2
Страна
Russia
hhВакансия с HeadHunter. Контакт ведёт на hh.ru

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/

TL;DR

Data Engineer (AI): Разработка инфраструктуры и пайплайнов для обработки данных при обучении Vision-Language Models с акцентом на масштабируемость, качество и версионирование датасетов. Фокус на построении сложных процессов очистки, фильтрации и генерации синтетических данных для работы с мультимодальными наборами данных объемом в десятки миллиардов изображений.

Компания

Крупнейшая технологическая компания, развивающая передовые AI-решения и обладающая одним из самых больших сообществ DS-специалистов в стране.

Что делать

  • Проектировать и реализовывать пайплайны обработки данных на больших масштабах (десятки миллиардов изображений).
  • Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM.
  • Обеспечивать импорт данных из различных источников, их валидацию, очистку и дедупликацию.
  • Отвечать за инфраструктуру хранения и версионирования датасетов, включая экспорт в training-ready форматы.
  • Собирать статистику, строить отчеты и визуализации для анализа состава и качества данных.
  • Работать в тесной связке с ML-инженерами, исследователями и инфраструктурной командой.

Требования

  • Сильный опыт в data engineering и построении production-grade data pipelines.
  • Уверенное владение Python (multiprocessing, multithreading, async).
  • Опыт работы с большими объемами данных и распределенной обработкой.
  • Практический опыт с объектными хранилищами (S3) и системами типа YTsaurus.
  • Опыт работы с DVC, Git, Docker и реляционными базами данных (PostgreSQL).
  • Готовность работать на стыке engineering и ML research.

Хорошо, если есть

  • Опыт работы с мультимодальными данными (изображения, текст, image-text pairs).
  • Понимание архитектуры современных датасетов для VLM / LMM.
  • Опыт построения пайплайнов для synthetic data generation.
  • Опыт работы с Common Crawl или LAION-подобными датасетами.

Культура и преимущества

  • Возможность выбора формата работы: гибрид или офис.
  • Доступ к крупнейшему DS&AI community и образовательным программам СберУниверситета.
  • Возможность быть соавтором НИРов и статей для международных конференций.
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
  • Ипотека по льготной ставке до 7% и подписка СберПрайм+.
  • Ежегодный пересмотр зарплаты и годовая премия.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →