Назад
7 дней назад

Ведущий инженер доступности в MAX (SRE)

Формат работы
remote (только Russia)
Тип работы
fulltime
Грейд
senior
Страна
Russia/Belarus
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Ведущий инженер доступности в MAX (SRE): Развитие и эксплуатация высоконагруженной инфраструктуры мессенджера с акцентом на надёжность, observability и SRE-практики. Focus on внедрение SLI/SLO и error budget, автоматизацию, реагирование на инциденты, безопасные изменения и эксплуатационную документацию.

Локация: Дистанционный формат работы

Компания

VK развивает MAX — цифровую платформу с мессенджером, мини-приложениями, нейропомощником, платёжным сервисом и конструктором чат-ботов.

Что делать

  • Развивать и сопровождать инфраструктуру высоконагруженной системы, повышать надёжность, доступность и производительность.
  • Внедрять SLI/SLO, error budget и алертинг на основе пользовательских метрик.
  • Развивать observability: Prometheus, Alertmanager, Grafana и централизованные логи; снижать alert noise и улучшать MTTD/MTTR.
  • Автоматизировать эксплуатационные операции, развивать self-service-подходы и участвовать в on-call, реагировании на инциденты и postmortem.
  • Участвовать в архитектурных обсуждениях, ревью изменений и согласовании требований к production readiness.
  • Создавать и поддерживать runbooks, playbooks, инструкции по релизам и откатам, аварийные процедуры и документацию по дашбордам, алертам и зависимостям.

Требования

  • 5+ лет опыта в SRE, DevOps, Platform или System Engineering и опыт эксплуатации highload-систем.
  • Глубокое знание Linux, диагностика CPU, памяти, дисковой подсистемы и production-деградаций.
  • Знание TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7-балансировки и диагностики сетевых проблем.
  • Опыт эксплуатации распределённых систем, публичных облаков, контейнеров и Kubernetes.
  • Практический опыт с Terraform или аналогами, Ansible, Git workflow, code review и версионированием инфраструктуры.
  • Знание CI/CD, canary и blue-green релизов, rollback-стратегий, SLI/SLO, error budget и incident response; готовность участвовать в on-call.

Хорошо, если есть

  • Опыт работы с PostgreSQL, Redis, Cassandra, Kafka или ClickHouse.
  • Опыт сопровождения Java, включая JVM/GC, heap/thread dumps и диагностику latency.
  • Знание основ security: secrets management и least privilege.

Культура и преимущества

  • Дистанционный формат работы.
  • Работа с высоконагруженной цифровой платформой и инфраструктурой production-уровня.
  • Практики безопасных изменений, postmortem без поиска виноватых и развитие эксплуатационной документации.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →