7 дней назад
Ведущий инженер доступности в MAX (SRE)
RUВакансия из Hirify RU, списка российских tech-компаний
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Ведущий инженер доступности в MAX (SRE): Развитие и эксплуатация высоконагруженной инфраструктуры мессенджера с акцентом на надёжность, observability и SRE-практики. Focus on внедрение SLI/SLO и error budget, автоматизацию, реагирование на инциденты, безопасные изменения и эксплуатационную документацию.
Локация: Дистанционный формат работы
Компания
VK развивает MAX — цифровую платформу с мессенджером, мини-приложениями, нейропомощником, платёжным сервисом и конструктором чат-ботов.
Что делать
- Развивать и сопровождать инфраструктуру высоконагруженной системы, повышать надёжность, доступность и производительность.
- Внедрять SLI/SLO, error budget и алертинг на основе пользовательских метрик.
- Развивать observability: Prometheus, Alertmanager, Grafana и централизованные логи; снижать alert noise и улучшать MTTD/MTTR.
- Автоматизировать эксплуатационные операции, развивать self-service-подходы и участвовать в on-call, реагировании на инциденты и postmortem.
- Участвовать в архитектурных обсуждениях, ревью изменений и согласовании требований к production readiness.
- Создавать и поддерживать runbooks, playbooks, инструкции по релизам и откатам, аварийные процедуры и документацию по дашбордам, алертам и зависимостям.
Требования
- 5+ лет опыта в SRE, DevOps, Platform или System Engineering и опыт эксплуатации highload-систем.
- Глубокое знание Linux, диагностика CPU, памяти, дисковой подсистемы и production-деградаций.
- Знание TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7-балансировки и диагностики сетевых проблем.
- Опыт эксплуатации распределённых систем, публичных облаков, контейнеров и Kubernetes.
- Практический опыт с Terraform или аналогами, Ansible, Git workflow, code review и версионированием инфраструктуры.
- Знание CI/CD, canary и blue-green релизов, rollback-стратегий, SLI/SLO, error budget и incident response; готовность участвовать в on-call.
Хорошо, если есть
- Опыт работы с PostgreSQL, Redis, Cassandra, Kafka или ClickHouse.
- Опыт сопровождения Java, включая JVM/GC, heap/thread dumps и диагностику latency.
- Знание основ security: secrets management и least privilege.
Культура и преимущества
- Дистанционный формат работы.
- Работа с высоконагруженной цифровой платформой и инфраструктурой production-уровня.
- Практики безопасных изменений, postmortem без поиска виноватых и развитие эксплуатационной документации.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →