Назад
13 часов назад

Senior DevOps/SRE (Observability) Engineer

Формат работы
remote/hybrid/onsite
Тип работы
fulltime
Грейд
senior
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Senior DevOps/SRE (Observability) Engineer (высоконагруженные онлайн-сервисы): Поддержка и развитие observability-платформы, production-инфраструктуры в Kubernetes и процессов управления инцидентами с акцентом на метрики, логи, трассировки и надежность распределённых систем. Focus on диагностике критических инцидентов, развитии мониторинга и алертинга, проведении RCA/Post-Mortem и внедрении улучшений reliability.

Локация: Удалённый, офисный или гибридный формат работы. Компания нанимает специалистов, которые уже переехали из России.

Компания

Международная продуктовая компания разрабатывает и поддерживает высоконагруженные проекты для крупных компаний, преимущественно в сфере развлекательных онлайн-сервисов.

Что делать

  • Поддерживать и развивать стратегию observability, стандартизировать подходы и консультировать команды разработки.
  • Обеспечивать надёжную работу приложений в Kubernetes в production, включая диагностику инцидентов и анализ распределённых систем.
  • Развивать observability-платформу для metrics, logs и traces на базе VM stack, CloudWatch, ELK и сопутствующих инструментов.
  • Создавать и поддерживать мониторинг, алертинг и дашборды с учётом архитектуры сервисов и production-требований.
  • Участвовать в полном цикле управления production-инцидентами: on-call-реагирование через PagerDuty, координация восстановления, RCA/Post-Mortem и внедрение reliability improvements.
  • Развивать практики Incident Management и reliability engineering, взаимодействуя с кросс-функциональными командами.

Требования

  • От 3 лет опыта в роли DevOps Engineer.
  • Практический опыт работы с observability-стеком: OpenTelemetry, Grafana, Loki, Tempo, Mimir, VictoriaMetrics, ELK, Vector и Sentry.
  • Глубокий production-опыт работы с Kubernetes, включая диагностику и устранение инцидентов.
  • Опыт работы с GitLab CI/CD, GitOps и Argo CD, уверенное владение Git и различными моделями ветвления.
  • Опыт разработки и поддержки Helm-чартов, контейнеризации и build-инструментов Docker, Kaniko и BuildKit.
  • Опыт on-call, работы с критическими инцидентами, проведения RCA/Post-Mortem и внедрения улучшений reliability.

Культура и преимущества

  • Возможность развивать компетенции, работать над крупными проектами и применять знания на практике.
  • Наставничество и оплата курсов для повышения квалификации.
  • Минимум бюрократии и быстрое согласование необходимых решений.
  • Оплачиваемые больничные и отпуск.
  • Частичная компенсация занятий английским языком и 4 дополнительных day-off в год.
  • Годовой бонус по результатам работы, поддержка сотрудников в важные периоды жизни и реферальная программа.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →