Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Платформенный SRE (Observability/CI/CD): Разработка и поддержка систем наблюдаемости и обеспечения доступности облачной платформы с акцентом на стандарты надежности данных и автоматизацию проверок качества. Фокус на создании Quality Gates в CI/CD, расчете композитных SLO и реализации концепций Observability as Code.
Локация: Москва
Компания
Cloud.ru — ведущий российский провайдер облачных услуг и инфраструктурных решений.
Что делать
- Формировать требования к метрикам и внедрять стандарты наблюдаемости и надежности данных.
- Анализировать потоки данных с помощью Prometheus, Loki и OpenTelemetry для выявления узких мест и оптимизации.
- Автоматизировать контроль качества данных через Quality Gates (схемы, покрытие метрик, SLA/SLO) перед деплоем в прод.
- Проводить R&D, нагрузочное тестирование и планировать тесты на надежность, включая хаос-тестирование и канареечные развертывания.
- Выполнять RCA инцидентов, анализировать логи и трассировки, вести базу знаний и post-mortem.
- Развивать внутреннюю платформу мониторинга, внедряя подходы Observability as Code и Alerting as Code.
Требования
- Опыт построения отказоустойчивых и масштабируемых сервисов.
- Практический опыт внедрения Quality Gates в CI/CD процессы для управления рисками развертывания.
- Умение определять SLI/SLO для новых сервисов и рассчитывать композитные SLO для сложных микросервисных систем (10+ компонентов).
- Опыт реализации Observability as Code и Alerting as Code.
- Навыки системного анализа сложных сценариев отказов и поиска корневых причин (RCA).
- Опыт написания технической документации и коммуникации с разработчиками и бизнесом.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →