Назад
10 часов назад

Senior DevOps Engineer (igaming)

Формат работы
remote
Тип работы
fulltime
Грейд
senior
Вакансия от Hirify. Размещена напрямую Вакансия размещена на Hirify напрямую от HR/нанимающего менеджера

Мэтч

Покажет вашу совместимость с вакансией

Описание вакансии

TL;DR
Senior DevOps Engineer (SRE): миграция production-инфраструктуры с Docker Compose на Kubernetes и построение отказоустойчивых систем с акцентом на мониторинг и автоматизацию. Фокус на проектировании процессов on-call, внедрении SLI/SLO и обеспечении стабильности высоконагруженных сервисов.

Senior DevOps Engineer (SRE)

Требования:

  • Опыт работы с Docker Swarm и/или Kubernetes в production-среде.
  • Уверенное владение Ansible.
  • Опыт построения monitoring stack (Prometheus + Grafana)
  • Глубокие знания Linux (Debian/Ubuntu) на уровне траблшутинга
  • Опыт с GitLab CI/CD
  • Администрирование MariaDB/MySQL (репликация, backup, восстановление)
  • Опыт построения централизованного логирования (ELK/Loki)
  • Опыт работы SRE: диагностика и устранение инцидентов в production
  • Умение самостоятельно принимать технические решения и нести ответственность за их результат.

Дежурства и ответственность

  • Участие в графике on-call-дежурств.
  • Оперативная реакция на критические production-инциденты, в том числе за пределами стандартного рабочего времени.
  • Автономность в принятии решений
  • Ответственность за доступность и стабильность инфраструктуры.
  • Проведение postmortem-разборов и устранение первопричин инцидентов.

Будет преимуществом

  • Опыт работы с Terraform.
  • Опыт миграции проектов с Docker Compose или Docker Swarm в Kubernetes.
  • Опыт работы с Helm и Argo CD.
  • Опыт с security best practices (secrets management, SSL/TLS, firewall)
  • Опыт работы с высоконагруженными системами.
  • Опыт в iGaming или Fintech (требования к uptime)
  • Опыт построения или развития DevOps/SRE-команды.

Задачи

  • Миграция production с Docker Compose в отказоустойчивый Docker Swarm или Kubernetes-кластер.
  • Построение мониторинга и алертинга на базе Prometheus, Grafana и Alertmanager.
  • Внедрение централизованного логирования.
  • Развитие Infrastructure as Code с использованием Ansible и Terraform.
  • Автоматизация резервного копирования и восстановления с целевым RTO менее одного часа.
  • Выстраивание on-call-процессов, runbook-документации и работы с инцидентами.
  • Security hardening инфраструктуры.
  • Внедрение SLI/SLO и подготовка к работе по SLA.

Текущая инфра:

  • ~50 серверов (Hetzner dedicated + VPS, DigitalOcean)
  • Staging: Docker Swarm
  • Production: Docker Compose
  • БД: MariaDB с Master-Slave репликацией
  • CI/CD: GitLab, Harbor registry
  • IaC: начальная стадия внедрения, Ansible для конфигурации серверов

Условия:

  • Формат работы: полностью удаленный.
  • Испытательный срок: 3 месяца.
  • Отпуск и wellbeing: 18 рабочих дней отпуска, 5 оплачиваемых sick days, 2 day-off в год, оплачиваемый больничный.
  • Дополнительные бенефиты: бонус на индивидуальное развитие, подарки ко дню рождения, на годовщину работы и по важным жизненным событиям.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →

Вакансия размещена на Hirify напрямую от HR/нанимающего менеджера