Назад
8 часов назад

Senior/Lead DevOps Engineer (Kubernetes, Kafka)

Формат работы
remote (только Russia)
Тип работы
fulltime
Грейд
senior/lead
Страна
Russia
Вакансия от Hirify. Размещена напрямую Вакансия размещена на Hirify напрямую от HR/нанимающего менеджера

Мэтч

Покажет вашу совместимость с вакансией

Описание вакансии

TL;DR
Senior/Lead DevOps Engineer (Kubernetes/Kafka): проведение комплексного аудита инфраструктуры и проектирование целевой архитектуры с акцентом на SRE и CI/CD процессы. Фокус на решении задач отказоустойчивости, оптимизации затрат и внедрении надежных event-driven интеграций на базе Kafka. ID вакансии: 89063_SS

Senior/Lead DevOps Engineer (Архитектура / Kubernetes / Kafka / SRE / Аудит)

Ставка: обсуждается.

Грейд: Senior / Lead.

Загрузка: Full-time (полная занятость).

Срок привлечения: 2 месяца (проект аудита и проектирования целевой архитектуры).

Формат: Удалённо.

Часовой пояс: UTC+3 (МСК).

Локация/Гражданство: Россия / РФ.

О проекте: ИТ-компания создаёт единое цифровое пространство на BPMN/CRM/ERP-платформе, интегрируя корпоративные системы и внешние приложения для задач клиентов.

Ищем Senior/Lead DevOps Engineer для проведения комплексного аудита существующей инфраструктуры, проектирования целевой архитектуры и выстраивания процессов SRE и CI/CD. Роль для зрелого инженера с опытом от 6 лет, который глубоко понимает Kubernetes, имеет сильный бэкграунд в эксплуатации Kafka (от 3 лет в production) и умеет переводить бизнес-требования в надежные, безопасные и экономически эффективные архитектурные решения.

Ключевые задачи:

Аудит и стратегия:

  • Проведение комплексного аудита инфраструктуры и архитектуры: выявление узких мест, рисков отказоустойчивости, технического долга и проверок на соответствие требованиям (в т.ч. 152-ФЗ).
  • Подготовка и защита перед руководством дорожной карты с приоритизацией по рискам и эффекту.

Архитектура и внедрение:

  • Проектирование и внедрение целевой архитектуры: топология сетей, схема окружений (dev/stage/prod), стратегия отказоустойчивости и disaster recovery.
  • Выстраивание и поддержка CI/CD-процессов для нескольких продуктовых команд.
  • Внедрение и развитие практик SRE: SLI/SLO/SLA, error budget, observability, управление инцидентами и post-mortem культура.

Безопасность и оптимизация:

  • Обеспечение безопасности инфраструктуры: управление секретами, разграничение доступа, аудит уязвимостей.
  • Оптимизация затрат на инфраструктуру (cloud/on-premise) без потери надёжности.

Лидерство:

  • Техническое экспертное наставничество для команд разработки.
  • Ведение технической документации: архитектурные решения (ADR), runbook'и, схемы инфраструктуры.

Обязательные требования:

Опыт и архитектура (КРИТИЧНО!):

  • Опыт проектирования архитектуры распределённых систем и сервисов от 6+ лет.
  • Опыт проведения технического аудита инфраструктуры/архитектуры с конкретными результатами и метриками.
  • Понимание паттернов отказоустойчивости (репликация, failover, circuit breaker, graceful degradation) и trade-off между микросервисной и монолитной архитектурой.

Инфраструктура и K8s (КРИТИЧНО!):

  • Глубокое знание Kubernetes: проектирование кластеров, Helm, Operators, сетевые политики, RBAC.
  • Опыт работы с Docker/containerd и построением безопасных образов.
  • Опыт работы с Infrastructure as Code: Terraform, Ansible, Pulumi.
  • Опыт эксплуатации облачных платформ (Яндекс.Облако, Timeweb Cloud, VK Cloud, AWS/GCP) и/или on-premise дата-центров.

CI/CD и автоматизация:

  • Опыт работы с GitHub Actions, Jenkins, ArgoCD.
  • Опыт внедрения GitOps-подходов.
  • Автоматизация рутинных операционных задач (скрипты на Python/Bash).

SRE и наблюдаемость:

  • Опыт построения систем мониторинга и алертинга: Prometheus, Grafana, Alertmanager.
  • Опыт работы с логированием и трассировкой: ELK/OpenSearch, Loki, Jaeger/Tempo.
  • Опыт внедрения self-hosted решений для observability (в т.ч. Sentry).
  • Практический опыт управления инцидентами on-call и разбора post-mortem.

Безопасность:

  • Понимание принципов безопасной эксплуатации распределённых и контейнеризированных сервисов.
  • Опыт работы с системами управления секретами (Vault, sealed-secrets).
  • Опыт настройки авторизации и разграничения доступа в базах данных и векторных хранилищах (Qdrant, PostgreSQL).
  • (Знакомство с 152-ФЗ и вопросами размещения данных в РФ будет преимуществом).

Базы данных и Kafka (КРИТИЧНО!):

  • Опыт эксплуатации реляционных (PostgreSQL) и NoSQL решений.
  • Понимание работы с векторными базами данных (Qdrant, Elasticsearch).
  • Глубокое понимание Apache Kafka: архитектура брокеров и топиков, партиционирование, репликация, ISR, семантика доставки, consumer groups.
  • Практический опыт эксплуатации Kafka в production от 3 лет: развёртывание и тюнинг кластеров (в т.ч. в Kubernetes через Strimzi), мониторинг lag и throughput, диагностика инцидентов.
  • Опыт проектирования event-driven интеграций на Kafka: схемы данных и Schema Registry, идемпотентность, обработка ошибок и dead-letter-топики, Kafka Connect / Kafka Streams.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →

Вакансия размещена на Hirify напрямую от HR/нанимающего менеджера