Мэтч
Покажет вашу совместимость с вакансией
Описание вакансии
Senior/Lead DevOps Engineer (Архитектура / Kubernetes / Kafka / SRE / Аудит)
Ставка: обсуждается.
Грейд: Senior / Lead.
Загрузка: Full-time (полная занятость).
Срок привлечения: 2 месяца (проект аудита и проектирования целевой архитектуры).
Формат: Удалённо.
Часовой пояс: UTC+3 (МСК).
Локация/Гражданство: Россия / РФ.
О проекте: ИТ-компания создаёт единое цифровое пространство на BPMN/CRM/ERP-платформе, интегрируя корпоративные системы и внешние приложения для задач клиентов.
Ищем Senior/Lead DevOps Engineer для проведения комплексного аудита существующей инфраструктуры, проектирования целевой архитектуры и выстраивания процессов SRE и CI/CD. Роль для зрелого инженера с опытом от 6 лет, который глубоко понимает Kubernetes, имеет сильный бэкграунд в эксплуатации Kafka (от 3 лет в production) и умеет переводить бизнес-требования в надежные, безопасные и экономически эффективные архитектурные решения.
Ключевые задачи:
Аудит и стратегия:
- Проведение комплексного аудита инфраструктуры и архитектуры: выявление узких мест, рисков отказоустойчивости, технического долга и проверок на соответствие требованиям (в т.ч. 152-ФЗ).
- Подготовка и защита перед руководством дорожной карты с приоритизацией по рискам и эффекту.
Архитектура и внедрение:
- Проектирование и внедрение целевой архитектуры: топология сетей, схема окружений (dev/stage/prod), стратегия отказоустойчивости и disaster recovery.
- Выстраивание и поддержка CI/CD-процессов для нескольких продуктовых команд.
- Внедрение и развитие практик SRE: SLI/SLO/SLA, error budget, observability, управление инцидентами и post-mortem культура.
Безопасность и оптимизация:
- Обеспечение безопасности инфраструктуры: управление секретами, разграничение доступа, аудит уязвимостей.
- Оптимизация затрат на инфраструктуру (cloud/on-premise) без потери надёжности.
Лидерство:
- Техническое экспертное наставничество для команд разработки.
- Ведение технической документации: архитектурные решения (ADR), runbook'и, схемы инфраструктуры.
Обязательные требования:
Опыт и архитектура (КРИТИЧНО!):
- Опыт проектирования архитектуры распределённых систем и сервисов от 6+ лет.
- Опыт проведения технического аудита инфраструктуры/архитектуры с конкретными результатами и метриками.
- Понимание паттернов отказоустойчивости (репликация, failover, circuit breaker, graceful degradation) и trade-off между микросервисной и монолитной архитектурой.
Инфраструктура и K8s (КРИТИЧНО!):
- Глубокое знание Kubernetes: проектирование кластеров, Helm, Operators, сетевые политики, RBAC.
- Опыт работы с Docker/containerd и построением безопасных образов.
- Опыт работы с Infrastructure as Code: Terraform, Ansible, Pulumi.
- Опыт эксплуатации облачных платформ (Яндекс.Облако, Timeweb Cloud, VK Cloud, AWS/GCP) и/или on-premise дата-центров.
CI/CD и автоматизация:
- Опыт работы с GitHub Actions, Jenkins, ArgoCD.
- Опыт внедрения GitOps-подходов.
- Автоматизация рутинных операционных задач (скрипты на Python/Bash).
SRE и наблюдаемость:
- Опыт построения систем мониторинга и алертинга: Prometheus, Grafana, Alertmanager.
- Опыт работы с логированием и трассировкой: ELK/OpenSearch, Loki, Jaeger/Tempo.
- Опыт внедрения self-hosted решений для observability (в т.ч. Sentry).
- Практический опыт управления инцидентами on-call и разбора post-mortem.
Безопасность:
- Понимание принципов безопасной эксплуатации распределённых и контейнеризированных сервисов.
- Опыт работы с системами управления секретами (Vault, sealed-secrets).
- Опыт настройки авторизации и разграничения доступа в базах данных и векторных хранилищах (Qdrant, PostgreSQL).
- (Знакомство с 152-ФЗ и вопросами размещения данных в РФ будет преимуществом).
Базы данных и Kafka (КРИТИЧНО!):
- Опыт эксплуатации реляционных (PostgreSQL) и NoSQL решений.
- Понимание работы с векторными базами данных (Qdrant, Elasticsearch).
- Глубокое понимание Apache Kafka: архитектура брокеров и топиков, партиционирование, репликация, ISR, семантика доставки, consumer groups.
- Практический опыт эксплуатации Kafka в production от 3 лет: развёртывание и тюнинг кластеров (в т.ч. в Kubernetes через Strimzi), мониторинг lag и throughput, диагностика инцидентов.
- Опыт проектирования event-driven интеграций на Kafka: схемы данных и Schema Registry, идемпотентность, обработка ошибок и dead-letter-топики, Kafka Connect / Kafka Streams.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Вакансия размещена на Hirify напрямую от HR/нанимающего менеджера