Назад
9 часов назад

DevOps Engineer (Kubernetes)

Формат работы
remote
Тип работы
fulltime
Грейд
senior
Страна
Russia
vacancy_detail.hirify_telegram_tooltipВакансия из Telegram канала -

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

TL;DR
DevOps Engineer (Kubernetes): Развёртывание и сопровождение платформы Langfuse в защищённых контурах банка с акцентом на Kubernetes/OpenShift, Apache Kafka, CI/CD и observability. Фокус на обеспечении отказоустойчивости, безопасности, резервного копирования, расследовании инцидентов и автоматизации инфраструктуры.
👩‍💻Вакансия DevOps Engineer

🟢Удаленно🟢Полная занятость
🟢ЗП обсуждается на собеседовании
🟢В компанию Aston

🟦Задачи
– развёртывать, настраивать и сопровождать Langfuse в защищённых контурах Банка, включая настройку зависимых компонентов: PostgreSQL, ClickHouse, Redis и объектного хранилища;
– организовывать интеграцию с Apache Kafka: создавать и сопровождать топики, настраивать ACL, consumer groups, retention, репликацию, DLQ/retry-механизмы, мониторить Kafka lag;
– поддерживать потоки телеметрии моделей: результаты работы классических ML-моделей, LLM traces, события RAG-пайплайнов, метрики качества, технические логи и алерты;
– развёртывать и эксплуатировать сервисы в Kubernetes/OpenShift: namespaces, RBAC, Secrets, ConfigMaps, Ingress, resource limits/requests, autoscaling и сетевые политики
разрабатывать и сопровождать Helm-чарты, Kubernetes-манифесты и шаблоны конфигурации для dev/test/preprod/prod-контуров;
– строить и поддерживать CI/CD- и GitOps-конвейеры: сборка, тестирование, сканирование, публикация артефактов, деплой и rollback;
– автоматизировать инфраструктуру и конфигурации с использованием Ansible, Terraform или аналогичных средств;
– настраивать мониторинг, централизованное логирование и алертинг: Prometheus, Grafana, Alertmanager, ELK/Opensearch или аналоги;
– сопровождать и проводить первичную оптимизацию PostgreSQL, ClickHouse, Redis, Kafka, Nginx/Ingress и смежных инфраструктурных компонентов;
– обеспечивать отказоустойчивость, резервное копирование, восстановление и планирование ресурсов платформы;
– участвовать в разборе инцидентов, готовить RCA, runbook’и и мероприятия по предотвращению повторных сбоев;
– обеспечивать требования ИБ: управление доступами, секретами, сертификатами, сетевой сегментацией, аудитом и устранением уязвимостей;
– вести эксплуатационную и техническую документацию по сервисам, интеграциям и процедурам сопровождения.

🟦Требования
– опыт работы DevOps/SRE-инженером от 5-ти лет;
практический опыт эксплуатации Kubernetes или OpenShift в production-среде: Helm, RBAC, networking, autoscaling, диагностика и настройка ресурсов;
– уверенное знание Linux, Docker, Git, Bash и основ сетевого взаимодействия: TCP/IP, DNS, HTTP(S), TLS, reverse proxy;
– практический опыт работы с Apache Kafka: топики, партиции, репликация, consumer groups, ACL, retention, мониторинг и устранение инцидентов;
– опыт построения и сопровождения CI/CD-пайплайнов на Jenkins, GitLab CI, TeamCity, Argo CD или аналогичных инструментах;
– знание и практическое применение Ansible, Terraform либо других IaC-инструментов;
– опыт настройки мониторинга и observability: Prometheus, Grafana, Alertmanager, централизованное логирование, трассировка;
– опыт эксплуатации PostgreSQL; понимание принципов работы ClickHouse и Redis;
– умение автоматизировать рутинные операции с помощью Python и Bash;
– понимание принципов высоконагруженных и распределенных систем;
– знание подходов к безопасной эксплуатации: управление секретами, сертификатами, доступами, уязвимостями и журналированием действий;
– навыки технической коммуникации: взаимодействие с командами разработки, архитекторами, ИБ, администраторами платформы и владельцами интеграций.

🌐

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →

Текст вакансии взят без изменений

Источник -