Не получаете ответ?
Вакансия опубликована 13 дн. назад - шансы на ответ снижаются.
обновлено 13 дней назад
Customer Reliability Engineer (on-premise)
RUВакансия из Hirify RU, списка российских tech-компаний
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
Customer Reliability Engineer (on-premise): Обеспечение надёжной работы сервисов Яндекс 360 в закрытых контурах корпоративных заказчиков с акцентом на диагностику Linux, сетей, баз данных и распределённых инсталляций. Focus on анализ инцидентов и первопричин, автоматизацию на Python/Bash, внедрение обновлений и адаптацию архитектуры под on-premise-эксплуатацию.
Локация: Москва, гибридный офис
Компания
Яндекс 360 — экосистема корпоративных сервисов: Почта, Диск, Документы, Телемост, Мессенджер, Доски, Трекер и Вики. On-premise-направление поставляет эти сервисы в закрытые контуры крупных корпоративных заказчиков.
Что делать
- Разбирать сложные инциденты, анализировать логи, дампы сетевого трафика, работу ядра Linux и баз данных, выполнять Root Cause Analysis.
- Помогать заказчикам разворачивать и обновлять инсталляции Яндекс 360 на их серверах в гетерогенных инфраструктурах.
- Писать скрипты и инструменты на Python и Bash, создавать плейбуки для автоматизации.
- Отвечать за надёжность систем и передавать разработчикам обратную связь для адаптации архитектуры сервисов под on-premise-эксплуатацию.
- Взаимодействовать с техническими специалистами и системными администраторами крупных заказчиков.
Требования
- От 5 лет опыта.
- Знание PostgreSQL и S3-совместимых хранилищ, умение писать простые SQL-запросы и читать логи баз данных.
- Глубокое понимание Linux, включая память, процессы, дисковую подсистему и namespaces; опыт работы с strace, tcpdump, lsof и perf.
- Знание сетей, OSI, TCP/IP, DNS, балансировки L3/L7 и методов диагностики сетевых проблем.
- Навыки программирования на Python и уверенное владение Bash; понимание Docker, Containerd и опыт работы с Kubernetes.
- Готовность погружаться в проблемы клиентов и решать их, а не только закрывать тикеты.
Хорошо, если есть
- Опыт работы SRE, DevOps или системным администратором в high-load-проектах.
- Знание Ansible, Prometheus, Grafana и ELK-стека.
- Понимание CI/CD-процессов.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →