Назад

Не получаете ответ?

Вакансия опубликована 13 дн. назад - шансы на ответ снижаются.

обновлено 13 дней назад

Customer Reliability Engineer (on-premise)

Формат работы
hybrid
Тип работы
fulltime
Грейд
senior
Страна
Russia
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Customer Reliability Engineer (on-premise): Обеспечение надёжной работы сервисов Яндекс 360 в закрытых контурах корпоративных заказчиков с акцентом на диагностику Linux, сетей, баз данных и распределённых инсталляций. Focus on анализ инцидентов и первопричин, автоматизацию на Python/Bash, внедрение обновлений и адаптацию архитектуры под on-premise-эксплуатацию.

Локация: Москва, гибридный офис

Компания

Яндекс 360 — экосистема корпоративных сервисов: Почта, Диск, Документы, Телемост, Мессенджер, Доски, Трекер и Вики. On-premise-направление поставляет эти сервисы в закрытые контуры крупных корпоративных заказчиков.

Что делать

  • Разбирать сложные инциденты, анализировать логи, дампы сетевого трафика, работу ядра Linux и баз данных, выполнять Root Cause Analysis.
  • Помогать заказчикам разворачивать и обновлять инсталляции Яндекс 360 на их серверах в гетерогенных инфраструктурах.
  • Писать скрипты и инструменты на Python и Bash, создавать плейбуки для автоматизации.
  • Отвечать за надёжность систем и передавать разработчикам обратную связь для адаптации архитектуры сервисов под on-premise-эксплуатацию.
  • Взаимодействовать с техническими специалистами и системными администраторами крупных заказчиков.

Требования

  • От 5 лет опыта.
  • Знание PostgreSQL и S3-совместимых хранилищ, умение писать простые SQL-запросы и читать логи баз данных.
  • Глубокое понимание Linux, включая память, процессы, дисковую подсистему и namespaces; опыт работы с strace, tcpdump, lsof и perf.
  • Знание сетей, OSI, TCP/IP, DNS, балансировки L3/L7 и методов диагностики сетевых проблем.
  • Навыки программирования на Python и уверенное владение Bash; понимание Docker, Containerd и опыт работы с Kubernetes.
  • Готовность погружаться в проблемы клиентов и решать их, а не только закрывать тикеты.

Хорошо, если есть

  • Опыт работы SRE, DevOps или системным администратором в high-load-проектах.
  • Знание Ansible, Prometheus, Grafana и ELK-стека.
  • Понимание CI/CD-процессов.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →