Назад
21 час назад

SRE-инженер в команду AI-агентов Фантеха (AI)

Формат работы
hybrid
Тип работы
fulltime
Грейд
middle
Страна
Russia

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
SRE-инженер в команду AI-агентов Фантеха (AI): Эксплуатация работающих AI-сервисов и подготовка инфраструктуры для новых микросервисов с акцентом на надёжность, наблюдаемость и автоматизацию. Фокус на развитии мониторинга и SLI/SLO, проектировании отказоустойчивых решений, диагностике инцидентов и создании инфраструктурных инструментов на Python.

Локация: гибридный формат, офисы в Москве и Санкт-Петербурге

Компания

Фантех — бизнес-юнит Яндекса, развивающий развлекательные онлайн-сервисы Яндекс Плюса и AI-продукты для поиска и рекомендации контента.

Что делать

  • Обеспечивать надёжность работающих AI-сервисов, участвовать в дежурствах, диагностировать инциденты и устранять их первопричины.
  • Развивать мониторинг, логирование и алертинг, внедрять практики SLI, SLO и error budget.
  • Проектировать инфраструктуру новых микросервисов, настраивать развёртывание и интеграцию с общей платформой, включая Yandex Deploy и IDP.
  • Писать инструменты на Python, развивать CI/CD и автоматизировать создание и настройку инфраструктуры.
  • Участвовать в проектировании отказоустойчивых решений, разборе инцидентов и улучшении инженерных практик.

Требования

  • От 3 лет опыта.
  • Опыт работы с Linux или Unix-системами, диагностики системных проблем, сетевыми протоколами, DNS, HTTP, балансировкой и маршрутизацией.
  • Навыки построения мониторинга, анализа логов и настройки алертов.
  • Программирование на Python и автоматизация инфраструктурных задач.
  • Опыт с Kubernetes, Terraform, Ansible или аналогами, CI/CD, облачной инфраструктурой, базами данных, очередями и кешами.
  • Понимание отказоустойчивых распределённых систем, SLI/SLO и готовность участвовать в дежурствах и обсуждать архитектурные решения с разработчиками.

Хорошо, если есть

  • Опыт эксплуатации высоконагруженных систем и capacity planning.
  • Практический опыт внедрения SLI, SLO и error budget.
  • Опыт обеспечения надёжности сервисов, взаимодействующих с LLM или внешними API.
  • Знание особенностей наблюдаемости и диагностики AI-систем.
  • Опыт нагрузочного тестирования и оптимизации производительности.

Культура и преимущества

  • Работа в команде разработчиков AI-продуктов, включая AI-собеседника Люмен.
  • Влияние на проектирование, запуск и эксплуатацию новых продуктов.
  • Совместная работа с разработчиками над инженерными практиками и надёжностью сервисов.
  • Участие в развитии внутренних инструментов и платформы Яндекса.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →