Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
SRE-инженер в команду AI-агентов Фантеха (AI): Эксплуатация работающих AI-сервисов и подготовка инфраструктуры для новых микросервисов с акцентом на надёжность, наблюдаемость и автоматизацию. Фокус на развитии мониторинга и SLI/SLO, проектировании отказоустойчивых решений, диагностике инцидентов и создании инфраструктурных инструментов на Python.
Локация: гибридный формат, офисы в Москве и Санкт-Петербурге
Компания
Фантех — бизнес-юнит Яндекса, развивающий развлекательные онлайн-сервисы Яндекс Плюса и AI-продукты для поиска и рекомендации контента.
Что делать
- Обеспечивать надёжность работающих AI-сервисов, участвовать в дежурствах, диагностировать инциденты и устранять их первопричины.
- Развивать мониторинг, логирование и алертинг, внедрять практики SLI, SLO и error budget.
- Проектировать инфраструктуру новых микросервисов, настраивать развёртывание и интеграцию с общей платформой, включая Yandex Deploy и IDP.
- Писать инструменты на Python, развивать CI/CD и автоматизировать создание и настройку инфраструктуры.
- Участвовать в проектировании отказоустойчивых решений, разборе инцидентов и улучшении инженерных практик.
Требования
- От 3 лет опыта.
- Опыт работы с Linux или Unix-системами, диагностики системных проблем, сетевыми протоколами, DNS, HTTP, балансировкой и маршрутизацией.
- Навыки построения мониторинга, анализа логов и настройки алертов.
- Программирование на Python и автоматизация инфраструктурных задач.
- Опыт с Kubernetes, Terraform, Ansible или аналогами, CI/CD, облачной инфраструктурой, базами данных, очередями и кешами.
- Понимание отказоустойчивых распределённых систем, SLI/SLO и готовность участвовать в дежурствах и обсуждать архитектурные решения с разработчиками.
Хорошо, если есть
- Опыт эксплуатации высоконагруженных систем и capacity planning.
- Практический опыт внедрения SLI, SLO и error budget.
- Опыт обеспечения надёжности сервисов, взаимодействующих с LLM или внешними API.
- Знание особенностей наблюдаемости и диагностики AI-систем.
- Опыт нагрузочного тестирования и оптимизации производительности.
Культура и преимущества
- Работа в команде разработчиков AI-продуктов, включая AI-собеседника Люмен.
- Влияние на проектирование, запуск и эксплуатацию новых продуктов.
- Совместная работа с разработчиками над инженерными практиками и надёжностью сервисов.
- Участие в развитии внутренних инструментов и платформы Яндекса.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Похожие вакансии
NDA
3 дня назад
SRE Engineer
Т-Банк
3 дня назад
Site Reliability Engineer (Fintech)
CloudLinux
4 дня назад
Senior Database Reliability Engineer (Dbre)
5 000 - 10 000$
Голодаев Александр Александрович
4 дня назад
Ведущий DevOps-инженер / SRE (Fintech)
220 000 - 300 000₽
Lamoda
3 дня назад
Инженер по обеспечению надежности генеративного ИИ (LLM)
300 000 - 450 000₽
VK
6 дней назад