7 дней назад
AI Agent Reliability Engineer / Harness Engineer (Agentic AI)
100 000₽
hhВакансия с HeadHunter. Контакт ведёт на hh.ru
Мэтч & Сопровод
Покажет вашу совместимость и напишет письмо
Описание вакансии
Текст:
TL;DR
AI Agent Reliability Engineer / Harness Engineer (Agentic AI): Построение системы оценки качества автономных ИИ-агентов для многошаговых B2B-процессов с акцентом на автоматизированные evals, regression suites и release gates. Focus on анализе execution traces и tool calls, red teaming, безопасных границах поведения и наблюдаемости production-систем.
Локация: удалённая работа, Ташкент; синхронное окно команды — с 10:00–11:00 до 20:00–21:00 МСК
Зарплата: от 100000 RUR в месяц, до вычета налогов
Компания
B2B-платформа автономных ИИ-агентов для рынка США, работающих с многошаговыми процессами, документами, перепиской и внешними системами.
Что делать
- Строить систему оценки качества агентов: критерии успеха, эталонные наборы данных, сценарные тесты и автоматизированные evals.
- Анализировать execution traces, tool calls, контекст и результаты, превращая сбои в воспроизводимые тесты и системные улучшения.
- Создавать regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации.
- Проектировать безопасные границы поведения, approval gates, fallback- и escalation-механизмы.
- Проводить red teaming и повышать надёжность production-агентов с помощью трассировки, мониторинга, алертов, retry, timeout и idempotency.
- Развивать переиспользуемый evaluation harness платформы и общие инженерные стандарты.
Требования
- Production-разработка на Python, опыт создания тестируемых backend-систем, pytest, Docker и CI через GitHub Actions или аналог.
- Личный опыт проектирования системы оценки недетерминированной системы: автоматизированных evals, сценарных тестов и эталонных наборов.
- Практический опыт создания LLM-приложений или агентов, включая tool calling, многошаговую оркестрацию, анализ логов и трасс.
- Статистическая грамотность: размеры выборок, дисперсия и оценка значимости различий между версиями недетерминированной системы.
- Понимание production-рисков AI: prompt injection, ошибочное использование инструментов, избыточные полномочия, зацикливание и рост стоимости.
- Английский — B1 или выше.
Хорошо, если есть
- Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами.
- LLM-as-a-judge с проверкой качества самой оценки, симуляторы, генераторы тестовых данных и собственные evaluators.
- Red teaming LLM-систем, AI security и построение guardrails.
- OpenTelemetry, observability, graceful degradation и incident analysis.
Культура и преимущества
- Полная занятость и удалённый формат работы.
- Возможность определять стандарты качества и надёжности агентной платформы.
- Высокая самостоятельность в выборе подходов и инструментов; оценка по результату.
Процесс найма
- Вместо стандартного сопроводительного письма требуется разобрать систему, надёжность которой была повышена, и предоставить проверяемые артефакты.
- Нужно описать подход к оценке многошагового агента и проверке корректности LLM-as-a-judge.
- Также требуется рассказать о неудачном опыте и причинах, по которым проект не достиг цели.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →
Похожие вакансии
Копылов Евгений Анатольевич
7 дней назад
AI Agent Reliability Engineer / Harness Engineer Agentic AI
100 000₽
Копылов Евгений Анатольевич
7 дней назад
AI Agent Engineer (AI)
150 000₽
22 часа назад
Python-разработчик (AI)
100 000 - 120 000₽
Копылов Евгений Анатольевич
7 дней назад
AI Agent Engineer (AI)
150 000₽
ELEMENT
6 дней назад
Junior AI/ML-инженер
100 000 - 120 000₽
Копылов Евгений Анатольевич
7 дней назад
Agent Knowledge Engineer (AI)
100 000₽