Назад

AI Agent Reliability Engineer / Harness Engineer (Agentic AI)

100 000
Формат работы
remote (только Uzbekistan)
Тип работы
fulltime
Грейд
middle
Английский
b1
Страна
Uzbekistan
hhВакансия с HeadHunter. Контакт ведёт на hh.ru

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
AI Agent Reliability Engineer / Harness Engineer (Agentic AI): Построение системы оценки качества автономных ИИ-агентов для многошаговых B2B-процессов с акцентом на автоматизированные evals, regression suites и release gates. Focus on анализе execution traces и tool calls, red teaming, безопасных границах поведения и наблюдаемости production-систем.

Локация: удалённая работа, Ташкент; синхронное окно команды — с 10:00–11:00 до 20:00–21:00 МСК

Зарплата: от 100000 RUR в месяц, до вычета налогов

Компания

B2B-платформа автономных ИИ-агентов для рынка США, работающих с многошаговыми процессами, документами, перепиской и внешними системами.

Что делать

  • Строить систему оценки качества агентов: критерии успеха, эталонные наборы данных, сценарные тесты и автоматизированные evals.
  • Анализировать execution traces, tool calls, контекст и результаты, превращая сбои в воспроизводимые тесты и системные улучшения.
  • Создавать regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации.
  • Проектировать безопасные границы поведения, approval gates, fallback- и escalation-механизмы.
  • Проводить red teaming и повышать надёжность production-агентов с помощью трассировки, мониторинга, алертов, retry, timeout и idempotency.
  • Развивать переиспользуемый evaluation harness платформы и общие инженерные стандарты.

Требования

  • Production-разработка на Python, опыт создания тестируемых backend-систем, pytest, Docker и CI через GitHub Actions или аналог.
  • Личный опыт проектирования системы оценки недетерминированной системы: автоматизированных evals, сценарных тестов и эталонных наборов.
  • Практический опыт создания LLM-приложений или агентов, включая tool calling, многошаговую оркестрацию, анализ логов и трасс.
  • Статистическая грамотность: размеры выборок, дисперсия и оценка значимости различий между версиями недетерминированной системы.
  • Понимание production-рисков AI: prompt injection, ошибочное использование инструментов, избыточные полномочия, зацикливание и рост стоимости.
  • Английский — B1 или выше.

Хорошо, если есть

  • Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами.
  • LLM-as-a-judge с проверкой качества самой оценки, симуляторы, генераторы тестовых данных и собственные evaluators.
  • Red teaming LLM-систем, AI security и построение guardrails.
  • OpenTelemetry, observability, graceful degradation и incident analysis.

Культура и преимущества

  • Полная занятость и удалённый формат работы.
  • Возможность определять стандарты качества и надёжности агентной платформы.
  • Высокая самостоятельность в выборе подходов и инструментов; оценка по результату.

Процесс найма

  • Вместо стандартного сопроводительного письма требуется разобрать систему, надёжность которой была повышена, и предоставить проверяемые артефакты.
  • Нужно описать подход к оценке многошагового агента и проверке корректности LLM-as-a-judge.
  • Также требуется рассказать о неудачном опыте и причинах, по которым проект не достиг цели.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →