Назад

AI Agent Reliability Engineer / Harness Engineer Agentic AI

100 000
Формат работы
remote (только Kazakhstan)
Тип работы
fulltime
Грейд
senior
Английский
b1
Страна
Kazakhstan
hhВакансия с HeadHunter. Контакт ведёт на hh.ru

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
AI Agent Reliability Engineer / Harness Engineer Agentic AI (Python/LLM): Построение системы оценки качества и надёжности автономных ИИ-агентов для многошаговых процессов с акцентом на automated evals, regression suites, release gates и анализ execution traces. Focus on проектирование безопасных границ поведения, red teaming, мониторинг production-агентов и предотвращение регрессий по качеству, стоимости и latency.

Локация: удалённая работа, город/регион — Астана. Синхронное окно команды: с 10:00–11:00 до 20:00–21:00 МСК.

Зарплата: от 100000 RUR в месяц, до вычета налогов.

Компания

HeadHunter развивает B2B-платформу автономных ИИ-агентов для рынка США. Агенты выполняют многошаговые рабочие процессы с документами, перепиской и действиями во внешних системах, включая электронную почту, CRM и календари.

Что делать

  • Строить систему оценки качества агентов: критерии успеха, эталонные наборы данных, сценарные тесты и автоматизированные evals.
  • Анализировать execution traces, tool calls, контекст и результаты, превращая сбои в воспроизводимые тесты и системные улучшения.
  • Разрабатывать regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации.
  • Проектировать безопасные границы поведения, контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы.
  • Проводить red teaming для prompt injection, подмены контекста, ошибочных tool calls, зацикливания и превышения полномочий.
  • Повышать надёжность production-агентов через трассировку, мониторинг, алерты, retry, timeout, idempotency и восстановление.

Требования

  • От 3 до 6 лет опыта.
  • Production-разработка на Python, включая тестируемые backend-системы, pytest, Docker и CI через GitHub Actions или аналог.
  • Опыт самостоятельного проектирования системы оценки недетерминированной системы: automated evals, сценарные тесты и эталонные наборы.
  • Практический опыт создания LLM-приложений или агентов, tool calling, оркестрации многошаговых сценариев и анализа логов и трасс.
  • Статистическая грамотность: размеры выборок, дисперсия и значимость различий между версиями недетерминированной системы.
  • Понимание рисков production AI и английский язык уровня B1 или выше.

Хорошо, если есть

  • Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами.
  • LLM-as-a-judge с проверкой качества самой оценки, симуляторы, генераторы тестовых данных и собственные evaluators.
  • Red teaming LLM-систем, AI security и построение guardrails.
  • OpenTelemetry, observability, graceful degradation и incident analysis.

Культура и преимущества

  • Полная занятость и удалённый формат работы.
  • Возможность определять стандарты качества и надёжности агентной платформы.
  • Высокая самостоятельность в выборе подходов и инструментов; оценка по результату.

Процесс найма

  • На интервью потребуется подробно рассказать о личном опыте и предоставить верифицируемые артефакты: GitHub, eval-наборы, evaluators или технические статьи.
  • Нужно объяснить, как оценивать многошагового агента без простого сравнения результата с эталоном и как проверять корректность LLM-as-judge.
  • Также требуется описать неудачный проект или решение и причины неудачи.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →