Moai Team

Что такое AgenticPerformance?

Нет измерений — нет улучшений: Стандарт делает eval-driven development обязательным, а AgenticPerformance (APL) — слой, который это реализует. Он инструментирует любой агентный стек — LangGraph, CrewAI, OpenAI или Claude Agent SDK, да хоть самописный агентный цикл — через OpenTelemetry, нормализуя конвенции OpenInference и gen_ai.* в одну каноническую модель. Поверх этого хранилища трейсов он гоняет golden-set-эвалы на агента с гейтом версий, который блокирует регрессии в CI, автоматически разбирает сбои в стабильные, повторяющиеся от прогона к прогону кластеры с трендами по статистической значимости и ведёт управляемый цикл улучшений — assisted, suggested или автоматический под судьёй — внутри механически enforced-envelope безопасности с откатываемым леджером. Каждый агент получает headless-скоркарту, доступную как API и по MCP.

Области экспертизы

Всё, что нужно, чтобы измерять и улучшать флот агентов — от сырых спанов до управляемого цикла улучшений.

  • Трейсинг нативно на OTel

    Построен на GenAI-конвенциях OpenTelemetry со слоем нормализации, который сводит OpenInference и gen_ai.* к одной канонической модели — инструментируете один раз, рассуждаете о каждом прогоне.

  • Golden-set-эвалы с гейтом в CI

    Обязательный детерминированный базовый набор плюс golden-set на каждого агента — и гейт версий, который блокирует новую версию агента, если она регрессирует относительно предыдущей на замороженном наборе.

  • Кластеры сбоев и тренды

    Упавшие прогоны автоматически разбираются в именованные, стабильные кластеры сбоев, которые живут от прогона к прогону, — а тренды срабатывают только при статистической значимости. Без погони за шумом.

  • Управляемый цикл улучшений

    Три уровня автономии — assisted, suggested и автоматический под судьёй — внутри механически enforced-envelope безопасности: allowlist диффов, контентный guard и полностью обоснованный, откатываемый леджер улучшений.

  • Иммутабельный реестр агентов

    Агенты и content-addressed, неизменяемые версии агентов — каждый трейс, эвал и улучшение привязаны ровно к той версии, которая их породила.

  • Скоркарта на агента

    Headless read-model здоровья каждого агента — оценки эвалов, кластеры сбоев, тренды — доступная как API и по MCP, готовая для дашбордов и fleet-view.

Ещё по Agentic Software

Больше из нашей agentic-практики — стандарт, по которому мы строим, опенсорс-слои, которые его реализуют, и команда, которая всё это запускает.

Связаться с нами

Хотите вшить eval-driven development в свой агентный стек? Расскажите о продукте — покажем, что APL сможет измерять с первого дня.

Сообщение