Отчёт показывает приличную точность, а задача срывается на повторе
Вы смотрите на отчёт по агенту: больше половины задач решается, цифра приличная. Но в работе одна и та же задача сегодня проходит, а завтра срывается — хотя инструкцию никто не менял.
Причина в том, что средний процент отвечает на вопрос «сколько агент решает в среднем», а не «решит ли он эту задачу снова». В отчёте ReAct-агент на GPT-4.1 в бенчмарке AppWorld даёт 77,4% успеха в среднем по пяти прогонам каждой задачи. Но если прогнать те же задачи пять раз подряд, все пять попыток успешны только для 53,0% задач.
Разрыв объясняется просто. Задача решена в 4 прогонах из 5: средняя точность учитывает её как 0,8 успеха, а доля задач, решённых во всех пяти, для неё ноль — стабильно агент её не решает. То есть высокая средняя цифра может скрывать рваную повторяемость.
Pass^k — это доля задач, решённых во всех k прогонах; метрику ввели авторы IBM Research, чтобы измерять стабильность. Pass^k никогда не превышает среднюю точность, а разницу между ними называют consistency gap. Чем она больше, тем больше надёжности теряется на повторах.
Учебный пример проверки: возьмите 10 однотипных задач и прогоните каждую 5 раз. Посчитайте два числа — среднюю точность по всем прогонам и долю задач, успешных во всех пяти. Большой разрыв говорит, что агент нестабилен, даже если первая цифра выглядит хорошо.
После правок контекста повторяйте замер и оставляйте изменение только там, где доля полностью успешных задач выросла, а средняя точность не упала.
Разбор
AiManual - База знаний по ИИ
16 сен 2026 12:30
Комментариев пока нет.