Эвалы агента: когда хватит LLM-судьи, а когда нужен оценщик со схемой
Команда гоняет эвалы агента на одних и тех же трейсах, а оценки раз за разом плывут: сегодня поведение прошло проверку, завтра тот же прогон получил другое число. Возникает вопрос — оставлять судью-модель или переходить на что-то более предсказуемое.
LLM-судья берёт неструктурированный трейс и рассуждает над ним. Это его сильная сторона: не нужно заранее описывать схему, можно спросить про сложный критерий словами. Платим за это скоростью, ценой и нестабильностью — по данным материала, «цена гибкости - скорость, стоимость и нестабильность».
Типизированный оценщик (в материале — Jev) устроен иначе: он не генерирует текст, а принимает структурированное состояние и возвращает типизированные ответы вместе с вероятностями. В узком тесте LangChain разброс оценок у него оказался в 92-913 раз ниже, чем у LLM-судей, средний вызов длился 0,44 секунды и стоил $0,00035, а весь прогон обошёлся в $0,34 против $28,17 у Claude. Условие — трейсы надо нормализовать в схему, и класс задач уже.
Похожая мысль есть в материале про to-do-списки агентов: создание списка — генерация нового текста, а обновление статуса — условное редактирование. Разные куски работы лучше ложатся на разные инструменты, и оценка тут не исключение.
Правило выбора простое. Нужен свободный разбор неструктурированного текста и сложные критерии словами — берите LLM-судью. Нужен непрерывный скоринг или классификация поведения на большом объёме и вы готовы привести трейсы к схеме — смотрите на типизированный оценщик. Цифры LangChain получены в узком тесте: проверяйте свой разброс, цену и время на своём наборе трейсов.
Учебный пример: команда прогоняет эвалы на каждый pull request. Сначала она сравнивает на одном наборе трейсов разброс оценок, среднее время вызова и суммарную стоимость двух судей, и только потом решает, что оставить в постоянной проверке.
Разбор 1 · Разбор 2
AiManual - База знаний по ИИ
21 сен 2026 12:30
Комментариев пока нет.