Лучший агент в эксперименте смог успешно выполнить 91% бизнес-задач хотя бы один раз.
Но если требовать, чтобы он выполнял ту же задачу правильно каждый раз, показатель падал до 25%.
И есть ещё более неприятная часть.
В 4 из 5 неудачных запусков агент:
— вежливо завершал работу
— вызывал инструмент записи в базу
— сообщал, что всё выполнено
Но состояние базы показывало обратное.
То есть по финальному ответу агента проблема вообще могла быть незаметна.
Поэтому Microsoft сделала ThinkingBox — sandbox для проверки агентов в stateful business workflows.
Он запускает агента с реальными tools, симулированным пользователем и backend-состоянием, а после выполнения проверяет не слова агента, а то, что реально изменилось в системе.
Очень правильная метрика для production-агентов:
не «смог ли он сделать это хотя бы раз», а
**«делает ли он это стабильно при повторных запусках».**
Paper:
https://arxiv.org/abs/2608.19741
“One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows”



