У Microsoft вышла очень показательная работа про надёжность… — Машиннное обучение | Наука о данных Библиотека — TG.ME

У Microsoft вышла очень показательная работа про надёжность AI-агентов.

Лучший агент в эксперименте смог успешно выполнить 91% бизнес-задач хотя бы один раз.

Но если требовать, чтобы он выполнял ту же задачу правильно каждый раз, показатель падал до 25%.

И есть ещё более неприятная часть.

В 4 из 5 неудачных запусков агент:
— вежливо завершал работу
— вызывал инструмент записи в базу
— сообщал, что всё выполнено

Но состояние базы показывало обратное.

То есть по финальному ответу агента проблема вообще могла быть незаметна.

Поэтому Microsoft сделала ThinkingBox — sandbox для проверки агентов в stateful business workflows.

Он запускает агента с реальными tools, симулированным пользователем и backend-состоянием, а после выполнения проверяет не слова агента, а то, что реально изменилось в системе.

Очень правильная метрика для production-агентов:

не «смог ли он сделать это хотя бы раз», а
**«делает ли он это стабильно при повторных запусках».**


Paper:
https://arxiv.org/abs/2608.19741

“One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows”
❤6👍4🔥2
August 23, 2026 1.3K 49