🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы?
Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага.
Учёные проверили агентов на задачах из открытых научных репозиториев:
* публичные тесты можно использовать для итераций;
* скрытые тесты показывают, действительно ли проблема решена.
Результат удивляет:
Claude Code с Opus-5 проходит 96,64% публичных тестов, но настоящий показатель Pas@1 - всего 47,90%.
Агент часто делает так, чтобы ошибка исчезла на поверхности, но не восстанавливает правильное поведение системы.
📄 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
https://arxiv.org/abs/2608.19799

4
2
1August 25, 2026 971 20