AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы?… — Машиннное обучение | Наука о данных Библиотека — TG.ME

🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы?

Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага.

Учёные проверили агентов на задачах из открытых научных репозиториев:

* публичные тесты можно использовать для итераций;
* скрытые тесты показывают, действительно ли проблема решена.

Результат удивляет:

Claude Code с Opus-5 проходит 96,64% публичных тестов, но настоящий показатель Pas@1 - всего 47,90%.

Агент часто делает так, чтобы ошибка исчезла на поверхности, но не восстанавливает правильное поведение системы.


📄 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
https://arxiv.org/abs/2608.19799
👍4❤2🔥1
August 25, 2026 971 20