вышел лучший бенчмарк?
DeepSWE. бенчмарку больше двух недель, все уже высказались: гпт первый, клод догоняет, китайцы внизу. стоит ли брать что-то кроме гпт, если он ещё и дешевле всех на задачу?
у всех одна проблема — модель сертифицирует себя, не зная про скрытые тесты. китайцев не тренировали под harness'ы.
deepswe меряет одну вещь — насколько модель натренирована работать в mini-swe-agent. показали на claude и gpt: на родном harness'е результат падает. это не про общий интеллект и кодинг.
новый бенчмарк, вышедший во время написания поста — SWE-marathon, в котором даже предусмотрена защита от reward hacking.
бенчмарк кажется лучше, но часто виновата сама среда: терминал багался и команды не отправлялись.
бенчмарки часто противоречат друг другу: где-то claude code — хороший harness, где-то нет. разногласия не только тут, но и в Terminal-Bench 2.0, AA-Coding-Bench и других подобных.
5
2June 10, 2026 665 4 2




