катафейка: post #88 — TG.ME

вышел лучший бенчмарк?

DeepSWE
. бенчмарку больше двух недель, все уже высказались: гпт первый, клод догоняет, китайцы внизу. стоит ли брать что-то кроме гпт, если он ещё и дешевле всех на задачу?

у всех одна проблема — модель сертифицирует себя, не зная про скрытые тесты. китайцев не тренировали под harness'ы.

deepswe меряет одну вещь — насколько модель натренирована работать в mini-swe-agent. показали на claude и gpt: на родном harness'е результат падает. это не про общий интеллект и кодинг.

новый бенчмарк, вышедший во время написания поста — SWE-marathon, в котором даже предусмотрена защита от reward hacking.

бенчмарк кажется лучше, но часто виновата сама среда: терминал багался и команды не отправлялись.

бенчмарки часто противоречат друг другу: где-то claude code — хороший harness, где-то нет. разногласия не только тут, но и в Terminal-Bench 2.0, AA-Coding-Bench и других подобных.
❤5👎2
June 10, 2026 806 4