Ребята дали четырём передовым моделям (Fable vs новые GPT) немного поработать: собрать симуляцию полёта NASA HL-20 — шесть степеней свободы, аэродинамика из 170 таблиц продувок — плюс четыре задачи от уравнений состояния до релятивистской динамики. Сверка относитльно независимого эталона.
Claude выиграл - доля правильно произведенных расчётов - 89% против 73% у худшего GPT-5.6. Промах в конечной точке траектории: 0.4 метра у Fable, 19, 400 и примерно 500 у остальных. Цена победы $9.60 за прогон; GPT-5.6-Sol взял 81,5% за $1.74.
Все провалы похожи: модель проверяет сама себя. Sol перепутал две похожие скорости из условия задачи и точно подогнал расчёт под неверную — все его проверки сошлись, потому что сверяли ответ с его же ошибкой, а не с условием.
Terra молча сократила время симуляции с 5 до 3 секунд и себя проверяла на том же укороченном отрезке — накопивгшуюся ошибку никто не увидел. Fable нарочно пытался ломать собственные формулы, чтобы убедиться, что его тесты работают. Похоже поэтому и выиграл.
Второй эксперимент: та же модель в их харнессе Dyad с принудительной верификацией набрала 0.899, в стоковом coding-агенте — 0.533 и ноль на релятивистской задаче. Формула авторов: модель — переменная, харнесс — множитель. Авторы исселодвания продают харнесс Dyad, так что мотив формулы очевиден.
Тут я с ними не согласен
Следить за рынком харнессов для меня сейчас — трата времени: универсальные агенты обмениваются фичами с лагом в недели, кто-то новый временами начинает побеждать, остальные догоняют. Кто сегодня лучший? Знаю, многие пытаются сделать свои варианты. Вместо того что бы работать.
Когда появятся новые герои — мы этого не пропустим. Так было сначала с Cursor, потом с Claude Code и наконец то в тулсете закрепился и Codex (мы пользуемся обоими - всмысле обоими одновременно).
Dyad в этот раз выиграл зашитой проверкой, которую агент физически не может пропустить. Это вправильный кейс.
Мы умеем такое с клодом: у Claude Code есть хуки — скрипты, которые блокируют действие агента, если проверка не прошла. Плюс гит-хуки, которые не дают закоммитить сломанный файл. Работает.
Модели меняем постоянно. Проверки, которые агент не может обойти, собираем каждый день.
Сергей Булаев AI 🤖 - об AI и не только

7
21
3
July 31, 2026 5.4K 3 48