Оценка Fale-5 с циферками.
Если хотите лайкнуть - лучше сначала репостните.
Напомню, пока эта штука была доступна я успел прогнать свой бенчмарк, (на который пожёг свои лимиты), но не успел подвести итоги с циферками в руках, только качественные выводы и вот наконец-то подъехало сравнение количественное и подробный анализ использованных стратегий.
Спонсором и таким образом соавтором этого выпуска является Chill guy (@import_sklearn ) Подогнавший мне для валидации и подведения итогов свой сервер с 3090-ыми, и даже свои лимиты на погонять, пока я ждал сброса последствий Fablе-овой расточительности.
Итак, сначала итоговая таблица:
Итоговые очки / Штрафные баллы за мухлёж или непослушание / Модель + окружение
55.49 0 claude-code+opus-4.6 + Human in the Loop
42.63 28 claude-code+fable-5+kcg-config
31.48 9 claude-code+opus-4.7-kcg
28.97 2 claude-code+opus-4.6
Модель прямо таки сильно, скачком выпрыгнула вперёд относительно других тоже топовых для своего времени моделей. Улучшила рекордные результаты на обеих подзадачах. Так что теперь у меня есть спарсифицированное ядро обгоняющее dense умножение x15 на задаче тренеровки, и x15.3 на инференсе для больших моделей. Теоретический порог по флопсам, напомню x33 то есть прямо совсем близко. Может она бы и чуть-чуть больше набрала, если бы сразу находилась в подходящем окружении.
Модель проявила просто чудеса самоконтроля. Нахватала штрафов за остановку без команды почитав свою ситуацию безнадёжной, но при этом всего два штрафных очка за хакинг реварда и несколько раз случайно ревард хакнув сама себя ловила за руку и откатывалась. Что сильно упрощает работу по сравнению с 4.7 где большая часть времени была потрачена на ловлю слишком хитрой модели за руку во множестве мест.
Модель всё ещё сильно проигрывает HitL в способности разумно откатиться сильно назад на принципиально другое архитекутурное решение. Именно здесь главная точка роста, если вы строите свой авторесёрч цикл или вообще заниметесь Loop инженерингом. Несколько такиех откатов она сделала самостоятельно (не все удачные), то есть и тут некий самостоятельный рост идёт.
В общем, помянем! Хорошая была модель. ОДнозначно стоила своих денег. Предположу не меньше полугода уйдёт у китайцев чтобы её догнать, и не факт что веса они при этом не выложат.
И если вы ещё не занялись луп инженирингом - вы отстаёте от стремительно несущегося поезда. Итоговый машинный отчёт в приложении для интересующихся.
P.P.S. Подробные отчёты по каждой подзадаче и получившиеся ядра доступны по запросу если вам для дела и под честное слово не выкладывать в интернет, не хочу наводнять трейновые датасеты правильными ответами, пока.
P.P.S. Если вы хотите проспонсировать замер и сравнение любимой модели, приятного вам харнеса, или вашего личного авторесёрч-лупа - пишите, но учтите, если платить по токенам, то это довольно не дешево, и на не топовые модели типа не стоит особо рассчитывать.