The ExtremeCode Times: post #1505 — TG.ME

Мда ёпта, 12 с копейками часов на 4B модельку и 6 млн слитых токенов на судейку. В бенче ровно 100 вопросов.

В ходе предварительных тестов понял, что вообще нет никакого смысла гонять по базовым алгоритмическим вопросам. С этими задачами даже 4B модель зажатая до одного бита прекрасно справится, а если миксовать сложные и простые вопросы, то просто размоем результаты.

В общем, зафигачил пока датасет с хардкорными задачками уровня мидл-сеньор по стеку JS/Nodejs/Express/React/Mongodb/Postgresql/Redis.

И что вы мне сделаете? Я вообще-то G0VNO изобрел, на какой стек мозгов хватило, тот и гоняю.

Помимо саммари, еще складирую все решения судейки отдельно, что б можно было посмотреть че там происходит. Конкретно у Qwen3.5 4B жОские проблемы со следованием инструкций, ну и естественно ей не хватает параметров

P.S.
По шкале вайб скор, модель должна хотя бы 60% в среднем набрать, в таком случае она с большей частью задач справилась, хоть и с небольшими, но терпимыми, косяками
❤102👍27🐳22🍒12✍3🔥2🗿2
August 6, 2026 29.1K 43 28