Мда ёпта, 12 с копейками часов на 4B модельку и 6 млн слитых токенов на судейку. В бенче ровно 100 вопросов.
В ходе предварительных тестов понял, что вообще нет никакого смысла гонять по базовым алгоритмическим вопросам. С этими задачами даже 4B модель зажатая до одного бита прекрасно справится, а если миксовать сложные и простые вопросы, то просто размоем результаты.
В общем, зафигачил пока датасет с хардкорными задачками уровня мидл-сеньор по стеку JS/Nodejs/Express/React/Mongodb/Postgresql/Redis.
И что вы мне сделаете? Я вообще-то G0VNO изобрел, на какой стек мозгов хватило, тот и гоняю.
Помимо саммари, еще складирую все решения судейки отдельно, что б можно было посмотреть че там происходит. Конкретно у Qwen3.5 4B жОские проблемы со следованием инструкций, ну и естественно ей не хватает параметров
P.S.
По шкале вайб скор, модель должна хотя бы 60% в среднем набрать, в таком случае она с большей частью задач справилась, хоть и с небольшими, но терпимыми, косяками

102
27
22
3
2
2August 6, 2026 29.1K 43 28