катафейка: post #68 — TG.ME

⁠ катафс этим поцом не общаемся - https://huggingface.co/DavidAU/Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED
сейчас мое мнение по поводу "opus/gemini/gpt/kimi/glm/... reasoning" моделей иное.

ранее, как и большинство поверхностно знающих о языковых моделях людей и об их файнтюне — я думала, что эти opus-ризонинги реально помогают моделям составлять цепочки рассуждений. истина не так уж и проста, эти тюны и вправду делают модели похожими по поведению на opus.

проблема в том, что модель не учится думать — она учится выглядеть так, будто думает. будто копирует почерк, но знаний на самом деле не прибавляется.

посмотрев на результаты qwen3.5-27b-claude-opus-4.6-distill в ugi leaderboard, стало понятно что происходит на самом деле. по знаниям — world model упал на 8 пунктов, pop culture на 4, общий ugi score просел с 22 до 16. модель стала тупее. зато writing вырос на 3 пункта и стало больше диалогов в ответах. то есть модель научилась красиво оформлять ответы в стиле claude, но забыла часть того, что знала.

а на карточке модели автор показывает бенчмарки hellaswag, arc, winogrande, и там +2-4%. звучит как улучшение. но эти бенчмарки — это тесты с вариантами ответа, где модели нужно просто выбрать из четырёх. пошаговый стиль рассуждений claude помогает лучше выбирать. а когда нужно самой вспомнить и применить знания в реальных задачах — качество ухудшается.

2100 примеров рассуждений от opus — это не дистилляция. это стилевой файнтюн. настоящая дистилляция это сотни тысяч примеров, а тут просто кормежка 2к ответов claude с припиской "distill".

и это не проблема конкретно этой модели — это паттерн. каждый раз, когда кто-то берёт маленькую модель и дообучает её на выходах большой, получается одно и то же: модель начинает звучать умнее, но быть умнее она не начинает. 27 миллиардов параметров физически не могут вместить то что знает модель на сотни миллиардов. стиль копируется, знания — нет. это можно назвать reward-хакингом, но про это пост отдельный, если будет.

конкретно сейчас произошёл бум таких дистилляций у моделей gemma4 и qwen3.5. такой обмен стиля на знания того не стоит — используйте базовые модели вместо этих подделок. забавно, что по запросу "opus" на hugging face можно увидеть 8к+ моделей, и по крайней мере первые 3 страницы выдачи составляют именно они. люди тратят свои деньги и ресурсы на обучение этих моделей, которые ничего не стоят.
👍111
April 12, 2026 350