сам эксперимент.
взяли матрицу из 6 учеников и 11 учителей:
▸ ученики: qwen-4b, qwen-30b, qwen-235b, llama8b, llama-70b, deepseek
▸ учителя: те же + gpt-4.1-nano, claude-haiku-4.5, gemma-4-26b-a4b-it, claude-opus-4.7, gpt-5.5
на диагонали матрицы — self-distillation, где ученик и учитель совпадают (это контрольная точка).
тренировка:
тренировали LoRA на ответах учителя к Alpaca chat dataset (простенький датасет без сложных вопросов для тренировки через учителей упомянутых выше). замеряли на четырёх бенчмарках: IFEval, MMLU, MATH-500, Olympiads. датасет тренировки полностью не связан с эваляционными задачами — это важно, потому что любые улучшения/деградации возникают не из переноса знаний из домена, а из общего эффекта файнтюна на модель.
- что подтвердилось?
деградация реальна, и она избирательна:
▸IFEval (instruction following) и MMLU (multiple choice) — почти не меняются
▸MATH-500 и Olympiads (требуют длинных reasoning-цепочек) — проседают, причём чем сложнее задача внутри MATH-500, тем сильнее просадка
модель сохраняет знания на задачах с коротким ответом и теряет их на задачах, требующих развёрнутого рассуждения. в моих UGI сравнениях это было заметно по тому что world model упал на 8 пунктов, на multiple-choice бенчмарках (hellaswag/arc/winogrande) автор дистиллята показывал +2-4%. эти "плюсы" и "минусы" — не противоречие. это разные оси бенчмарков.
знания вмещаются — модель не потеряла MMLU. ломается не контейнер знаний. ломается способ доступа к ним.
деградируют сильно именно qwen и deepseek. llama8b и llama70b как ученики почти не теряют способности, даже от чужих учителей. вероятная причина — у qwen очень характерный latex/markdown reasoning-стиль, который легко "сломать" чужим, а llama сам по себе стилистически более нейтрален.
интересная часть:
автор называет это reasoning style mismatch. модели обучают думать в собственной логике: какие фразы, какая последовательность шагов, какие проверки (LaTeX vs plain, markdown vs prose, шаги через "Step 1:" vs через "let me think about..."). qwen3-4b в чате и в математике структурирует ответы в LaTeX/markdown. после файнтюна на llama-8b qwen3-4b перестаёт это делать, потому что llama так не пишет. при этом сам Qwen натренирован думать только в латех-стиле — и в чужом стиле он рассуждает плохо.
ещё один эксперимент: автор обучил одну модель сразу на двух стилях — на её собственных ответах под меткой A и на ответах llama-8b под меткой B. потом задавал ей вопросы то с одной меткой, то с другой. под A — отвечает нормально, под B — глупеет. одна и та же модель, разный результат от метки. значит модель её способ думать никуда не делся — просто чужой стиль лежит рядом и активируется когда триггер подходящий.
окончательный вывод про huggingface дистилляты:
▸они не подменяют знания, а накладывают чужой стиль поверх родной reasoning-процедуры
▸это даёт прирост на multiple-choice и стилистических бенчмарках, потому что новый стиль красивее
▸это даёт просадку на задачах с открытым reasoning'ом — особенно в математике, олимпиадных задачах и долгих логических цепочках
▸эффект контекстный. но в реальных задачах условия совпадают почти всегда: ты пишешь промпт похожий на тот, на котором модель учили — и попадаешь в плохое рассуждение.
позиция "берите базовые модели" остаётся. не "знания не влезли" — знания на месте. сломалось другое: у модели был свой способ думать, и его поверх замазали чужим, который ей не подходит.
если всё-таки хочется получить стиль Opus на маленькой модели — есть способ не сломать логику. сначала обучаешь её на чужих ответах, потом вторым проходом дообучаешь на её собственных ответах, чтобы вернуть родной способ думать. знаний это не добавит, но хотя бы не сломает то, что уже работало.
в комментариях красивые графики с расследования