Соскучились по новым законам скейлинга? Их есть у меня! Для более… — gonzo-обзоры ML статей — TG.ME

Соскучились по новым законам скейлинга? Их есть у меня!
Для более критического восприятия добавил прожарку. Полезно?

Skaling: Chinchilla’s Exponents Meet Kaplan’s Coupling
Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja
Paper: https://arxiv.org/abs/2608.07222
Code: https://github.com/facebookresearch/lingua

# TL;DR

ЧТО сделали: Авторы представляют закон Skaling — обобщённую математическую формулу скейлинга нейросетей, которая связывает размер модели N и объём данных D через единый внешний показатель взаимодействия k. В дополнение к математической формуле в работе предлагается стратегия редкой профилирующей сетки в форме буквы «L» («L-shape grid»), которая ограничивает пробные запуски предобучения узкими границами с низким расходом вычислительных ресурсов.

ПОЧЕМУ это важно: Стандартные аддитивные законы скейлинга, включая широко используемый закон Шиншиллы (Chinchilla law), предполагают, что размер модели и объём данных влияют на лосс независимо, искусственно обнуляя их смешанную частную производную. Из-за этого математического изъяна возникают систематические ошибки прогнозирования в крайних режимах (при острой нехватке данных или сильном переобучении). Skaling устраняет эти краевые смещения, снижая среднюю абсолютную ошибку в процентах (MAPE) экстраполяции в 1.5-3 раза и одновременно сокращая вычисления на эмпирические эксперименты примерно в 10 раз.

Для практиков: Распределение многомиллионных бюджетов на обучение передовых LLM опирается на прогнозирование итогового качества модели по небольшим пилотным запускам. Традиционные формулы скейлинга делают ошибочное допущение: рост размера модели и увеличение объёма данных действуют на снижение лосса абсолютно независимо. Введение всего одного параметра взаимодействия в законе Skaling убирает ошибки на границах. При этом, поскольку связанная поверхность лосса зафиксирована по своим краям, разработчики могут точно предсказывать результаты крупномасштабного обучения с помощью серии мелких экспериментов, выстроенных вдоль L-образной сетки, снижая накладные расходы на эксперименты на порядок.

Разбор тут: https://t.me/gonzo_ML_podcasts/4792
Прожарка тут: https://t.me/gonzo_ML_podcasts/4793
arXiv.org
Skaling: Chinchilla's Exponents Meet Kaplan's Coupling
Neural scaling laws are foundational for language model development, yet standard formulations systematically under- and overestimate loss at data-scarce and overtraining extremes. This failure...
👍8🔥3❤1
August 16, 2026 2.3K 3 33