Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss… — gonzo-обзоры ML статей — TG.ME

Внутренняя магия оптимизаторов и калибровочные симметрии.

The Loss Does Not See the Basis, but Adam Does
Devender Singh
Paper: https://arxiv.org/abs/2608.05136
Code: https://github.com/idevender/loss-basis-adam
Review: https://arxiviq.substack.com/p/the-loss-does-not-see-the-basis-but

ЧТО сделали: В работе представлена теоретическая и эмпирическая база для классификации оптимизаторов на основе калибровочной эквивариантности (gauge equivariance) относительно ортогональных преобразований в факторизованных моделях (W = UV^T). Автор доказывает теорему о структуре, характеризующую эквивариантные обновления без памяти как левые предусловители, определяемые матрицей Грама. Также доказана теорема переноса, связывающая потоки со скалярным предусловием с рескейленным градиентным спуском, и продемонстрировано, что зависящие от базиса оптимизаторы вроде Adam разрушают низкоранговую неявную регуляризацию, тогда как калибровочно-эквивариантные оптимизаторы (Gradient Descent, Muon, Shampoo) сохраняют её.

ПОЧЕМУ это важно: Годами ML-сообщество оценивало оптимизаторы преимущественно по скорости сходимости и эффективности снижения функции потерь. Эта работа доказывает, что выбор оптимизатора фундаментально определяет, какое именно интерполирующее решение найдёт сеть. Покоординатная адаптивность разрушает внутренние вращательные симметрии, что приводит к серьёзным последствиям для обобщающей способности и слияния моделей (model merging, включая техники permutation и rotational re-basin) в современных архитектурах вроде трансформеров.

Для практиков: Когда у моделей глубокого обучения есть избыточная факторизация параметров — например, матричные разложения или головы внимания в трансформерах — существует бесконечно много внутренних координатных базисов, которые дают абсолютно одинаковую функцию и лосс на обучении. Однако популярные оптимизаторы вроде Adam относятся к отдельным координатным осям по-разному. В результате Adam выбирает решения с более высоким рангом и худшей обобщающей способностью в зависимости от случайного начального поворота. В то же время оптимизаторы вроде Gradient Descent или Muon относятся ко всем направлениям симметрично и естественным образом находят простые низкоранговые решения. Инженерам важно понимать: выбор оптимизатора меняет то, чему учится модель, а не только то, как быстро она обучается.

Искать симметрии тут: https://t.me/gonzo_ML_podcasts/4796
arXiv.org
The Loss Does Not See the Basis, but Adam Does
Gradient descent on a factored model $W = UV^\top$ is implicitly biased toward low-rank solutions, while Adam, starting from the same small initialization, is not. We trace the difference to the...
❤14👍3
August 19, 2026 2K 1 41