Снова про эмерджентность (https://t.me/gonzo_ML/1031). В работе прослеживают её до обнаружения паттернов разреженной маршрутизации внимания для конкретных задач.
Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns
Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov
Статья: https://arxiv.org/abs/2606.25010
Ревью: https://arxiviq.substack.com/p/emergent-capabilities-arise-randomly
Код: N/A
Модель: N/A
# TL;DR
ЧТО сделали: Авторы провели детальное исследование внутренних механизмов моделей (mechanistic study), которое показало, что внезапное, стохастическое появление прикладных способностей (downstream capabilities) у трансформеров в процессе обучения вызвано резким обнаружением паттернов разреженной маршрутизации внимания (sparse attention routing patterns), специфичных для конкретной задачи. Анализируя предобученные LLM и конструируя контролируемые синтетические задачи, они выделили длину контекста и разреженность паттернов как главные узкие горлышка (bottlenecks), ограничивающие этот процесс обучения, а также продемонстрировали, что альтернативные архитектуры или стратегии предварительного предобучения могут значительно ускорить эмерджентность.
ПОЧЕМУ это важно: Это исследование демистифицирует «эмерджентные способности», смещая парадигму от необъяснимого, зависящего от масштаба феномена или «иллюзии метрик» к конкретной проблеме оптимизационного поиска. Понимание того, что эмерджентность соответствует обнаружению разреженных цепей маршрутизации (routing circuits), открывает чёткий путь в обход дорогостоящего масштабирования «в лоб» (brute-force scaling). Вместо этого исследователи могут проектировать новые архитектуры, специализированные пайплайны синтетического предобучения или вводить оптимизационные баесы (optimization biases), которые сделают выучивание таких разреженных паттернов внимания крайне эффективным с точки зрения расхода данных.
Для практиков: Вместо бесконечного скейлинга моделей для достижения эмерджентности стоит сфокусироваться на предварительном предобучении (pre-pretraining) на структурированных синтетических датасетах (например, на языках Дика / Dyck) и использовать гибридные архитектуры, эффективные при позиционной маршрутизации (такие как MLP-Mixer), чтобы снизить оптимизационную сложность для трансформеров.
Искать эмерджентность тут: https://t.me/gonzo_ML_podcasts/4752
Forwarded fromgonzo-обзоры ML статей
arXiv.org
Emergent Capabilities Arise Randomly from Learning Sparse...
Neural scaling laws for transformer language models predict smooth improvements in pretraining loss with increasing parameters, but downstream capabilities such as in-context learning are known to...

3August 3, 2026 194