Прикольная работа про экономию памяти для работы с длинными… — gonzo-обзоры ML статей — TG.ME

Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика стабилизируется уже к середине сети, слои позже работают больше на предсказание следующего токена (или какая там у вас задача).

Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory

Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao
Paper: https://arxiv.org/abs/2607.28263
Code: https://github.com/liuhanzuo/COMem

# TL;DR

ЧТО сделали: Авторы представляют CoMem (Comprehension Memory) — архитектуру контекстной памяти с разделением по глубине, которая перестраивает обработку длинного контекста вдоль оси слоёв, а не токенов. Во время потоковой записи (WRITE) чанки контекста прогоняются через нижние слои трансформера [0:j], чтобы сохранить единое промежуточное состояние резидуального потока (residual state) для каждого токена. Это требует всего 1/18 объёма памяти по сравнению с полным KV-кэшем на Qwen3-8B. Во время чтения (READ) внешний BM25-ретривер выбирает ограниченный пак релевантных чанков, и верхние слои [j:L] пересчитываются над этим паком с использованием полного cross-chunk причинного внимания (causal attention). Самодистиллированный LoRA адаптер с рангом 32, обученный на обычном тексте, восстанавливает точность считывания верхних слоёв без изменения весов основной модели (backbone).

ПОЧЕМУ это важно: Стандартный инференс длинного контекста упирается в квадратичную сложность префилла и линейный рост KV-кэша. Существующие методы удаления токенов урезают долговременные зависимости, а подходы с полным перерасчётом требуют линейного роста памяти. Используя разделение труда по слоям — когда семантическое понимание стабилизируется на ранних слоях, а верхние специализируются на предсказании — CoMem отключает зависимость онлайн-вычислений и памяти GPU от общей длины сохранённого контекста. На 128k контекста на GPU NVIDIA H20 CoMem даёт ускорение префилла в 7.83 раза и снижает пиковую память с 89.36 ГБ до 18.26 ГБ, при этом превосходя полноконтекстные бейзлайны на бенчмарках длинных диалогов.

Для практиков: Сохранение контекста безграничной длины больше не требует удержания глубоких KV-кэшей на миллионы токенов в памяти GPU. Предварительный расчёт промежуточных резидуальных векторов оффлайн и выполнение онлайн-запросов над извлечённым паком фиксированного размера через верхние слои трансформера строго ограничивают затраты на инференс. Эта архитектура обеспечивает бесконечную контекстную память для диалоговых агентов и систем поиска по документам с субсекундной задержкой префилла и минимальным расходом VRAM.

Экономить память тут: https://t.me/gonzo_ML_podcasts/4791
arXiv.org
Understanding Is Done Early: A Depth Division of Labor in Large...
Transformer depth is not used uniformly: lower and middle layers build semantic representations, while upper layers increasingly specialize them for prediction. We turn this division of labor into...
👍7🔥5
August 15, 2026 2.3K 18 50