Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory
Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao
Paper: https://arxiv.org/abs/2607.28263
Code: https://github.com/liuhanzuo/COMem
# TL;DR
ЧТО сделали: Авторы представляют CoMem (Comprehension Memory) — архитектуру контекстной памяти с разделением по глубине, которая перестраивает обработку длинного контекста вдоль оси слоёв, а не токенов. Во время потоковой записи (WRITE) чанки контекста прогоняются через нижние слои трансформера
[0:j], чтобы сохранить единое промежуточное состояние резидуального потока (residual state) для каждого токена. Это требует всего 1/18 объёма памяти по сравнению с полным KV-кэшем на Qwen3-8B. Во время чтения (READ) внешний BM25-ретривер выбирает ограниченный пак релевантных чанков, и верхние слои [j:L] пересчитываются над этим паком с использованием полного cross-chunk причинного внимания (causal attention). Самодистиллированный LoRA адаптер с рангом 32, обученный на обычном тексте, восстанавливает точность считывания верхних слоёв без изменения весов основной модели (backbone).ПОЧЕМУ это важно: Стандартный инференс длинного контекста упирается в квадратичную сложность префилла и линейный рост KV-кэша. Существующие методы удаления токенов урезают долговременные зависимости, а подходы с полным перерасчётом требуют линейного роста памяти. Используя разделение труда по слоям — когда семантическое понимание стабилизируется на ранних слоях, а верхние специализируются на предсказании — CoMem отключает зависимость онлайн-вычислений и памяти GPU от общей длины сохранённого контекста. На 128k контекста на GPU NVIDIA H20 CoMem даёт ускорение префилла в
7.83 раза и снижает пиковую память с 89.36 ГБ до 18.26 ГБ, при этом превосходя полноконтекстные бейзлайны на бенчмарках длинных диалогов.Для практиков: Сохранение контекста безграничной длины больше не требует удержания глубоких KV-кэшей на миллионы токенов в памяти GPU. Предварительный расчёт промежуточных резидуальных векторов оффлайн и выполнение онлайн-запросов над извлечённым паком фиксированного размера через верхние слои трансформера строго ограничивают затраты на инференс. Эта архитектура обеспечивает бесконечную контекстную память для диалоговых агентов и систем поиска по документам с субсекундной задержкой префилла и минимальным расходом VRAM.
Экономить память тут: https://t.me/gonzo_ML_podcasts/4791


