Spatially Speculative Decoding ускоряет авторегрессионные… — Neural Networks | Нейронные сети — TG.ME

Spatially Speculative Decoding ускоряет авторегрессионные image-модели до 13.3×.

Идея простая: перестать делать вид, что картинка - это просто длинная строка токенов.

Обычно AR image-модель разворачивает 2D-изображение в последовательность и генерирует её токен за токеном. Это работает, но убивает скорость: каждый следующий шаг ждёт предыдущий.

SSD добавляет маленькие draft-heads, которые используют пространственную структуру изображения. Они предсказывают не только следующий токен, но и соседние токены справа и снизу. По сути, модель начинает черновиком собирать сразу куски изображения и целые строки, а не идти по одному токену.

Эти вспомогательные головы не пытаются угадывать финальные visual token labels напрямую. Они предсказывают внутренние feature-представления, которые проще выучить и стабильнее проверять.

Основная модель потом верифицирует draft-блок параллельно и исправляет ошибки, поэтому один промах не обнуляет весь блок.

На Janus-Pro, Lumina-mGPT и Emu3 авторы получили ускорение от 5.74× до 13.28× при сопоставимых бенчмарках.

Чем больше token grid, тем выше выигрыш. Базовая модель при этом не меняется: ускорение даёт небольшой обученный модуль поверх неё.

Paper: “SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation”

arxiv.org/abs/2606.20543

@machinelearning_books
July 14, 2026 1.1K 7