Spatially Speculative Decoding ускоряет авторегрессионные image-модели до 13.3×.
Идея простая: перестать делать вид, что картинка - это просто длинная строка токенов.
Обычно AR image-модель разворачивает 2D-изображение в последовательность и генерирует её токен за токеном. Это работает, но убивает скорость: каждый следующий шаг ждёт предыдущий.
SSD добавляет маленькие draft-heads, которые используют пространственную структуру изображения. Они предсказывают не только следующий токен, но и соседние токены справа и снизу. По сути, модель начинает черновиком собирать сразу куски изображения и целые строки, а не идти по одному токену.
Эти вспомогательные головы не пытаются угадывать финальные visual token labels напрямую. Они предсказывают внутренние feature-представления, которые проще выучить и стабильнее проверять.
Основная модель потом верифицирует draft-блок параллельно и исправляет ошибки, поэтому один промах не обнуляет весь блок.
На Janus-Pro, Lumina-mGPT и Emu3 авторы получили ускорение от 5.74× до 13.28× при сопоставимых бенчмарках.
Чем больше token grid, тем выше выигрыш. Базовая модель при этом не меняется: ускорение даёт небольшой обученный модуль поверх неё.
Paper: “SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation”
arxiv.org/abs/2606.20543
@machinelearning_books
Forwarded fromМашиннное обучение | Наука о данных Библиотека

July 14, 2026 1.1K 7