Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход… — gonzo-обзоры ML статей — TG.ME

Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный энкодер-декодер (T5Gemma, https://t.me/gonzo_ML/4421), то теперь вот диффузионно-блочную модельку, которая поочерёдно диффузией генерит блоки по 256 токенов. И даёт при этом 1500 токенов в секунду. Для промышленного инференса в облаке может и не такой биг дил, там большими батчами эффективность использования железа повышают, а вот для локальных моделек самое то. Возлагаю большие надежды на такие подходы. Когда же уже нормальное домашнее железо + быстрые модели хорошего качества.

DiffusionGemma Technical Report

DiffusionGemma Team, Google DeepMind
Paper: https://arxiv.org/abs/2608.00146
Code: https://github.com/google/hackable_diffusion
Review: https://arxiviq.substack.com/p/diffusiongemma-technical-report
Model: https://deepmind.google/models/gemma/diffusiongemma/

# TL;DR

ЧТО сделали: Авторы представляют DiffusionGemma (на самом деле представили они её раньше, сейчас наконец доехал техрепорт) — экспериментальную открытую диффузионную текстовую модель с 25.2 млрд параметров (3.85 млрд активных), построенную на базе смеси экспертов (MoE) Gemma 4 26B A4B. Вместо последовательной генерации «слева направо» токен за токеном DiffusionGemma параллельно и итеративно уточняет «холсты» размером в 256 токенов. Обходя классическое диффузионное предобучение с нуля, модель инициализируется весами уже обученной авторегрессионной модели и дообучается через двухэтапный пайплайн: Supervised Fine-Tuning (SFT) и новый совместный этап дистилляции сэмплера и обучения с подкреплением (Sampler Distillation & Reinforcement Learning, SD-RL).

ПОЧЕМУ это важно: Стандартные авторегрессионные LLM при обработке одиночных запросов упираются в пропускную способность памяти: они тратят значительно больше времени на пересылку весов и KV-кэша из памяти HBM в вычислительные блоки, чем на сами арифметические операции. DiffusionGemma переводит процесс генерации из режима memory-bound в compute-bound, выдавая около 20 токенов за один прямой проход (forward pass) и достигая скорости порядка 1500 выходных токенов в секунду на одной GPU NVIDIA H100. Это обеспечивает ускорение в 7.1 раза по сравнению с авторегрессионным бейзлайном при сохранении способностей к рассуждениям, длинному контексту и мультимодальности.

Для практиков: Для техлидов и архитекторов систем DiffusionGemma знаменует собой практический прорыв в безавторегрессионной генерации текста. Превратив сильную MoE-модель в дискретный диффузионный движок и потратив менее 10% от исходного бюджета токенов на обучение, Google DeepMind доказала: высокая скорость параллельной генерации не требует жертв со стороны сложного ризонинга. Веса выложены под лицензией Apache 2.0 вместе с эталонными реализациями в vLLM и HuggingFace Transformers, что даёт сообществу готовый высокопроизводительный фундамент для систем реального времени, агентских пайплайнов и низколатентных сервисов.

Разбор тут: https://t.me/gonzo_ML_podcasts/4794
arXiv.org
DiffusionGemma Technical Report
We introduce DiffusionGemma, an experimental open-weight language model that uses discrete diffusion to generate text at exceptionally high speed. Rather than decoding one token at a time,...
👍5❤3🤔1
August 17, 2026 2.1K 18 38
Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход… — gonzo-обзоры ML статей — TG.ME