Diffusion language models (DLM) становятся популярнее
Количество пейперов на эту тему растет, а гигачады в диффузионных моделях как Volodymyr Kuleshov, Aditya Grover и Stefano Ermon объединяются, рейзят деньги и создают свои модели с 1к+ токенов генерации в секунду и достаточно неплохим качеством ответов.
Простыми словами: DLM используют принцип, похожий на генерацию картинок. У вас есть конкретное количество маскированных или просто шумных токенов, и модель пытается угадать, какие токены из словаря должны стоять вместо них на самом деле.
Это позволяет нам генерировать несколько токенов одновременно, теряя немного в качестве, но зато очень быстро, и показывать классные результаты в задачах, где нужно условно угадать, какое слово должно стоять между двумя другими. Ведь в DLM используется bidirectional attention, то есть начало и конец контекста как бы «одинаково важны».
Недавно DeepMind также выпустили Gemma Diffusion, которая показывает очень неплохие результаты на разных бенчмарках, будучи при этом в 4 раза быстрее Gemma 4.
Я ставлю сейчас ставку на то, что из-за роста цен на железо, нехватки данных, и других замедляющих факторов, фронтир-лабы начнут активно развивать свои языковые диффузионные модели, и они начнут активно использоваться наряду с обычными авторегрессионными для таких задач, как сжатие контекста или планирование задач у агентов. И тренд пойдет уже с 2027 года
Очень интересное направление для ресерча, если кто-то думает чем заняться. Пока не пришел ASI, будет чем занять мозги