Вот так бы можно было бы назвать видео беседы Гранта Сандерсона (создателя канала 3Blue1Brown) и Алока Пураника, исследователя из Jane Street. В нём они разбирают статью Алока о применении теории групп к позиционным кодировкам в трансформерах.
Но не дай себя обмануть, тензорная алгебра и теория групп не так ужасна, тк ребята всегда славились наглядным разбором тем.
Вот основные тезисы этого разбора:
🎯 Главная идея - сужение пространства поиска.
Стандартный механизм self-attention сам по себе не учитывает порядок слов, те он инвариантен к перестановкам. Поэтому для учёта позиции токенов используются позиционные кодировки (Rope, Alibi, abs, sin и тп).
Алок задался вопросом: "Сколько вообще существует разумных способов закодировать позицию?"
Оказывается, если наложить всего несколько естественных ограничений, пространство возможных решений неожиданно сужается.
Математический аппарат. Теория групп.
Ключевое ограничение - трансляционная инвариантность, это когда сдвиг последовательности на t шагов должен просто сдвигать кодировки, а не менять их суть. Формализовав это требование, Алок пришёл к выводу, что все допустимые кодировки должны формировать однопараметрическую матричную группу вида exp(t×M). Это ограничивает всё множество решений до конкретного семейства матричных экспонент.
🔗 Связь с существующими методами.
Оказывается, самые популярные на практике методы позиционного кодирования являются частными случаями этого общего математического правила:
· RoPE (Rotary Positional Embedding): Использует вращающие матрицы.
· ALiBi (Attention with Linear Biases): Применяет линейные штрафы к вниманию.
Оба метода естественно вытекают из найденного Алоком общего решения.
💎 Самый интересный вывод. "Все хорошие идеи уже придуманы".
Все это блестящий пример того, как фундаментальная математика (теория групп) может не только объяснить эмпирически успешные решения (RoPE, ALiBi), но и строго доказать, что других хороших вариантов просто не существует. Покрайне мере в такой постановке моделирования. 🫡
Так что... Stay tuned. 🦾


