FlashAttention-3 и FlashAttention-4 — пример того, как алгоритмы… — DeepSchool — TG.ME

FlashAttention-3 и FlashAttention-4 — пример того, как алгоритмы нужно заново адаптировать под каждое поколение GPU 🚀

В новой статье разбираем, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell и какие архитектурные изменения вновь ускорили attention.

Вы узнаете:

• почему на H100 FA-2 просел по утилизации GPU
• как Tensor Memory Accelerator и асинхронные Tensor Cores ускорили FA-3
• зачем нужна warp-специализация
• как matmul и softmax удалось выполнять параллельно
• что даёт FP8 с контролем ошибок
• и почему для Blackwell снова понадобилась перестройка во FlashAttention-4

Читайте разбор по ссылке! 👈🏼
1❤19🔥14👍11
July 9, 2026 4.9K 78