FlashAttention-3 и FlashAttention-4 — пример того, как алгоритмы нужно заново адаптировать под каждое поколение GPU 🚀
В новой статье разбираем, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell и какие архитектурные изменения вновь ускорили attention.
Вы узнаете:
• почему на H100 FA-2 просел по утилизации GPU
• как Tensor Memory Accelerator и асинхронные Tensor Cores ускорили FA-3
• зачем нужна warp-специализация
• как matmul и softmax удалось выполнять параллельно
• что даёт FP8 с контролем ошибок
• и почему для Blackwell снова понадобилась перестройка во FlashAttention-4
Читайте разбор по ссылке! 👈🏼
1
19
14
11
19
14
11July 9, 2026 4.9K 78