Вышел, пожалуй, самый полный список материалов для изучения производительности GPU и ИИ.
Новая версия начинается с разбора того, как выполняется один запрос на инференс, а затем постепенно переходит к модели выполнения CUDA, Roofline, вычислительной арифметике трансформеров, TTFT, TPOT, goodput и оптимизации ядер.
Именно эти материалы мы используем, чтобы глубоко разобраться в том, как оптимизировать системы инференса.
Также добавили FlashAttention-4, Tensor Memory в Blackwell и низкоточные тензорные ядра, непрерывный батчинг, системы KV-кэша, квантизацию, спекулятивное и структурированное декодирование.
Отдельно разбираются обслуживание MoE-моделей, коллективные операции, топология, разделение prefill и decode, а также Blackwell Ultra, MI350/CDNA 4, Ironwood и Trainium3.
Ещё появились KernelBench-Verified и SOL-ExecBench, плюс отдельный список технологий, за которыми стоит следить — Rubin и CDNA 5.
https://github.com/wafer-ai/gpu-perf-engineering-resources