Data Portal | DS & ML: post #1046 — TG.ME

Вышел, пожалуй, самый полный список материалов для изучения производительности GPU и ИИ.

Новая версия начинается с разбора того, как выполняется один запрос на инференс, а затем постепенно переходит к модели выполнения CUDA, Roofline, вычислительной арифметике трансформеров, TTFT, TPOT, goodput и оптимизации ядер.

Именно эти материалы мы используем, чтобы глубоко разобраться в том, как оптимизировать системы инференса.

Также добавили FlashAttention-4, Tensor Memory в Blackwell и низкоточные тензорные ядра, непрерывный батчинг, системы KV-кэша, квантизацию, спекулятивное и структурированное декодирование.

Отдельно разбираются обслуживание MoE-моделей, коллективные операции, топология, разделение prefill и decode, а также Blackwell Ultra, MI350/CDNA 4, Ironwood и Trainium3.

Ещё появились KernelBench-Verified и SOL-ExecBench, плюс отдельный список технологий, за которыми стоит следить — Rubin и CDNA 5.

https://github.com/wafer-ai/gpu-perf-engineering-resources
August 24, 2026 606 41