Напомню, что мы все еще читаем The Ultra-Scale Playbook! Можно посмотреть старые записи и присоединиться.
Сегодня разбирали "5D parallelism in a Nutshell". TL;DR:
• DP (data parallelism) - база;
• Все, кто тренят на GPU, юзают PP (pipeline parallelism);
• TPUs (читаем Гугл) жертвуют PP в пользу TP (tensor parallelism);
• Внезапно, ZeRO-1 > ZeRO-2 для Deepseek.
Запись и слайды тут. Картиночки прилагаются. Репосты в Твиттере и на Линкедине горячо приветствуются. Желающие почитать и обсудить "Finding the Best Training Configuration" очень ожидаются на следующем созвоне 22 января!
5January 15, 2026 1.7K 5



