Всем привет! 👋
Уже завтра на внеплановой Reading Group посмотрим на архитектуру Kimi K3. Авторы модели предлагают масштабировать и пре-трейн, и test-time вычисления одновременно, а как именно: узнаем уже завтра.
Пробежимся по деталям из технического отчета:
- Kimi Delta Attention — как при миллионе токенов не словить переполнение в BF16 и почему оно требует специализированных ядер (FlashKDA);
- Stable LatentMoE — как работать с 896 экспертами, не теряя GPU в простое;
- Post-training pipeline — как 9 RL-экспертов дистиллируются в одну модель для деплоя;
А также посмотрим, как архитектурные решения диктуют инфраструктуру, чтобы создание такой модели в принципе стало возможным.
📅 Встречаемся в пятницу в 15:00 (по МСК).
Толк
#reading_group #llm

13
3
2July 30, 2026 1.1K 7