False Positive: post #150 — TG.ME

Всем привет! 👋

Уже завтра на внеплановой Reading Group посмотрим на архитектуру Kimi K3. Авторы модели предлагают масштабировать и пре-трейн, и test-time вычисления одновременно, а как именно: узнаем уже завтра.

Пробежимся по деталям из технического отчета:

- Kimi Delta Attention — как при миллионе токенов не словить переполнение в BF16 и почему оно требует специализированных ядер (FlashKDA);

- Stable LatentMoE — как работать с 896 экспертами, не теряя GPU в простое;

- Post-training pipeline — как 9 RL-экспертов дистиллируются в одну модель для деплоя;

А также посмотрим, как архитектурные решения диктуют инфраструктуру, чтобы создание такой модели в принципе стало возможным.


📅 Встречаемся в пятницу в 15:00 (по МСК).

Толк

#reading_group #llm
🔥13👌3👍2
July 30, 2026 1.1K 7