Разбираем, почему модель не видит дальше обученного окна и как это чинится методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также — как масштабирование влияет на скорость и точность генерации.
В конце — обзор моделей от хайповых Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Смотрим, что для них работает, а что нет.
Читать далее

