Qwen выпустили Qwen3.8-27B — и это неожиданно большой скачок относительно Qwen3.6-27B 🚀
Это всё ещё dense-модель на 27B параметров, но прирост особенно заметен не на классических knowledge-бенчмарках, а на реальных coding-, agentic- и multimodal-задачах.
Несколько примеров Qwen3.8-27B → против Qwen3.6-27B:
• Terminal Bench 2.1: 63.4 → 73.0
• SWE-bench Pro: 53.5 → 61.7
• DeepSWE 1.1: 13.3 → 42.2 — более чем ×3
• QwenSWEBench: 49.3 → 79.0
• Agents' Last Exam Pass@1: 10.6 → 20.4
• HLE: 24.0 → 30.8
• LiveCodeBench v6: 83.9 → 90.3
Но самый интересный скачок, кажется, произошёл в мультимодальных агентах:
• OSWorld: 63.9 → 84.3
• WebArena: 48.8 → 64.8
• RecreationBench: 29.8 → 47.1
• SWE-MM: 25.7 → 38.6
• Vision2Web: 45.0 → 62.9
• BabyVision: 28.9 → 65.7
Причём на некоторых тестах локальная open-weight 27B уже оказывается на уровне или выше гораздо более крупных закрытых моделей из сравнительной таблицы самого Qwen.
По архитектуре всё как и у qwen3.6-27b - это 64 слоя, d_model=5120, гибрид Gated DeltaNet + Gated Attention, FFN 17,408, multi-step MTP и нативный контекст 262K с возможностью расширения до 1M.
Что особенно интересно: на GPQA прирост всего 87.8 → 89.2, зато на длинных агентских задачах местами +50–200%. Похоже, основной прогресс поколения 3.8 — уже не просто «модель стала немного умнее», а существенно лучше научилась долго планировать, пользоваться окружением, писать и исправлять код и доводить сложные задачи до конца.
На картинках ниже собрал все опубликованные Qwen метрики, сравнил с Qwen3.6-27B и, где возможно, с Qwen3.6-35B-A3B, плюс добавил Qwen3.7-Plus, Muse Glimmer-30B и Opus4.6 Max.
Очень мощный релиз для 27B.
Вот мы и определились, на базе чего будем тюнить мультимодалки ^_^
Для скорости пока что всё ещё юзаем Qwen3.6-35B-A3B, а для качественных задач новый фаворит!
🤗 Веса на HF: bf16 | fp8 | gguf
На openrouter пока что нет, но уже появилось в API на NeuralDeep.ru