Модель, которая по части тестов обходит Opus 4.6, теперь запускается на домашней видеокарте. Alibaba выложила Qwen3.8-27B с открытыми весами под лицензией Apache 2.0, она понимает текст, изображения и видео и держит контекст в 262 тысячи токенов.
Модель плотная, 27.78 миллиарда параметров, контекст расширяется до 1 миллиона токенов через YaRN, поддерживается MTP, то есть спекулятивное декодирование. Официально опубликованы только BF16 и FP8, для локального запуска сообщество собрало GGUF кванты. На RTX 5090 с 32 ГБ автор Хабра получил 100 токенов в секунду на кванте Q6 с контекстом 48 тысяч и 120 токенов в секунду на Q5 с контекстом 125 тысяч. На картах с 24 ГБ придется брать квант меньше, квантовать контекст или частично выгружать в оперативную память, отдельная сборка есть и под 16 ГБ
Источник: https://habr.com/ru/articles/1070694/
Почитать: https://huggingface.co/Qwen/Qwen3.8-27B
Кванты: https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
4August 16, 2026 348 1 3