AI Secrets: post #943 — TG.ME

Модель, которая по части тестов обходит Opus 4.6, теперь запускается на домашней видеокарте. Alibaba выложила Qwen3.8-27B с открытыми весами под лицензией Apache 2.0, она понимает текст, изображения и видео и держит контекст в 262 тысячи токенов.

Модель плотная, 27.78 миллиарда параметров, контекст расширяется до 1 миллиона токенов через YaRN, поддерживается MTP, то есть спекулятивное декодирование. Официально опубликованы только BF16 и FP8, для локального запуска сообщество собрало GGUF кванты. На RTX 5090 с 32 ГБ автор Хабра получил 100 токенов в секунду на кванте Q6 с контекстом 48 тысяч и 120 токенов в секунду на Q5 с контекстом 125 тысяч. На картах с 24 ГБ придется брать квант меньше, квантовать контекст или частично выгружать в оперативную память, отдельная сборка есть и под 16 ГБ

Источник: https://habr.com/ru/articles/1070694/

Почитать: https://huggingface.co/Qwen/Qwen3.8-27B

Кванты: https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
❤4
August 16, 2026 348 1 3