Умный, локальный и без цензуры Qwen3.8-Flash-Next
«Almost Zero refusal» — ей всё равно, что ты спросишь. Она не будет говорить «не могу ответить на этот вопрос». Это главная фишка.
«125B total / 6B active + 51B n-gram table»— это не стандартная плотная модель. Используется техника MOE (Mixture of Experts) — при каждом запросе активна только часть нейронов (6 млрд), но общий «словарь» знаний огромен (125 млрд). Это позволяет ей быть умной, но при этом жрать мало памяти.
«Vision, tools, reasoning» — она умеет смотреть на картинки (мультимодальность), пользоваться внешними инструментами (как API, калькулятор) и логически рассуждать (цепочки мыслей).
«262K context» — она «помнит» книгу размером с «Войну и мир» (262 тысячи токенов) за раз.
«Gated DeltaNet + Qwen Sparse Attention» — это технические ухищрения для ускорения работы и экономии памяти. Обычные трансформеры жрут много ресурсов, а эти механизмы пытаются решить эту проблему
Репозиторий

3
2