예고된대로 Qwen3.8-Flash-Next 공개 파라미터 크기는 125B A6B 로 DeepSeek V4 Flash 의… — Mutt Technologies — TG.ME

예고된대로 Qwen3.8-Flash-Next 공개

파라미터 크기는 125B A6B 로 DeepSeek V4 Flash 의 절반에 조금 못미치는데, Gemma 3과 비슷하게 N-gram Embedding이 51B 로 따로 있음. 이건 GPU에 안올리고 따로 읽는용도로 분리한듯 (이거 구현 어떻게 하냐...)

근데 벤치상으로는 DSV4F 를 대부분 이기는 수준
제가 들고있는 맥이 M4 Max 64GB인데 진짜 잘 쥐어짜서 돌리면 될거같은데 모델 낙수효과 드가자

https://huggingface.co/Qwen/Qwen3.8-Flash-Next
huggingface.co
Qwen/Qwen3.8-Flash-Next · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
August 26, 2026 1.6K 2 9