잊고있었던 고전 쥐어짜기 수법 REAP (안쓰이는 Expert 몇개 죽이기) 을 쓰면 39GB 메모리만 쓰고 서빙 가능하다… — Mutt Technologies — TG.ME

Mutt Technologies예고된대로 Qwen3.8-Flash-Next 공개 파라미터 크기는 125B A6B 로 DeepSeek V4 Flash 의 절반에 조금 못미치는데, Gemma 3과 비슷하게 N-gram Embedding이 51B 로 따로 있음. 이건 GPU에 안올리고 따로 읽는용도로 분리한듯 (이거 구현 어떻게 하냐...) 근데 벤치상으로는 DSV4F 를 대부분 이기는 수준 제가 들고있는 맥이 M4 Max 64GB인데 진짜 잘 쥐어짜서 돌리면 될거같은데 모델 낙수효과…
잊고있었던 고전 쥐어짜기 수법 REAP (안쓰이는 Expert 몇개 죽이기) 을 쓰면 39GB 메모리만 쓰고 서빙 가능하다 하네요 이거 잘되면 맥 안바꿔도 될듯??

추론시 전문가 512개중에 11개만 사용하는 ultra sparse 모델이었는데, 여기서 224개 죽이고 288개만 남겨도 쓸만하다(고 모델 개발자가 주장중)
주말간 실사용 해볼게요

https://huggingface.co/sh0wie/Qwen3.8-Flash-Next-REAP-288-MLX-4bit
huggingface.co
sh0wie/Qwen3.8-Flash-Next-REAP-288-MLX-4bit · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
August 28, 2026 900 13