من این مدلها رو برای سیستمهای کوچکتر میخوام تست کنم، روی minipc ها که arm هستند و gpu 780M دارند اما خب خوبیش اینه که رم رو میشه بین cpu, gpu به اشتراک گذاشت (تا ۱۶ گیگ) ازین به بعد AMD بهش میگم.
و روی یک دستگاه قدیمی با gpu 1060 که ازین به بعد Nvidia بهش میگم.
تا اینجا مدل
Qwen3.6-35B-A3B-GGUF رو با Q4_K_M تست کردم.
مدلهایی که انتخاب کردم برای کارهای اصلی (مواردی که A داره) مدلهای MoE هستند برای همین میشه با تریکهای مختلف سرعت قابل قبولی ازشون گرفت.
Lmstudio:
Amd + vulkan : 12 tok/sec
Nvidia + cuda : 8 tok/sec
قابل استفاده هست ولی حوصله سربر بخصوص اینکه مدل
thinking هست. البته برای کار من ۱۰ توکن به بالا خوب هست ولی رضایت ندارم از خروجی.برای همین دارم تلاش میکنم مدل رو با
llamacpp و فلگهای مهمتر بیارم بالا مثل TurboQuant, no mmap, ... توقع دارم حداقل بتونم روی هرکدوم ۵ توکن بیشتر بگیرم، بعد از تست فلگهای مهم حتماً بصورت دقیقتر به اشتراک میگذارم.
نکته مهم :
Llama-cpp
توی آپدیت جدیدش فلگهای اپتیمایز کردن خیلی مهمی رو معرفی کرده، برای همین منتظر دانلود
docker image اون هستم.پینوشت :
روی سیستم و 3090 نمیخوام چیزی بیارم، خوبی سیستمهایی که گفتم اینه که :
۱- مصرف برق پایینی دارند
۲- دائم روشن هستند
۳- برای من مهم اینه که توی ۳۰ دقیقه جوابم رو بده (قرار نیست ازین مدلها برای سوال جوابای سریع و ... استفاده کنم)
برای همین موارد گفتم که ۱۰ توکن هم برای من کار رو انجام میده
مدلهای کوچکتر که ۱-۳ گیگ حجم لازم دارند رو هم برای کارهای خیلی کوچیک و سریع لازم دارم که چون اون موارد مشکلی نیست توی اجراهاشون راجبش چیزی نمینویسم.
