این پست آپدیت خواهد شد : من این مدل‌ها رو برای سیستم‌های کوچکتر… — RandRng — TG.ME

RandRngپرسیدید چی دانلود می‌کنم : بخش خصوصی داستان هیچی که باید با توکن خودم باشه حتما مثل گیت‌هاب و داکر رجیستری و ... (اونارو دوباره می‌گیرم) اما این موارد رو اگر کسی بتونه درستش رو بذاره حداقل بخش کارهای لوکال و تسک‌های فاین‌تیون من رو راه میندازه unsloth/gemma…
این پست آپدیت خواهد شد :

من این مدل‌ها رو برای سیستم‌های کوچکتر می‌خوام تست کنم، روی minipc ها که arm هستند و gpu 780M دارند اما خب خوبیش اینه که رم رو میشه بین cpu, gpu به اشتراک گذاشت (تا ۱۶ گیگ) ازین به بعد AMD بهش می‌گم.

و روی یک دستگاه قدیمی با gpu 1060 که ازین به بعد Nvidia بهش می‌گم.

تا اینجا مدل
Qwen3.6-35B-A3B-GGUF
رو با Q4_K_M تست کردم.

مدل‌هایی که انتخاب کردم برای کارهای اصلی (مواردی که A داره) مدل‌های MoE هستند برای همین می‌شه با تریک‌های مختلف سرعت قابل قبولی ازشون گرفت.

Lmstudio:
Amd + vulkan : 12 tok/sec
Nvidia + cuda : 8 tok/sec


قابل استفاده هست ولی حوصله سربر بخصوص اینکه مدل thinking هست. البته برای کار من ۱۰ توکن به بالا خوب هست ولی رضایت ندارم از خروجی.

برای همین دارم تلاش می‌کنم مدل رو با llamacpp و فلگ‌های مهمتر بیارم بالا مثل
TurboQuant, no mmap, ...

توقع دارم حداقل بتونم روی هرکدوم ۵ توکن بیشتر بگیرم، بعد از تست فلگ‌های مهم حتماً بصورت دقیقتر به اشتراک می‌گذارم.

نکته مهم :
Llama-cpp

توی آپدیت جدیدش فلگ‌های اپتیمایز کردن خیلی مهمی رو معرفی کرده، برای همین منتظر دانلود docker image اون هستم.


پینوشت :

روی سیستم و 3090 نمی‌خوام چیزی بیارم، خوبی سیستم‌هایی که گفتم اینه که :
۱- مصرف برق پایینی دارند
۲- دائم روشن هستند
۳- برای من مهم اینه که توی ۳۰ دقیقه جوابم رو بده (قرار نیست ازین مدل‌ها برای سوال جوابای سریع و ... استفاده کنم)

برای همین موارد گفتم که ۱۰ توکن هم برای من کار رو انجام میده

مدل‌های کوچکتر که ۱-۳ گیگ حجم لازم دارند رو هم برای کارهای خیلی کوچیک و سریع لازم دارم که چون اون موارد مشکلی نیست توی اجراهاشون راجبش چیزی نمی‌نویسم.
👍12
May 22, 2026 2K 29