17.91 token/sec برای شروع عدد خوبی هست ؟ روی GTX 1060 با ۶ گیگ گرافیک… — RandRng — TG.ME

RandRngاین پست آپدیت خواهد شد : من این مدل‌ها رو برای سیستم‌های کوچکتر می‌خوام تست کنم، روی minipc ها که arm هستند و gpu 780M دارند اما خب خوبیش اینه که رم رو میشه بین cpu, gpu به اشتراک گذاشت (تا ۱۶ گیگ) ازین به بعد AMD بهش می‌گم. و روی یک دستگاه قدیمی با gpu…
17.91 token/sec 

برای شروع عدد خوبی هست ؟

روی GTX 1060 با ۶ گیگ گرافیک فکر کنم این GPU الان ۳۰ دلار قیمتش باشه
ولی داره Qwen3.6 با ۳۵ میلیارد پارامتر رو اجرا می‌کنه


docker run --gpus all --cap-add=IPC_LOCK \
-p 8080:8080 \
-v ~/.ai_models:/models:ro \
-e LD_LIBRARY_PATH=/app \
reg.home.arpa/ggml-org/llama.cpp:server-cuda \
-m /models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \
--n-cpu-moe 34 \
--no-mmap \
--mlock \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--host 0.0.0.0 \
--port 8080


خداییش این رو کپی نکنید؛ البته ۹۹٪ اعضای کانال فروارد می‌کنند (دمتون گرم ❤️) آمار فروارد رو دیدم ولی خب برای اون ۱٪ که پست‌هام رو تو لینکدین به اسم خودشون می‌ذارند این یکی رو اینکار رو نکنید.
واقعا انرژی گرفت ازم

اگر خواستید خودتون اجرا کنید :
۱- حتما llamacpp رو آپدیت کنید؛ نسخه cuda 13 رو نگیرید؛ nvidia 1060 به زور cuda 13.0 رو پشتیبانی میده
نسخه درایور nvidia روی باید بالاتر از 570 ببرید (خیلی جاها می‌گن 575) من مستقیم برای آخرین نسخه ها رفتم و درنهایت متوجه شدم که 580 آخرین نسخه‌ای هست که این کارت گرافیک رو پشتیبانی می‌کنه پیشنهاد می‌کنم که دقیقا هم روی این نسخه بمونید.

۲- به هیچ‌وجه سراغ درایور open source نرید؛‌ یک سری باگ‌هایی داره که نتایج خیلی بدی بهتون میده

۳- پارامترها رو من تا جایی که شده اپتیمایز کردم پس همین اعداد رو بذراید باشه؛ اگر gpu شما حافظه بیشتری داره پیشنهاد می‌کنم
—n-cpu-moe 

رو عدد کوچکتری بذارید تقریبا هر لایه ۵۰۰ مگ گرافیک می‌خواد یعنی اگر gpu شما ۸ گیگ هست شما این مقدار رو می‌تونید بجای 34 توی تست من روی 32 بذارید تا مقدار بیشتری از لایه‌ها روی gpu قرار بگیره

درنهایت؛ یک تکنیک دیگر هست که فکر می‌کنم با اضافه کردن اون به ۲۰ هم برسم یا شاید بتونم کانتکست رو دستی تنظیم کنم روی 256K و اون هم TurboQuant هست برای k-v cache من اینجا برای اطمینان از base-line با q8 که نرم هست رفتم جلو.

میزان مصرف هم اینطوری هست که :
5684MiB / 6144MiB Nvidia 1060GPU
و حدود ۱۹ گیگ از رم سیستم رو استفاده کرده.

البته من چون سیستم رو استفاده می‌کنم با محیط گرافیکی اومدم بالا و کمی از رم برای اون استفاده شده

——————————
البته همه‌ی این‌ها به لطف یکی از دوستان بود که vpn لازم برای تست رو فراهم کرد. ❤️🌹

پینوشت:
من تا اینجا هدفم سرعت توکن خروجی بود؛ بعد از این با TurboQuant و تکنیک های جدیدی که معرفی شده سعی می‌کنم کانتکست توکن رو افزایش بدم.
👍23❤9😁2
May 22, 2026 5.9K 179