17.91 token/sec
برای شروع عدد خوبی هست ؟
روی
GTX 1060 با ۶ گیگ گرافیک فکر کنم این GPU الان ۳۰ دلار قیمتش باشه ولی داره
Qwen3.6 با ۳۵ میلیارد پارامتر رو اجرا میکنهdocker run --gpus all --cap-add=IPC_LOCK \
-p 8080:8080 \
-v ~/.ai_models:/models:ro \
-e LD_LIBRARY_PATH=/app \
reg.home.arpa/ggml-org/llama.cpp:server-cuda \
-m /models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \
--n-cpu-moe 34 \
--no-mmap \
--mlock \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--host 0.0.0.0 \
--port 8080
خداییش این رو کپی نکنید؛ البته ۹۹٪ اعضای کانال فروارد میکنند (دمتون گرم ❤️) آمار فروارد رو دیدم ولی خب برای اون ۱٪ که پستهام رو تو لینکدین به اسم خودشون میذارند این یکی رو اینکار رو نکنید.
واقعا انرژی گرفت ازم
اگر خواستید خودتون اجرا کنید :
۱- حتما
llamacpp رو آپدیت کنید؛ نسخه cuda 13 رو نگیرید؛ nvidia 1060 به زور cuda 13.0 رو پشتیبانی میده نسخه درایور
nvidia روی باید بالاتر از 570 ببرید (خیلی جاها میگن 575) من مستقیم برای آخرین نسخه ها رفتم و درنهایت متوجه شدم که 580 آخرین نسخهای هست که این کارت گرافیک رو پشتیبانی میکنه پیشنهاد میکنم که دقیقا هم روی این نسخه بمونید.۲- به هیچوجه سراغ درایور open source نرید؛ یک سری باگهایی داره که نتایج خیلی بدی بهتون میده
۳- پارامترها رو من تا جایی که شده اپتیمایز کردم پس همین اعداد رو بذراید باشه؛ اگر
gpu شما حافظه بیشتری داره پیشنهاد میکنم —n-cpu-moe
رو عدد کوچکتری بذارید تقریبا هر لایه ۵۰۰ مگ گرافیک میخواد یعنی اگر
gpu شما ۸ گیگ هست شما این مقدار رو میتونید بجای 34 توی تست من روی 32 بذارید تا مقدار بیشتری از لایهها روی gpu قرار بگیره درنهایت؛ یک تکنیک دیگر هست که فکر میکنم با اضافه کردن اون به ۲۰ هم برسم یا شاید بتونم کانتکست رو دستی تنظیم کنم روی
256K و اون هم TurboQuant هست برای k-v cache من اینجا برای اطمینان از base-line با q8 که نرم هست رفتم جلو.میزان مصرف هم اینطوری هست که :
5684MiB / 6144MiB Nvidia 1060GPU و حدود ۱۹ گیگ از رم سیستم رو استفاده کرده.
البته من چون سیستم رو استفاده میکنم با محیط گرافیکی اومدم بالا و کمی از رم برای اون استفاده شده
——————————
البته همهی اینها به لطف یکی از دوستان بود که
vpn لازم برای تست رو فراهم کرد. ❤️🌹پینوشت:
من تا اینجا هدفم سرعت توکن خروجی بود؛ بعد از این با
TurboQuant و تکنیک های جدیدی که معرفی شده سعی میکنم کانتکست توکن رو افزایش بدم.

