Config Proxy Hub: post #3274 — TG.ME

#information344

اگه لپ‌تاپت کارت گرافیک گنده‌ای نداره و فکر می‌کنی مدل‌های هوش مصنوعی قوی مالِ تو نیستن، این یکی رو از دست نده

تیم ‌Unsloth⁩ مدل‌های سنگینی مثل Qwen 2.5 (نسخه ۳۲ میلیارد پارامتری) رو به‌شدت فشرده کرده و نسخه‌هاش رو روی ‌Hugging Face⁩ گذاشته. کوچیک‌ترین فایل‌هاش بین ۶ تا ۷ گیگابایتن  یعنی مدلی که تا دیروز کارت گرافیک ده‌ها هزار دلاری می‌خواست، الان حجمش اندازه‌ی دو تا فیلمه و روی سیستم‌های معمولی هم بالا میاد.
ایده‌ی پشتش خیلی قشنگه. تا حالا فشرده‌سازی مدل‌ها (‌Quantization⁩) این شکلی بود که کل مدل یکنواخت کوچیک می‌شد و به‌ازاش دقت و هوش مدل افت می‌کرد. اما کاری که ‌Unsloth⁩ کرده اینه که همه‌ی بخش‌های مدل رو هم‌ارزش نمی‌بینه: بخش‌های حساس رو با دقت بالا نگه می‌داره و بخش‌هایی که کم‌اثرترن رو شدیدتر فشرده می‌کنه.

چند تا فکت جذاب:
لایسنس این مدل ‌Apache 2.0⁩ هست، یعنی کاملاً آزاد حتی برای استفاده‌ی تجاری و ساخت محصول.

به راحتی با نرم‌افزارهای ‌Ollama⁩، ‌LM Studio⁩ و ‌llama.cpp⁩ لوکال اجرا می‌شه.
 خودِ ‌Unsloth⁩ می‌گه این روش جدید فشرده‌سازی (Dynamic 3.0) توی حجمِ برابر، بیش از ۱۰٪ دقت بهتری می‌ده.
اما ۳ تا نکته‌ی تجربی که توی صفحه‌ی مدل نوشته نشده و باید بدونی:
حجم فایل مدل با مقدار RAM که واقعاً لازم داری یکی نیست. سیستم‌عامل خودش چند گیگ رم درگیر می‌کنه و پردازش متنِ مکالمه (Context Window) هم حافظه می‌خواد. یعنی روی یه لپ‌تاپ ۸ گیگابایتی عملاً نمی‌تونی فایل ۷ گیگی رو روون اجرا کنی؛ انتخاب واقع‌بینانه‌تر نسخه‌ی ۶ گیگیه، اونم وقتی کروم یا برنامه‌ی سنگین دیگه‌ای باز نباشه.

نسخه‌هایی که از همه بیشتر فشرده شدن (اسمشون با ‌IQ1⁩ شروع می‌شه) محسوس خنگ‌ترن: بیشتر اشتباه می‌کنن و جوابشون سطحی‌تره. هیچ هشداری درباره‌اش داده نشده، ولی هرچی فشرده‌سازی بیشتر بشه، افت استدلال بالاتر می‌ره. اگه رمت می‌کشه، حتماً نسخه‌ی سنگین‌تر رو دانلود کن.

یه ترفند کاربردی برای تنظیمات: برای کارهای استدلالی، برنامه‌نویسی و حل مسئله، پارامتر ‌Temperature⁩ رو روی ۱.۰ بذار، و برای چت یا تولید محتوای معمولی روی ۰.۷ تنظیمش کن.

@configproxyhub
August 25, 2026 149 1