اگه لپتاپت کارت گرافیک گندهای نداره و فکر میکنی مدلهای هوش مصنوعی قوی مالِ تو نیستن، این یکی رو از دست نده
تیم Unsloth مدلهای سنگینی مثل Qwen 2.5 (نسخه ۳۲ میلیارد پارامتری) رو بهشدت فشرده کرده و نسخههاش رو روی Hugging Face گذاشته. کوچیکترین فایلهاش بین ۶ تا ۷ گیگابایتن یعنی مدلی که تا دیروز کارت گرافیک دهها هزار دلاری میخواست، الان حجمش اندازهی دو تا فیلمه و روی سیستمهای معمولی هم بالا میاد.
ایدهی پشتش خیلی قشنگه. تا حالا فشردهسازی مدلها (Quantization) این شکلی بود که کل مدل یکنواخت کوچیک میشد و بهازاش دقت و هوش مدل افت میکرد. اما کاری که Unsloth کرده اینه که همهی بخشهای مدل رو همارزش نمیبینه: بخشهای حساس رو با دقت بالا نگه میداره و بخشهایی که کماثرترن رو شدیدتر فشرده میکنه.
چند تا فکت جذاب:
لایسنس این مدل Apache 2.0 هست، یعنی کاملاً آزاد حتی برای استفادهی تجاری و ساخت محصول. خودِ Unsloth میگه این روش جدید فشردهسازی (Dynamic 3.0) توی حجمِ برابر، بیش از ۱۰٪ دقت بهتری میده.
به راحتی با نرمافزارهای Ollama، LM Studio و llama.cpp لوکال اجرا میشه.
اما ۳ تا نکتهی تجربی که توی صفحهی مدل نوشته نشده و باید بدونی:
حجم فایل مدل با مقدار RAM که واقعاً لازم داری یکی نیست. سیستمعامل خودش چند گیگ رم درگیر میکنه و پردازش متنِ مکالمه (Context Window) هم حافظه میخواد. یعنی روی یه لپتاپ ۸ گیگابایتی عملاً نمیتونی فایل ۷ گیگی رو روون اجرا کنی؛ انتخاب واقعبینانهتر نسخهی ۶ گیگیه، اونم وقتی کروم یا برنامهی سنگین دیگهای باز نباشه.
نسخههایی که از همه بیشتر فشرده شدن (اسمشون با IQ1 شروع میشه) محسوس خنگترن: بیشتر اشتباه میکنن و جوابشون سطحیتره. هیچ هشداری دربارهاش داده نشده، ولی هرچی فشردهسازی بیشتر بشه، افت استدلال بالاتر میره. اگه رمت میکشه، حتماً نسخهی سنگینتر رو دانلود کن.
یه ترفند کاربردی برای تنظیمات: برای کارهای استدلالی، برنامهنویسی و حل مسئله، پارامتر Temperature رو روی ۱.۰ بذار، و برای چت یا تولید محتوای معمولی روی ۰.۷ تنظیمش کن.
@configproxyhub
