ادامه پست های کار با مدل های لوکال هوش مصنوعی :
وقتی وارد دنیای مدلهای Local میشید، خیلی زود با عددهایی مثل 7B، 14B، 32B یا 70B روبهرو میشید. اما این اعداد دقیقاً یعنی چی؟
حرف B مخفف Billion یا میلیارد هست و تعداد پارامترهای مدل رو نشون میده.
مثلاً:
7B → حدود ۷ میلیارد پارامتربهطور کلی، هرچی تعداد پارامترها بیشتر باشه، مدل میتونه ظرفیت بیشتری برای یادگیری الگوهای پیچیده داشته باشه؛ اما در عوض حافظه و قدرت پردازشی بیشتری هم لازم داره.
14B → حدود ۱۴ میلیارد پارامتر
32B → حدود ۳۲ میلیارد پارامتر
70B → حدود ۷۰ میلیارد پارامتر
پس مثلاً 7B یعنی 7 گیگابایت؟ نه تعداد پارامترها با حجم مدل یکی نیست. اینجاست که مفهوم مهم بعدی وارد میشه:
Quantization
معنی Quantization یعنی کاهش دقت عددهایی که برای ذخیره پارامترهای مدل استفاده میشن.
مثلاً ممکنه یک مدل رو در نسخههای مختلف ببینید:
"FP16"
"Q8"
"Q6"
"Q4"
نسخههای Quantized معمولاً حجم و مصرف حافظه کمتری دارن و به همین دلیل میشه مدلهای بزرگتری رو روی سیستمهای معمولی اجرا کرد. مثلاً یک مدل 7B در نسخه FP16 میتونه تقریباً دو برابر یک نسخه 4-bit حافظه برای وزنهای مدل نیاز داشته باشه. اما این کاهش حجم کاملاً رایگان نیست؛ Quantization میتونه مقداری از دقت یا کیفیت مدل رو کاهش بده، هرچند در بسیاری از مدلهای جدید نسخههای 4-bit و 8-bit عملکرد بسیار خوبی دارن.
پس برای انتخاب مدل چه کار کنیم؟
اگر سیستم معمولی دارید، معمولاً بهتره از مدلهای کوچکتر و Quantized شروع کنید.
مثلاً:
7B/8B → مناسب برای شروع
14B → کیفیت بالاتر، نیاز به منابع بیشتر
32B → سنگینتر و مناسب سیستمهای قویتر
70B+ → نیازمند RAM/VRAM بسیار بیشتر
البته فقط به عدد B نگاه نکنید معماری مدل، Quantization، طول Context، نوع کار و مقدار RAM/VRAM در عملکرد نهایی تأثیر زیادی دارن.
@configproxyhub
