تیم Qwen از مدل جدید خود با نام Qwen3.8-Flash رونمایی کرد؛ یک مدل چندوجهی (Multimodal) از نوع MoE که پیشنمایشی از معماری نسل آینده یعنی Qwen4 محسوب میشود.
این مدل با وجود ۱۲۵ میلیارد پارامتر، تنها ۶ میلیارد پارامتر را برای هر توکن فعال میکند که منجر به بهینگی خیرهکنندهای شده است. از دیگر ویژگیهای فنی این مدل میتوان به موارد زیر اشاره کرد:
- پشتیبانی از متن پیشفرض ۲۶۲ هزار توکن با قابلیت گسترش تا ۱ میلیون
- استفاده از معماری نوین شامل GDN و QSA hybrid attention
- بهینهسازی هزینههای آموزش تا ۹ برابر کمتر از مدلهای قبلی
- ثبت نتایج درخشان در بنچمارکهای مطرحی چون MathVision با امتیاز ۹۵.۷ و SWE-bench Pro با ۶۲.۵
شما میتوانید جزئیات فنی و گزارش کامل این مدل را در گزارش تخصصی Qwen مطالعه کرده و وزنهای نسخه اولیه آن را از هگینگفیس دریافت کنید. نسخه تولیدی این مدل نیز در پلتفرم QwenCloud با قیمت بسیار رقابتی در دسترس قرار گرفته است.
📚 مطالعه با جزئیات بیشتر
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Qwen3_8_Flash #Muon_optimizer
