🚀 معرفی مدل GLM-5.3-Flash با ظرفیت پردازش ۱ میلیون توکن
شرکت Z.ai از مدل جدید خود با نام GLM-5.3-Flash رونمایی کرد. این مدل یک سیستم Multimodal MoE با ۳۲۰ میلیارد پارامتر است که در هر توکن، ۱۸ میلیارد پارامتر را فعال میکند. این معماری بهینه باعث شده تا با وجود ابعاد بزرگ، هزینه سرویسدهی آن بسیار اقتصادی باشد.
مهمترین ویژگیها و نتایج این مدل:
• استفاده از استک توجه هیبریدی شامل KDA linear و NoPE sparse MLA که منجر به کاهش ۳ برابری محاسبات توجه و کاهش ۴.۴ برابری KV cache شده است.
• پشتیبانی واقعی از Context Window یک میلیون توکنی.
• کسب امتیاز ۸۴.۳ در بنچمارک Terminal-Bench 2.1 و ۶۳.۴ در DeepSWE v1.1.
بر اساس ارزیابی مستقل Artificial Analysis، این مدل در شاخص هوش نمره ۵۷ را کسب کرده و سرعت تولید توکن آن حدود ۴۹ توکن در ثانیه است که تعادل مناسبی بین کارایی و هزینه ایجاد میکند.
شما میتوانید جزئیات کامل فنی را در تحلیل کامل مطالعه کرده و وزنهای مدل را از Hugging Face دریافت کنید.
📊 Data➕Science

1August 27, 2026 173 1