معمای Ox Alpha حل شد؛ تقریباً یک DeepSeek Flash مولتیمودال
مدلی که چند روز با نام ناشناس Ox Alpha روی OpenRouter و OpenCode میچرخید، پیشنمایش مدل جدید GLM-5.3-Flash از Z.ai بوده است. نسخهی رسمی امروز با وزنهای باز و لایسنس MIT منتشر شده و برای coding، استفادهی agentic و کارهای long-horizon طراحی شده است. خود Z.ai هم میگوید نسخهی ناشناس را عمداً قبل از انتشار روی ترافیک واقعی آزمایش کرده است.
برای تقریب به ذهن، به نظرم نزدیکترین مدل جاافتاده به آن DeepSeek V4 Flash 0731 است. این شباهت فقط از اسم Flash یا قیمت نمیآید؛ دو مدل از نظر design point تقریباً در یک کلاس قرار میگیرند.
مدل GLM-5.3-Flash یک MoE با ۳۲۰ میلیارد پارامتر و ۱۸ میلیارد پارامتر فعال در هر توکن است. مدل DeepSeek V4 Flash هم در مدل پایه ۲۸۴ میلیارد پارامتر و ۱۳ میلیارد پارامتر فعال دارد. هر دو context یکمیلیونتوکنی دارند، هر دو open-weight و MIT هستند و هر دو بخش بزرگی از معماریشان را حول ارزانکردن inference روی contextهای طولانی ساختهاند.
معماری GLM البته یک قدم متفاوت جلو رفته است. این مدل از ترکیب linear attention و sparse attention استفاده میکند و Z.ai میگوید نسبت به GLM-5.3، محاسبات attention را حدود ۳ برابر و KV cache را حدود ۴.۴ برابر کاهش داده است. جالب اینکه خود Z.ai در گزارش معماری، DeepSeek V4 Flash و Kimi K3 را مستقیماً بهعنوان مدلهای مقایسه آورده؛ یعنی انتخاب DeepSeek بهعنوان نزدیکترین تقریب ذهن، با positioning خود سازنده هم جور درمیآید.
تفاوت بزرگتر در ورودی مدل است. مدل DeepSeek V4 Flash 0731 فعلاً text-only است، در حالی که GLM-5.3-Flash از پایه روی corpus چندوجهی ۳۰ تریلیونتوکنی آموزش دیده و تصویر، ویدئو و فایل را مستقیماً میفهمد. برای coding agent این موضوع کاربرد عملی دارد: ایجنت میتواند screenshot رابط، خروجی render، محیط بازی یا رابط یک نرمافزار را ببیند و بعد کدش را بر اساس نتیجه اصلاح کند.
از نظر capability هم دادههای اولیه GLM را کمی بالاتر میگذارند. امتیاز اعلامشدهی آن در Artificial Analysis Intelligence Index v4.1.1 برابر ۵۷ است؛ امتیاز فعلی DeepSeek V4 Flash 0731 در همان خانوادهی ارزیابی حدود ۵۲ است. در تستهای agentic نیز GLM روی Terminal-Bench 2.1 امتیاز ۸۴.۳ و روی DeepSWE امتیاز ۶۳.۴ گرفته، در حالی که اعداد منتشرشده برای DeepSeek 0731 بهترتیب ۸۲.۷ و ۵۴.۴ هستند. مقایسهی این دو benchmark را باید با احتیاط خواند، چون harness و تنظیمات اجرای دو شرکت یکسان نیست.
قسمت جالبتر ماجرا قیمت است. قیمت عادی GLM-5.3-Flash برای هر یک میلیون توکن ۰.۱۵ دلار ورودی، ۰.۵۰ دلار خروجی و ۰.۰۳ دلار cached input است. تا ۹ سپتامبر هم تخفیف ۵۰ درصدی دارد و این اعداد به ۰.۰۷۵، ۰.۲۵ و ۰.۰۱۵ دلار میرسند.
مقایسه با DeepSeek حالا حتی جذابتر شده، چون دیپسیک از ۱۷ اوت قیمت V4 را افزایش داده است. نرخ فعلی V4 Flash در ساعات کمباری حدود ۰.۲۲ دلار ورودی و ۰.۶۶ دلار خروجی و در ساعات شلوغ ۰.۴۴ و ۱.۳۲ دلار است. یعنی حتی بعد از تمامشدن تخفیف Z.ai، قیمت معمول ورودی و خروجی GLM پایینتر از نرخ کمباری DeepSeek میماند.
یک استثنای مهم در caching وجود دارد. قیمت cached input دیپسیک در ساعات کمباری فقط ۰.۰۰۷ دلار و در ساعات شلوغ ۰.۰۱۴ دلار است؛ بنابراین برای coding agentهایی که بخش بزرگی از repository، system prompt و context قبلی دائماً cache hit میشود، DeepSeek هنوز مزیت اقتصادی جدی دارد. قیمت یک مدل را برای workloadهای agentic بهتر است فقط از روی ستون input/output معمولی قضاوت نکنیم.
در نتیجه اگر بخواهم GLM-5.3-Flash را در یک جمله برای کسی که بازار مدلها را دنبال میکند جا بیندازم، میگویم:
مدلی در کلاس DeepSeek V4 Flash 0731، با حدود ۳۰۰ میلیارد پارامتر MoE، یک میلیون context و تمرکز شدید روی agentic coding؛ با capability اولیه کمی بالاتر، مولتیمودالیتی native و API ارزانتر، در مقابل مزیت DeepSeek در cache ارزان و اکوسیستم سروینگ جاافتادهتر.
نکتهی مهمتر شاید خود این کلاس جدید مدلها باشد: حدود ۳۰۰ میلیارد پارامتر کل، چیزی نزدیک ۱۵ میلیارد پارامتر فعال، context یکمیلیونی و attention طراحیشده برای inference ارزان. به نظر میرسد «Flash» در نسل جدید مدلهای چینی کمکم دارد به یک design point مشخص برای ایجنتها تبدیل میشود.
4August 26, 2026 115 3