سریعتر از GPU؛ اما چطور؟! — بخش اول
سربراس نسل جدید سیستمش، CS-4، را معرفی کرده و همزمان همکاریاش با OpenAI به مقیاس بسیار بزرگتری رسیده است. طبق گزارش رویترز، OpenAI متعهد شده طی سه سال بیش از ۲۰ میلیارد دلار برای استفاده از سرورهای مبتنی بر Cerebras هزینه کند؛ توسعهی قراردادی که در ابتدا تا ۷۵۰ مگاوات ظرفیت inference را پوشش میداد. این عدد بهخودیخود برتری فنی را ثابت نمیکند، اما نشان میدهد بحث دیگر یک benchmark آزمایشی نیست و OpenAI بخشی از ظرفیت inference آیندهاش را روی معماریای غیر از GPUهای متعارف میچیند.
برای فهم معماری Cerebras کافی است از CPU، GPU و RAM شروع کنیم. در یک کامپیوتر معمولی، پردازنده محاسبه میکند و داده را از حافظه میگیرد. در GPU هم مدل عمدتاً در حافظهی پرسرعت کنار GPU قرار دارد. در مدلهای بزرگ، مخصوصاً هنگام تولید token، مسئله فقط تعداد عملیات ریاضی نیست؛ برای ساخت هر token باید حجم بزرگی از وزنهای مدل دوباره در اختیار واحدهای محاسباتی قرار بگیرد. بنابراین سرعت جابهجایی داده میان حافظه و پردازنده میتواند به اندازهی قدرت خود پردازنده تعیینکننده باشد.
چیپهای معمولی ابتدا روی یک صفحهی بزرگ سیلیکونی به نام wafer ساخته و بعد از هم جدا میشوند؛ هر قطعهی جداشده میتواند به یک CPU یا GPU تبدیل شود. Cerebras مسیر متفاوتی رفت و بهجای بریدن wafer، تقریباً کل آن را به یک پردازندهی واحد تبدیل کرد. نتیجه یک چیپ بسیار بزرگ با صدها هزار هسته و مسیرهای ارتباطی داخلی کوتاهتر از یک خوشهی متشکل از تعداد زیادی GPU است.
مزیت دوم به حافظه برمیگردد. SRAM را میشود شبیه cache بسیار بزرگ و بسیار سریع داخل پردازنده تصور کرد؛ از RAM و حافظهی معمول GPU سریعتر است، اما فضای بیشتری روی سیلیکون میگیرد و گرانتر است، به همین دلیل در پردازندههای معمولی مقدار آن محدود است. هر Wafer Scale Engine سربراس ۴۴ گیگابایت SRAM روی خود چیپ دارد. این مقدار برای نگهداشتن همهی مدلهای بزرگ کافی نیست، اما اجازه میدهد بخش بزرگی از تبادل داده با پهنای باند بسیار بالا و بدون رفتوآمد مداوم به حافظه و شبکهی خارجی انجام شود.
نسل CS-4 این ایده را در سطح سیستم ادامه داده است. هر سیستم سه wafer دارد و سربراس latency ارتباط wafer-to-wafer را تا حدود ۲ میکروثانیه پایین آورده است. شرکت میگوید در مدلهای آزمایششده تا ۳۰ برابر سرعت inference بیشتر از سیستمهای GPU و تا ۱۰ برابر throughput بیشتر بهازای هر وات نسبت به CS-3 به دست آورده است. ادعای مدلهای بیش از ۱۰ تریلیون پارامتر با حدود ۱۰۰۰ token/s هم فعلاً extrapolation از benchmarkهای داخلی است، نه اجرای عمومی یک مدل ۱۰ تریلیون پارامتری.
خروجی عملیتر این معماری را در GPT-5.6 Sol میبینیم. حالت Ultrafast این مدل روی Cerebras تا حدود ۷۵۰ token در ثانیه خروجی میدهد؛ تا ۱۴ برابر سریعتر از processing استاندارد، و طبق OpenAI همان مدل Sol است نه نسخهای کوچکتر یا pruneشده. این تفاوت در coding agent یا research agent مهمتر میشود، چون مدل در یک کار بارها فراخوانی میشود، ابزار اجرا میکند و نتیجه را دوباره میخواند؛ latency هر مرحله روی مراحل بعدی جمع میشود.
بخش اقتصادی هم به همان اندازه مهم است. جابهجایی کمتر داده یعنی انرژی کمتر، شبکه و حافظهی خارجی کمتر و token بیشتر با همان توان دیتاسنتر. سربراس برای CS-4 تا ۱۰ برابر throughput بهازای هر وات نسبت به نسل قبلی اعلام کرده و در مقایسهای که خودش برای CS-3 و DGX B200 منتشر کرده، هزینهی کل سختافزار و انرژی را حدود ۳۲ درصد پایینتر محاسبه کرده است. این عدد مستقل نیست و باید برآورد خود شرکت تلقی شود، اما جهت رقابت روشن است: معیار فقط token/s نیست، بلکه token بهازای دلار و token بهازای وات است.
این روند به Cerebras محدود نیست. چند شرکت دیگر همان گلوگاه را دیدهاند، اما هرکدام بخش متفاوتی از معماری کامپیوتر را تغییر دادهاند. بخش دوم دربارهی همین alternativeهاست.
7August 20, 2026 256 11