🧠🌉استارتاپ Mostik؛ وقتی مدلهای AI بهجای متن، «حالتهای درونی» را به هم منتقل میکنند
استارتاپ Mostik روشی معرفی کرده که در آن یک مدل بزرگ و یک مدل کوچک بدون ردوبدلکردن متن، از طریق یک Bridge قابلآموزش به هم وصل میشوند. خود مدلها Frozen میمانند و فقط این پل آموزش میبیند.
در آزمایش اولیه، GLM-5.2 با 753B پارامتر به Qwen-3.5 با 4B متصل شد. مدل بزرگ فقط مسئله را میخواند و Hidden State خود را منتقل میکند؛ تولید پاسخ کاملاً برعهده مدل کوچک است. نتیجه: مدل 4B حدود 50٪ فاصله عملکردی با مدل 753B را جبران کرد، دقت خودش حدود 25٪ بالا رفت و در برخی زیرمجموعههای سخت، بهبود تا 2 برابر رسید.
استارتاپ Mostik همچنین میگوید این ترکیب برای کیفیت مشابه، حدود 2.5 برابر Compute کمتر از یک مدل میانرده مصرف میکند و Latent Hand-off در برخی تنظیمات تا 10 واحد درصد بهتر از انتقال معمول متن عمل کرده است.
🔥 ایده اصلی جذاب است: بهجای اینکه یک مدل ابتدا «فکرش را به متن تبدیل کند» تا مدل بعدی آن را بخواند، خودِ Representation داخلی مستقیماً منتقل میشود.
⚠️ درباره «رتبه اول ARC-AGI» باید احتیاط کرد؛ نتایج ARC-AGI-3 فعلاً به تنظیمات و Leaderboard مورد استفاده بستگی دارند و نباید بدون اشاره به منبع، آن را پیروزی قطعی و نهایی تلقی کرد.
[جزئیات فنی Mostik]
https://mostik.ai/read-more
@rss_ai_ir
❤️ حمایت از کانال: [Daramet]
https://daramet.com/Virsun
#Mostik #LLM #LatentSpace #MultiAgent #Qwen #GLM #AIResearch #هوش_مصنوعی

18
17
16
1September 4, 2026 776 5