استارتاپ Mostik؛ وقتی مدل‌های AI به‌جای متن، «حالت‌های درونی» را به… — VIRSUN — TG.ME

🧠🌉استارتاپ Mostik؛ وقتی مدل‌های AI به‌جای متن، «حالت‌های درونی» را به هم منتقل می‌کنند

استارتاپ Mostik روشی معرفی کرده که در آن یک مدل بزرگ و یک مدل کوچک بدون ردوبدل‌کردن متن، از طریق یک Bridge قابل‌آموزش به هم وصل می‌شوند. خود مدل‌ها Frozen می‌مانند و فقط این پل آموزش می‌بیند.

در آزمایش اولیه، GLM-5.2 با 753B پارامتر به Qwen-3.5 با 4B متصل شد. مدل بزرگ فقط مسئله را می‌خواند و Hidden State خود را منتقل می‌کند؛ تولید پاسخ کاملاً برعهده مدل کوچک است. نتیجه: مدل 4B حدود 50٪ فاصله عملکردی با مدل 753B را جبران کرد، دقت خودش حدود 25٪ بالا رفت و در برخی زیرمجموعه‌های سخت، بهبود تا 2 برابر رسید.

استارتاپ Mostik همچنین می‌گوید این ترکیب برای کیفیت مشابه، حدود 2.5 برابر Compute کمتر از یک مدل میان‌رده مصرف می‌کند و Latent Hand-off در برخی تنظیمات تا 10 واحد درصد بهتر از انتقال معمول متن عمل کرده است.

🔥 ایده اصلی جذاب است: به‌جای اینکه یک مدل ابتدا «فکرش را به متن تبدیل کند» تا مدل بعدی آن را بخواند، خودِ Representation داخلی مستقیماً منتقل می‌شود.

⚠️ درباره «رتبه اول ARC-AGI» باید احتیاط کرد؛ نتایج ARC-AGI-3 فعلاً به تنظیمات و Leaderboard مورد استفاده بستگی دارند و نباید بدون اشاره به منبع، آن را پیروزی قطعی و نهایی تلقی کرد.

[جزئیات فنی Mostik]
https://mostik.ai/read-more

@rss_ai_ir
❤️ حمایت از کانال: [Daramet]
https://daramet.com/Virsun

#Mostik #LLM #LatentSpace #MultiAgent #Qwen #GLM #AIResearch #هوش_مصنوعی
❤18👌17🔥16🙏1
September 4, 2026 776 5