🚀🧠 بدون آموزش مجدد، عملکرد DeepSeek V4 Pro در بعضی بنچمارکها جهش کرد!
یک گزارش تازه درباره DeepSeek V4 Pro 0813 نکته مهمی را نشان میدهد: برای قویتر کردن یک مدل، همیشه لازم نیست دوباره آن را آموزش دهید یا وزنهایش را تغییر دهید.
چارچوبی به نام J-Space Cognition Suite به مدل متصل شده و تلاش میکند بخشی از تواناییهایی را که مدل از قبل دارد، در وظایف طولانی و عاملمحور بهتر استخراج کند. خود گزارش تأکید میکند که هیچ تغییری در وزنهای DeepSeek ایجاد نشده است.
ایده اصلی این است که مشکل بعضی مدلهای قدرتمند الزاماً «کمبود هوش» نیست.
مدل ممکن است در یک مأموریت طولانی:
🔹 هدف اصلی را بهتدریج فراموش کند
🔹 بعد از فراخوانی ابزار مسیر استدلالش تغییر کند
🔹 یک خطا را بدون فهمیدن علت چند بار تکرار کند
🔹 تصور کند کار تمام شده، درحالیکه نتیجه هنوز بررسی نشده
🔹 یا در زنجیرههای طولانی استدلال گرفتار شود.
چارچوب J-Space یک لایه کنترلی روی مدل قرار میدهد و با استفاده از حافظه وضعیت، Checkpoint، مدیریت Workflow، بازیابی بعد از خطا و Verification تلاش میکند این اتلاف توانایی را کاهش دهد. نویسنده این پدیده را «Capability-Realization Loss» مینامد.
📊 اعداد منتشرشده برای ترکیب DeepSeek V4 Pro + J-Space قابلتوجهاند:
Terminal Bench:
۸۷.۹ ← ۹۰.۱
NL2Repo:
۶۱.۵ ← ۷۳.۴
CyberGym:
۸۳.۳ ← ۸۶.۸
DeepSWE:
۶۲.۷ ← ۷۲.۰
Toolathlon:
۷۴.۱ ← ۷۹.۵
در آزمون HLE همراه ابزار نیز امتیاز از ۶۰.۰ به ۶۷.۷ و در AutomationBench از ۳۱.۸ به ۳۸.۲ رسیده است.
🔥 نکته جالبتر اینکه در جدول منتشرشده، این ترکیب در چند آزمون عاملمحور و برنامهنویسی بالاتر از نتایج عمومی گزارششده برای مدلهایی مانند Opus 4.8 و Fable 5 قرار گرفته است.
اما یک هشدار بسیار مهم وجود دارد:
⚠️ این نتایج هنوز یک مقایسه کاملاً استاندارد و مستقل میان همه مدلها نیستند.
خود نویسنده گزارش صراحتاً میگوید نتایج J-Space فعلاً اجرای تکمرحلهای (Single Run) هستند، میانگین چند اجرا و Confidence Interval ندارند و امتیاز مدلهای رقیب نیز از نتایج عمومی شرکتهای مختلف گرفته شده است؛ بنابراین نمیتوان از این جدول نتیجه گرفت که DeepSeek در شرایط کاملاً یکسان قطعاً از همه آنها بهتر است.
این احتیاط اتفاقاً نکته پژوهشی ماجرا را جذابتر میکند.
💡 شاید یکی از رقابتهای مهم نسل بعدی هوش مصنوعی فقط این نباشد:
«چه کسی مدل بزرگتر و قویتری آموزش میدهد؟»
بلکه این باشد:
«چه کسی میتواند توانایی موجود در مدل را بهتر به عملکرد واقعی تبدیل کند؟»
در این نگاه، عملکرد نهایی یک Agent چیزی شبیه این میشود:
مدل پایه + حافظه + ابزارها + مدیریت Context + Verification + Harness
و این یعنی ممکن است یک Harness خوب بدون تغییر حتی یک پارامتر، تفاوت قابلتوجهی در عملکرد عملی یک مدل ایجاد کند.
📌 خود پروژه نیز این ادعا را مطرح نمیکند که J-Space «هوش جدیدی» به DeepSeek اضافه کرده است؛ بلکه هدفش این است که مدل تواناییهایی را که از قبل دارد، پایدارتر استفاده کند.
[گزارش و مخزن DeepSeek V4 × J-Space در GitHub](https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report?utm_source=chatgpt.com)
@rss_ai_ir
#هوش_مصنوعی #دیپ_سیک #عامل_هوشمند #استدلال #برنامه_نویسی #DeepSeek #JSpace #AIAgents #Reasoning #CodingAgent #LLM #AgenticAI #AI

3
1
1August 18, 2026 670 13