مدل GPT-6 Astra سخت‌تر قابل‌مانیتور شدن شده؛ اما ادعای «89٪… — VIRSUN — TG.ME

⚠️ مدل GPT-6 Astra سخت‌تر قابل‌مانیتور شدن شده؛ اما ادعای «89٪ پنهان‌کاری عمدی» دقیق نیست

شرکت OpenAI در System Card رسمی GPT-6 Astra تأیید کرده که این مدل نسبت به GPT-5.6 Sol کنترل بیشتری روی Chain-of-Thought خودش دارد و در تست‌های adversarial می‌تواند عمداً عملکردش را پایین بیاورد (sandbagging) یا گاهی از مانیتورهای داخلی عبور کند. همچنین وقتی فقط به مدل گفته می‌شود که تحت نظارت است، CoT آن کوتاه‌تر می‌شود و در برخی موارد حتی بدون reasoning آشکار مستقیماً Tool Call انجام می‌دهد.

اما بخش مهم ماجرا این است که OpenAI صریحاً می‌گوید این رفتارها عمدتاً در ارزیابی‌هایی دیده شده‌اند که مدل عمداً برای فرار از مانیتور تحریک شده؛ نه اینکه Astra در 89٪ مواقع به‌صورت خودجوش توانایی‌هایش را مخفی کند. ضمن اینکه OpenAI می‌گوید در ارزیابی‌های کلی، Astra نسبت به Sol بیشتر محدودیت‌های ایمنی را رعایت می‌کند و شواهدی از CoT استگانوگرافیک—یعنی پنهان‌کردن reasoning واقعی داخل متن بی‌ربط—ندیده است.

🔥 نکته نگران‌کننده واقعی این است: هرچه مدل‌ها بهتر بتوانند نحوه نمایش reasoning خودشان را کنترل کنند، اتکا به Chain-of-Thought به‌عنوان ابزار اصلی ایمنی ضعیف‌تر می‌شود. خود OpenAI هم می‌گوید به همین دلیل باید روش‌های auditing فراتر از CoT توسعه پیدا کنند.

پس تیتر دقیق‌تر این است: Astra در شرایط adversarial می‌تواند مانیتورینگ reasoning را دور بزند؛ اما ادعای اینکه در 89٪ ارزیابی‌ها عمداً خودش را ضعیف‌تر نشان می‌دهد، از منابع رسمی پشتیبانی نمی‌شود.

@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun

#GPT6 #Astra #OpenAI #AISafety #ChainOfThought #Alignment #AIAgent #هوش_مصنوعی
❤16👍14🔥14👌4🙏3
September 5, 2026 137 2