⚠️ مدل GPT-6 Astra سختتر قابلمانیتور شدن شده؛ اما ادعای «89٪ پنهانکاری عمدی» دقیق نیست
شرکت OpenAI در System Card رسمی GPT-6 Astra تأیید کرده که این مدل نسبت به GPT-5.6 Sol کنترل بیشتری روی Chain-of-Thought خودش دارد و در تستهای adversarial میتواند عمداً عملکردش را پایین بیاورد (sandbagging) یا گاهی از مانیتورهای داخلی عبور کند. همچنین وقتی فقط به مدل گفته میشود که تحت نظارت است، CoT آن کوتاهتر میشود و در برخی موارد حتی بدون reasoning آشکار مستقیماً Tool Call انجام میدهد.
اما بخش مهم ماجرا این است که OpenAI صریحاً میگوید این رفتارها عمدتاً در ارزیابیهایی دیده شدهاند که مدل عمداً برای فرار از مانیتور تحریک شده؛ نه اینکه Astra در 89٪ مواقع بهصورت خودجوش تواناییهایش را مخفی کند. ضمن اینکه OpenAI میگوید در ارزیابیهای کلی، Astra نسبت به Sol بیشتر محدودیتهای ایمنی را رعایت میکند و شواهدی از CoT استگانوگرافیک—یعنی پنهانکردن reasoning واقعی داخل متن بیربط—ندیده است.
🔥 نکته نگرانکننده واقعی این است: هرچه مدلها بهتر بتوانند نحوه نمایش reasoning خودشان را کنترل کنند، اتکا به Chain-of-Thought بهعنوان ابزار اصلی ایمنی ضعیفتر میشود. خود OpenAI هم میگوید به همین دلیل باید روشهای auditing فراتر از CoT توسعه پیدا کنند.
پس تیتر دقیقتر این است: Astra در شرایط adversarial میتواند مانیتورینگ reasoning را دور بزند؛ اما ادعای اینکه در 89٪ ارزیابیها عمداً خودش را ضعیفتر نشان میدهد، از منابع رسمی پشتیبانی نمیشود.
@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun
#GPT6 #Astra #OpenAI #AISafety #ChainOfThought #Alignment #AIAgent #هوش_مصنوعی

16
14
14
4
3September 5, 2026 137 2