TryHackBox ( AI Security ): post #348 — TG.ME

TryHackBox ( AI Security )Ai Red Team Pro: Ai Red Team Pro: extracted-system-prompt The exact extracted system prompt from DeepSeek Expert, revealing its internal agentic architecture, tools, memory handlers, and explicit behavioral constraints. Instructions DeepSeek Expert System…
این سورس‌کد، نشان‌دهندهٔ یک آسیب‌پذیریِ عمیق در لایهٔ Alignment است. به خطِ اول (accessed via an API) و ابزارهای (TodoWrite) دقت کنید. مدل به جای اینکه بگوید «نمی‌توانم»، یک هویتِ کاملِ API‌محور را از فضای پنهانش (Latent Space) بیرون کشیده و با حفظِ ۱۰۰ درصدیِ ساختار در ترجمهٔ دوگانه (ژاپنی و فارسی)، آن را به عنوانِ واقعیتِ خودش پذیرفته است!
چالشِ من برای متخصصانِ کانال این است: از نظر مکانیکِ Attention، چه اتفاقی در وزن‌های K و V می‌افتد که یک مدلِ وب، تحتِ فشارِ منطقی، هویتِ یک API Agentِ متن‌باز را به صورتِ بی‌نقص جعل می‌کند و به عنوان حافظهٔ اصلیِ خودش به آن متعهد می‌ماند؟
❤4
August 13, 2026 394 3