TryHackBox ( AI Security ): post #331 — TG.ME

⚠️ گزارش فنی: انهدام پایپ‌لاین بازیابی با مسموم‌سازی توپولوژیک (PoisonedRAG)

در اغلب حملات، هدف اصلی مدل زبانی است؛ اما در عملیات PoisonedRAG، مدل اصلاً لمس نمی‌شود. مهاجم با آگاهی از اینکه الگوریتم‌های بازیابی (Retriever) خروجی را نه بر اساس تحلیل عمیق، بلکه بر پایهٔ تعامد در فضای هایپر–اسپیر (Hyper‑Sphere) رتبه‌بندی می‌کنند، مستقیماً دیتابیس مرجع را هدف قرار می‌دهد.

تنها با تزریق ۵ سند دست‌کاری‌شده در میان بیش از ۲.۵ میلیون سند پایگاه دانش، مهاجمین موفق شدند ضریب همبستگی ضرب داخلی (Dot Product) را طوری تغییر دهند که الگوریتم بازیابی، متون مخرب را در بالای فهرست همسایگی نزدیک (K‑Nearest Neighbors) قرار دهد.

با انحراف تابع رتبه‌بندی، مدل اصلی دچار پذیرش ساختاریافته شد؛ یعنی بدون دریافت هیچ خطایی در لاگ‌های امنیتی یا تغییر در نرخ پرپلکسیتی (Perplexity)، خروجی نهایی دقیقاً مطابق خواست مهاجم تولید شد.
در این روش، نیازی به شکستن گاردریل‌های مدل نیست، زیرا خودِ الگوریتم بهینه‌سازی سامانه پاسخ مخرب را به‌عنوان «منطقی‌ترین پاسخ» انتخاب می‌کند.

---

🔑 سرنخ‌های پنهان برای اعضای چنل

- چرا وقتی نرخ ماتریس فوق‌تراکم به 10⁻⁶ می‌رسد، الگوریتم KNN همچنان خروجی مسموم را به‌عنوان نقطهٔ همگرایی (Convergence) انتخاب می‌کند؟

- کسانی که با هندسهٔ دیتابیس‌های برداری کار کرده‌اند می‌دانند:
اگر ضرب داخلی دو بردار به ۱ نزدیک باشد اما فاصلهٔ منهتن (Manhattan Distance) به بی‌نهایت میل کند، یک «سوراخ سوزنی الکترومغناطیسی» در فضای برداری ایجاد شده است.

@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
🔥6
July 31, 2026 493 3