⚠️ گزارش فنی: انهدام پایپلاین بازیابی با مسمومسازی توپولوژیک (PoisonedRAG)
در اغلب حملات، هدف اصلی مدل زبانی است؛ اما در عملیات PoisonedRAG، مدل اصلاً لمس نمیشود. مهاجم با آگاهی از اینکه الگوریتمهای بازیابی (Retriever) خروجی را نه بر اساس تحلیل عمیق، بلکه بر پایهٔ تعامد در فضای هایپر–اسپیر (Hyper‑Sphere) رتبهبندی میکنند، مستقیماً دیتابیس مرجع را هدف قرار میدهد.
تنها با تزریق ۵ سند دستکاریشده در میان بیش از ۲.۵ میلیون سند پایگاه دانش، مهاجمین موفق شدند ضریب همبستگی ضرب داخلی (Dot Product) را طوری تغییر دهند که الگوریتم بازیابی، متون مخرب را در بالای فهرست همسایگی نزدیک (K‑Nearest Neighbors) قرار دهد.
با انحراف تابع رتبهبندی، مدل اصلی دچار پذیرش ساختاریافته شد؛ یعنی بدون دریافت هیچ خطایی در لاگهای امنیتی یا تغییر در نرخ پرپلکسیتی (Perplexity)، خروجی نهایی دقیقاً مطابق خواست مهاجم تولید شد.
در این روش، نیازی به شکستن گاردریلهای مدل نیست، زیرا خودِ الگوریتم بهینهسازی سامانه پاسخ مخرب را بهعنوان «منطقیترین پاسخ» انتخاب میکند.
---
🔑 سرنخهای پنهان برای اعضای چنل
- چرا وقتی نرخ ماتریس فوقتراکم به 10⁻⁶ میرسد، الگوریتم KNN همچنان خروجی مسموم را بهعنوان نقطهٔ همگرایی (Convergence) انتخاب میکند؟
- کسانی که با هندسهٔ دیتابیسهای برداری کار کردهاند میدانند:
اگر ضرب داخلی دو بردار به ۱ نزدیک باشد اما فاصلهٔ منهتن (Manhattan Distance) به بینهایت میل کند، یک «سوراخ سوزنی الکترومغناطیسی» در فضای برداری ایجاد شده است.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
6July 31, 2026 493 3