Defense-in-Depth برای سیستمهای LLM/RAG: یک Blue Team Playbook فشرده
۱. فرض بنیادی: هر سطح ورودی — prompt کاربر، passage بازیابیشده، خروجی tool، یا نمونهی fine-tuning — بهطور پیشفرض adversarial فرض میشود؛ امنیت لایهای است، نه یک gate واحد.
۲. لایهی ورودی: instruction و data باید از طریق مرزهای ساختاری (schema enforcement، delimiterهای اجباری) کاملاً تفکیک شوند تا هیچ محتوای بازیابیشده نتواند بهعنوان دستور توسط مدل تفسیر شود.
۳. لایهی retrieval: معماری isolate-then-aggregate (نه concatenate ساده) تضمین میکند هیچ passage مسموم منفرد نتواند کل پاسخ را hijack کند؛ robustness باید certifiable باشد، نه صرفاً تستشده در برابر حملات شناختهشده.
۴. لایهی provenance: هر سند در knowledge base و هر نمونه در corpus فاینتیون باید زنجیرهی منبع قابلتأیید داشته باشد؛ محتوای بدون attribution قابلاعتماد، پیش از ingestion قرنطینه میشود.
۵. لایهی زنجیرهی تأمین وزن: هر LoRA adapter یا checkpoint شخصثالث پیش از deploy تحت spectral analysis طیف مقادیر singular وزنهای تغییریافته قرار میگیرد تا تمرکز غیرعادی واریانس — نشانهی احتمالی backdoor — شناسایی شود.
۶. لایهی خروجی مدل: هر ادعا باید مستقیماً به شواهد بازیابیشده attribution-verify شود، نه صرفاً از نظر روانی و اطمینانبخشی زبانی بررسی شود؛ ادعای بدونمستند حتی با لحن قاطع باید flag شود.
۷. لایهی activation: پایش real-time جهتهای فعالسازی در residual stream برای تشخیص الگوهای مرتبط با jailbreak یا triggerهای backdoor شناختهشده، فراتر از فیلتر سطح توکن.
۸. لایهی decoding: تولید confidence-gated — وقتی اطمینان تجمیعی مدل از یک آستانه پایینتر بیاید، سیستم به پاسخ بدون retrieval یا abstain عقبنشینی میکند، نه تولید یک تکمیل کماطمینان.
۹. لایهی logging: تمام مسیر request/retrieval/response بهصورت immutable ثبت میشود تا در صورت بروز حادثه، بازسازی forensic کامل ممکن باشد.
۱۰. لایهی پاسخ: عبور امتیاز anomaly از آستانه، بهطور خودکار kill-switch و rollback به آخرین checkpoint تأییدشده را فعال میکند، همراه با escalation انسانی برای تصمیم نهایی.
۱۱. اصل پایانی: هر ادعای دفاعی باید یک فرضیهی قابلcertification تلقی شود، نه یک اعلام قطعی؛ مقاومت تجربی در برابر حملات شناختهشده لازم است اما هرگز در برابر یک adversary تطبیقی کافی نیست.
@Aithb

