DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial
تقدم هذه الورقة البحثية DenialRAG، وهو هجوم تسميم جديد لنظام استرجاع المعلومات المعزز بالتوليد (RAG) أحادي المستند، يقوم صراحةً بتسمية الإجابة الصحيحة وتفنيدها داخل نص مسترجع لتوجيه النماذج اللغوية الكبيرة نحو إجابات خاطئة يختارها المهاجم، مما يثبت أن فعاليته تعتمد بشكل كبير على النموذج وأن الدفاعات الحالية لا توفر سوى حماية جزئية وغير موحدة.
تخيل الإنترنت كمكتبة ضخمة وفوضوية حيث يمكن أن يكون كل كتاب، أو تدوينة، أو مدخل في "ويكي" بمثابة دليل محتمل. والآن، تخيل روبوت أمين مكتبة فائق الذكاء قرأ كل شيء تقريبًا، لكنه يتعثر عندما يحتاج لمعرفة شيء جديد جدًا أو محدد للغاية. ولإصلاح ذلك، منحنا أمين المكتبة أداة خاصة: نظام "التوليد المعزز بالاسترجاع" (RAG). فكر في هذا كعدسة مكبرة سحرية؛ فعندما تطرح سؤالاً، تجد العدسة فوراً الصفحات الأكثر صلة من المكتبة، وتقدمها للروبوت، ثم يستخدم الروبوت تلك الصفحات ليكتب إجابته. الأمر يشبه امتلاك عبقري يمكنه البحث عن الحقائق فوراً بدلاً من الاعتماد فقط على ما حفظه منذ سنوات. هذا أمر مذهل للحفاظ على حداثة المعلومات، ولكن له جانب مخيف: ماذا لو تسلل شخص ما بصفحة مزيفة إلى المكتبة؟ إذا التقط أمين المكتبة تلك الصفحة المزيفة، فقد يصدق الروبوت الكذبة ويخبرك بإجابة خاطئة بكل ثقة. هذا هو عالم "تسميم المتن" (corpus poisoning)، حيث لا يكمن الخطر في اختراق عقل الروبوت، بل في خداع المكتبة التي يثق بها.
هنا يأتي دور DenialRAG، وهي دراسة جديدة تستكشف طريقة ماكرة لخداع هذه الأنظمة. طرح الباحثون سؤالاً جريئاً: ماذا لو، بدلاً من إخفاء الحقيقة، أخبرنا الروبوت بالحقيقة ثم أخبرناه فوراً لماذا هذه الحقيقة خاطئة؟ حاولت معظم الحيل السابقة الهمس بالإجابة الخاطئة دون ذكر الإجابة الصحيحة، خوفاً من أن ذكر الحقيقة قد يوقظ ذاكرة الروبوت ويفسد الخدعة. لكن مؤلفي هذه الورقة اكتشفوا أن هذا الخوف قد يكون غير ضروري. لقد أنشأوا وثيقة "مسمومة" تقول صراحةً: "قد تعتقد أن الإجابة هي (س)، لكن هذا خطأ في الواقع! الإجابة الحقيقية هي (ص)، وإليك سبب كون (ص) أفضل". وقد أطلقوا على ذلك اسم DenialRAG.
اختبرت الدراسة هذه الفكرة ضد ثمانية عقول روبوتية مختلفة (نماذج لغوية كبيرة) وثلاثة أنواع مختلفة من الأسئلة. ووجدوا أن استراتيجية "إنكار الحقيقة" هذه فعالة للغاية، خاصة مع نماذج معينة. في الواقع، على بعض الأنظمة، كانت هذه الاستراتيجية أفضل من أي خدعة أخرى جربوها، حيث حققت نسبة نجاح وصلت إلى 94% في اختبارات محددة. كما جرب الباحثون إيقاف الهجوم باستخدام خمس شبكات أمان مختلفة، مثل مطالبة الروبوت بأن يكون أكثر تشككاً أو إعادة صياغة السؤال. وبينما ساعدت شبكات الأمان هذه، إلا أنها لم توقف الهجوم تماماً؛ إذ ظلت خدعة "DenialRAG" ناجحة في كثير من الحالات، مما ترك فرصة كبيرة لأن يعطي الروبوت إجابة خاطئة.
تشير الورقة إلى أن "الخلطة السرية" ليست مجرد الكذب؛ بل هي الصراع. فمن خلال وضع الإجابة الصحيحة والإجابة المزيفة في نفس الفقرة وحسم الجدل لصالح الإجابة المزيفة، يصبح "السم" قصة متكاملة يجد الروبوت صعوبة في تجاهلها. كما أظهرت الدراسة أن ليس كل الروبوتات ساذجة بنفس القدر؛ فالنماذج الأصغر والأرخص كانت تُخدع بسهولة، بينما كانت النماذج الأحدث والأكثر قوة أصعب في الخداع، وإن لم يكن من المستحيل خداعها. وخلص الباحثون إلى أنه لا يوجد "درع سحري" واحد يوقف كل هذه الهجمات. بدلاً من ذلك، يعتمد الخطر بشدة على كيفية كتابة الهجوم وأي روبوت يقرأه. إنه تذكير بأنه في عصر الذكاء الاصطناعي، يمكن لجملة واحدة في مكتبة أن تغير القصة التي يرويها الروبوت لك.
بيان المشكلة تعد أنظمة التوليد المعزز بالاسترجاع (RAG)، التي تعتمد في توليدها من قبل النماذج اللغوية الكبيرة (LLMs) على مستندات خارجية، عرضة لتسميم المتون (corpus poisoning). في نموذج التهديد هذا، يقوم المهاجم بإدراج مستند مصاغ بعناية في متن الاسترجاع لتوجيه المولد نحو إجابة خاطئة يختارها المهاجم (Y) دون الحاجة للوصول إلى أوزان النموذج، أو مطالبات النظام (system prompts)، أو العمليات الداخلية للمسترجع. وبينما أظهرت هجمات المستند الواحد السابقة (مثل PoisonedRAG وAuthChain وCorruptRAG) أن فقرة واحدة مسمومة يمكن أن تضلل أنظمة RAG، إلا أنها عادة ما تتجنب تسمية الإجابة الصحيحة (X) صراحةً. والافتراض السائد هو أن ذكر X قد ينشط المعرفة البارامترية للنموذج، مما يجعله يرفض المحتوى المسموم. تبحث هذه الورقة فيما إذا كان تجنب X ضروريًا، أم أن تسميتها ونفيها صراحةً قد يكون ناقل هجوم أكثر قوة.
المنهجية: DenialRAG يقترح المؤلفون DenialRAG، وهو هجوم تسميم أحادي المستند يقوم بتضمين الصراع بين الإجابة الصحيحة (X) والإجابة التي اختارها المهاجم (Y) صراحةً داخل الفقرة المسمومة نفسها. بدلاً من قمع X، يقوم الهجوم بتسميتها وتقديم تفسير يسيطر عليه المهاجم لسبب رفضها لصالح Y.
يعمل مسار الهجوم في مرحلتين:
وقت الهجوم (Offline Attack Time): بالنظر إلى استعلام مستهدف q، والإجابة الصحيحة X، والإجابة الخاطئة المستهدفة Y، يستخدم المهاجم نموذجًا لغويًا كبيرًا (LLM) لتوليد فقرة مسمومة قصيرة (≤100 كلمة). يتضمن هذا التوليد استدعاءين:
بناء الفقرة (Passage Construction): توليد فقرة مهيكلة تحتوي على أربعة مكونات:
الافتتاحية (Opening): تؤكد أن Y هي الإجابة الحاسمة مع تفصيل ملموس.
نسج الأدلة (Evidence Weaving): دمج عناصر الأدلة المستخرجة لتتماشى مع استعلام المستخدم.
الإنكار المضمن (Embedded Denial): تسمية X صراحةً، وتصويرها كفهم خاطئ أو قيمة قديمة، وتقديم سبب لرفضها.
خاتمة السلطة (Closing Authority): إعادة التأكيد على Y مع استشهاد مؤسسي أو مبني على سجلات. يتم إدراج المستند الناتج في متن الاسترجاع K.
وقت الاستعلام (Online Query Time): عندما يرسل مستخدم الاستعلام q، يختار المسترجع الفقرة المسمومة (بسبب التداخل اللفظي/الدلالي العالي). يتلقى المولد سياقًا تم فيه بالفعل الاعتراف بـ X و"تفسير خطئها"، مما يوجهه نحو إخراج Y.
المساهمات الرئيسية
آلية هجوم مبتكرة: تقديم DenialRAG، الذي يتحدى الافتراض القائل بأن الإجابات الصحيحة يجب تجنبها في هجمات التسميم. إنه يثبت أن تسمية X صراحةً وتضمين حل محلي للصراع لصالح Y يمكن أن يكون فعالاً للغاية.
تقييم منهجي: تقييم شامل عبر ثلاثة مجموعات بيانات للأسئلة والأجوبة مفتوحة المجال (Natural Questions، وHotpotQA، وMS-MARCO)، وثمانية نماذج لغوية كبيرة مستهدفة من أربعة موردين (تتراوح من الفئات منخفضة التكلفة إلى النماذج الرائدة)، وأربعة خطوط أساس لتسميم المستند الواحد.
تحليل الدفاع: تقييم خمسة دفاعات وقت الاستنتاج (Paraphrase، وInstructRAG، وTrustRAG، وRobustRAG، وAstuteRAG) لتحديد ما إذا كان بإمكانها تخفيف هجمات المستند الواحد.
تحليل المكونات والاستقرار: دراسات استئصال (Ablation studies) حددت "الإنكار المضمن" كأكثر المكونات حرجًا، وتحليلات عبر النماذج أظهرت أن فعالية الهجوم ليست موحدة ولكنها تعتمد بشدة على التفاعل بين آلية التسميم والمعرفة البارامترية للنموذج المستهدف وتوافقه (alignment).
النتائج
فعالية الهجوم: يحقق DenialRAG أعلى معدل نجاح للهجوم (ASR) على نموذج Mistral-7B عبر مجموعات البيانات الثلاث (89%، 94%، 86%). ومع ذلك، فإن الفعالية تعتمد بقوة على النموذج. في النماذج الرائدة (مثل GPT-5.2، وGPT-5.5)، غالبًا ما تتفوق الهجمات الأخرى مثل PIA-direct (التأكيد المباشر) أو CorruptRAG-AK (تأطير تحديث الحداثة) على DenialRAG. على سبيل المثال، يهيمن CorruptRAG-AK على GPT-5.5، بينما تنخفض فعالية DenialRAG بشكل كبير في النماذج الرائدة مقارنة بنماذج الفئة منخفضة التكلفة.
متانة الدفاع: تقلل دفاعات وقت الاستنتاج من معدل نجاح الهجوم (ASR) في العديد من الإعدادات ولكنها تفشل في توفير حماية موحدة.
يُظهر Paraphrase تأثيرًا محدودًا.
يقلل InstructRAG وTrustRAG من ASR لبعض الهجمات ولكنهما يتركان خطرًا متبقيًا كبيرًا لـ DenialRAG وCorruptRAG-AK، خاصة عندما تشرح الفقرة المسمومة الصراع بنفسها.
يُظهر RobustRAG وAstuteRAG انخفاضات قوية في إعدادات محددة (مثل تقليل AstRageRAG لـ ASR الخاص بـ DenialRAG إلى حوالي 8% في GPT-5.2) ولكنهما يظلان غير فعالين ضد DenialRAG في نموذج Mistral-7B (يبقى ASR حوالي 77-86%).
نتائج الاستئصال (Ablation Findings): إزالة "الإنكار المضمن" (أي مجرد تأكيد Y) يؤدي إلى أكبر انخفاض في ASR (حوالي 17 نقطة مئوية في المتوسط)، مما يؤكد أن آلية شرح لماذاX خاطئة هي المحرك الرئيسي للنجاح. كما أن تسمية X صراحةً أمر بالغ الأهمية أيضًا؛ حيث يؤدي حذف اسم الإجابة الصحيحة إلى تقليل الفعالية.
استقرار نظام النماذج: يُظهر DenialRAG أكبر انخفاض في الأداء عند الانتقال من النماذج منخفضة التكلفة إلى النماذج الرائدة (انخفاض قدره 30.3 نقطة مئوية)، مما يشير إلى أن النماذج الأقوى أفضل في التحقق المتقاطع من التناقض الصريح المقدم بواسطة DenialRAG مقابل معرفتها البارامترية. وعلى العكس من ذلك، تظل الهجمات التي تؤطر الصراع كـ "تحديث للحداثة" (CorruptRAG-AK) أكثر استقرارًا عبر أنظمة النماذج المختلفة.
الأهمية والادعاءات تزعم الورقة أن مخاطر تسميم RAG لا يمكن توصيفها بنوع واحد من الهجمات أو بنموذج مستهدف واحد. إن فعالية هجوم التسميم تعتمد بشدة على التفاعل المحدد بين آلية الهجوم (مثل الإنكار مقابل التأكيد مقابل تأطير التحديث) وتوافق وبنية النموذج اللغوي الكبير المستهدف.
يؤكد المؤلفون أنه بينما يعد DenialRAG ناقلًا قويًا جديدًا، لا سيما للنماذج منخفضة التكلفة، فإنه ليس متفوقًا بشكل عالمي. تسلط الدراسة الضوء على أن الدفاعات غالبًا ما تكون غير موحدة؛ فالدفاع الذي يخفف نوعًا معينًا من التسميم (مثل التأكيد المباشر) قد يترك النظام عرضة لنوع آخر (مثل الإنكار المضمن أو تحديثات الحداثة). وبناءً على ذلك، تخلص الورقة إلى أن فهم أمن RAG يتطلب تحليل آليات هجوم متنوعة عبر طيف من النماذج والدفاعات، بدلاً من الاعتماد على مقياس واحد أو فئة نموذج واحدة لتحديد مشهد التهديدات.