← أحدث الأبحاث
💻 computer science

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

تقدم هذه الورقة البحثية DenialRAG، وهو هجوم تسميم جديد لنظام استرجاع المعلومات المعزز بالتوليد (RAG) أحادي المستند، يقوم صراحةً بتسمية الإجابة الصحيحة وتفنيدها داخل نص مسترجع لتوجيه النماذج اللغوية الكبيرة نحو إجابات خاطئة يختارها المهاجم، مما يثبت أن فعاليته تعتمد بشكل كبير على النموذج وأن الدفاعات الحالية لا توفر سوى حماية جزئية وغير موحدة.

المؤلفون الأصليون: Abay Zhurekbay, Tao Liu, Fan Li

نُشر 2026-08-05
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Abay Zhurekbay, Tao Liu, Fan Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل الإنترنت كمكتبة ضخمة وفوضوية حيث يمكن أن يكون كل كتاب، أو تدوينة، أو مدخل في "ويكي" بمثابة دليل محتمل. والآن، تخيل روبوت أمين مكتبة فائق الذكاء قرأ كل شيء تقريبًا، لكنه يتعثر عندما يحتاج لمعرفة شيء جديد جدًا أو محدد للغاية. ولإصلاح ذلك، منحنا أمين المكتبة أداة خاصة: نظام "التوليد المعزز بالاسترجاع" (RAG). فكر في هذا كعدسة مكبرة سحرية؛ فعندما تطرح سؤالاً، تجد العدسة فوراً الصفحات الأكثر صلة من المكتبة، وتقدمها للروبوت، ثم يستخدم الروبوت تلك الصفحات ليكتب إجابته. الأمر يشبه امتلاك عبقري يمكنه البحث عن الحقائق فوراً بدلاً من الاعتماد فقط على ما حفظه منذ سنوات. هذا أمر مذهل للحفاظ على حداثة المعلومات، ولكن له جانب مخيف: ماذا لو تسلل شخص ما بصفحة مزيفة إلى المكتبة؟ إذا التقط أمين المكتبة تلك الصفحة المزيفة، فقد يصدق الروبوت الكذبة ويخبرك بإجابة خاطئة بكل ثقة. هذا هو عالم "تسميم المتن" (corpus poisoning)، حيث لا يكمن الخطر في اختراق عقل الروبوت، بل في خداع المكتبة التي يثق بها.

هنا يأتي دور DenialRAG، وهي دراسة جديدة تستكشف طريقة ماكرة لخداع هذه الأنظمة. طرح الباحثون سؤالاً جريئاً: ماذا لو، بدلاً من إخفاء الحقيقة، أخبرنا الروبوت بالحقيقة ثم أخبرناه فوراً لماذا هذه الحقيقة خاطئة؟ حاولت معظم الحيل السابقة الهمس بالإجابة الخاطئة دون ذكر الإجابة الصحيحة، خوفاً من أن ذكر الحقيقة قد يوقظ ذاكرة الروبوت ويفسد الخدعة. لكن مؤلفي هذه الورقة اكتشفوا أن هذا الخوف قد يكون غير ضروري. لقد أنشأوا وثيقة "مسمومة" تقول صراحةً: "قد تعتقد أن الإجابة هي (س)، لكن هذا خطأ في الواقع! الإجابة الحقيقية هي (ص)، وإليك سبب كون (ص) أفضل". وقد أطلقوا على ذلك اسم DenialRAG.

اختبرت الدراسة هذه الفكرة ضد ثمانية عقول روبوتية مختلفة (نماذج لغوية كبيرة) وثلاثة أنواع مختلفة من الأسئلة. ووجدوا أن استراتيجية "إنكار الحقيقة" هذه فعالة للغاية، خاصة مع نماذج معينة. في الواقع، على بعض الأنظمة، كانت هذه الاستراتيجية أفضل من أي خدعة أخرى جربوها، حيث حققت نسبة نجاح وصلت إلى 94% في اختبارات محددة. كما جرب الباحثون إيقاف الهجوم باستخدام خمس شبكات أمان مختلفة، مثل مطالبة الروبوت بأن يكون أكثر تشككاً أو إعادة صياغة السؤال. وبينما ساعدت شبكات الأمان هذه، إلا أنها لم توقف الهجوم تماماً؛ إذ ظلت خدعة "DenialRAG" ناجحة في كثير من الحالات، مما ترك فرصة كبيرة لأن يعطي الروبوت إجابة خاطئة.

تشير الورقة إلى أن "الخلطة السرية" ليست مجرد الكذب؛ بل هي الصراع. فمن خلال وضع الإجابة الصحيحة والإجابة المزيفة في نفس الفقرة وحسم الجدل لصالح الإجابة المزيفة، يصبح "السم" قصة متكاملة يجد الروبوت صعوبة في تجاهلها. كما أظهرت الدراسة أن ليس كل الروبوتات ساذجة بنفس القدر؛ فالنماذج الأصغر والأرخص كانت تُخدع بسهولة، بينما كانت النماذج الأحدث والأكثر قوة أصعب في الخداع، وإن لم يكن من المستحيل خداعها. وخلص الباحثون إلى أنه لا يوجد "درع سحري" واحد يوقف كل هذه الهجمات. بدلاً من ذلك، يعتمد الخطر بشدة على كيفية كتابة الهجوم وأي روبوت يقرأه. إنه تذكير بأنه في عصر الذكاء الاصطناعي، يمكن لجملة واحدة في مكتبة أن تغير القصة التي يرويها الروبوت لك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →