← أحدث الأبحاث
💬 NLP

TriShieldRAG: A Three-Ring Defense-in-Depth Framework Against Knowledge Corruption in Retrieval-Augmented Generation

يعد TriShieldRAG إطار عمل دفاعي ثلاثي الطبقات يقلل بشكل كبير من معدل نجاح هجمات تسميم المعرفة في أنظمة التوليد المعزز بالاسترجاع (RAG) من حوالي 91% إلى 13% عبر الجمع بين حارس الاستيعاب، ومُقيّم الاسترجاع، وآلية توافق النماذج اللغوية الكبيرة المتعددة، مع الحفاظ على الدقة في الاستعلامات السليمة.

المؤلفون الأصليون: Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

نُشر 2026-07-28
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً حيث يمتلك صديقك الروبوت المفضل، فائق الذكاء، والذي سنسميه "الأوراكل" (The Oracle)، معرفة بكل شيء تقريباً. لكن هناك عقبة: "الأوراكل" يتذكر فقط ما تعلمه في المدرسة منذ سنوات مضت. إذا سألته عن فيلم جديد تماماً أو وصفة عائلية سرية، فعليه أن يخمن أو يبتكر شيئاً من عنده. ولإصلاح ذلك، منحا "الأوراكل" بطاقة مكتبة. الآن، كلما طرحت سؤالاً، يقوم "الأوراكل" بسرعة بجلب بضعة كتب من المكتبة، ويقرأها، ثم يستخدم هذه المعلومات الجديدة للإجابة عليك. هذا ما يسمى التوليد المعزز بالاسترجاع (Retrieval-Augmented Generation)، أو RAG اختصاراً. الأمر يشبه إعطاء ورقة غش لـ "عبقري" قبيل بدء الاختبار مباشرة.

لكن هناك مشكلة خفية في هذا الإعداد. ماذا لو تسلل شخص ما إلى المكتبة وزرع بعض الكتب المزيفة التي تبدو تماماً مثل الكتب الحقيقية؟ إذا وُضعت هذه الكتب المزيفة بجانب الإجابات الحقيقية، فقد يقرؤها "الأوراكل"، ويعتقد أنها حقيقية، ويعطيك إجابة خاطئة تماماً. هذا ما يسمى تسميم البيانات (Data Poisoning). إنه يشبه قيام شخص ما بمقلب عبر استبدال مكونات وصفة كعكة بالملح والرمل؛ يتبع الخباز ("الأوراكل") التعليمات بدقة، لكن النتيجة تكون كارثية. السؤال الكبير الذي يطرحه العلماء الآن هو: كيف نمنع المتلاعبين من خداع روبوتاتنا الذكية باستخدام كتب مكتبية مزيفة؟

تقدم هذه الورقة نظام مكتبة جديداً وشديد الأمان يسمى TriShieldRAG. بدلاً من الاعتماد على حارس أمن واحد للتحقق من الكتب، بنى المؤلفون نظام دفاع مكون من ثلاث حلقات، مثل قلعة ذات ثلاث طبقات من الحماية. لقد اختبروا هذا النظام ضد نوع محدد من المتلاعبين (الذين يزرعون خمسة كتب مزيفة لخداع الروبوت)، ووجدوا أنه بينما كان الروبوت يتعرض للخداع بنسبة 91% مع عدم وجود أي دفاعات، فإن نظام الثلاث حلقات الجديد خفض معدل الخداع هذا إلى 13% فقط.

حلقات الدفاع الثلاث

فكر في المكتبة كأنها مطار مزدحم. الكتب المزيفة هي "السم" الذي يحاول التسلل. صمم المؤلفون ثلاث نقاط تفتيش، أو "حلقات"، يجب أن تمر الكتب من خلالها قبل أن تصل إلى "الأوراكل".

الحلقة 1: الحارس عند الباب (حارس الإدخال - Ingest Guard)
الحلقة الأولى تشبه حارساً صارماً يتحقق من كل كتاب بمجرد محاولة شخص ما وضعه على الرف. يبحث هذا الحارس عن علامات حمراء واضحة. إذا كان الكتاب مكتوباً بطريقة غريبة ومتكررة، أو إذا كان يحتوي على السؤال الذي ستطرحه بالضبط (مثل كتاب بعنوان "من اخترع المصباح الكهربائي؟" يقع بجوار الإجابة مباشرة)، فإن الحارس يطرده فوراً. في اختبارات الورقة، كانت هذه الحلقة هي "اللاعب الثقيل"، حيث اصطادت الغالبية العظمى من الكتب المزيفة قبل دخولها المكتبة حتى. إنها خط الدفاع الأول، الذي يوقف أبسط الحيل عند الباب.

الحلقة 2: أمينة المكتبة الموثوقة (مقيّم الاسترجاع - Retrieval Scorer)
أحياناً، يكون الكتاب المزيف مكتوباً بشكل جيد لدرجة أن الحارس قد يخطئه. يتسلل ويستقر على الرف. عندما تطرح سؤالاً، تسحب المكتبة أفضل خمسة كتب تبدو أكثر صلة بسؤالك. الحلقة الثانية هي أمينة مكتبة ذكية تعيد تقييم تلك الكتب الخمسة. لا تكتفي هذه الأمينة بالنظر في مدى مطابقة الكتاب لسؤالك فحسب، بل تتحقق من شيئين آخرين: المصدر (من أين جاء هذا الكتاب؟ هل هو من مصدر موثوق مثل موسوعة شهيرة، أم من مدونة عشوائية؟) والاتساق (هل تتفق الكتب الأخرى في المجموعة مع هذا الكتاب؟). إذا كان الكتاب من مصدر مجهول ويتعارض مع الكتب الأربعة الأخرى، فإن أمينة المكتبة تصنفه ككتاب مشبوه وتدفعه إلى مؤخرة الصف. تشير الورقة إلى أن هذه الحلقة تعمل بشكل أفضل طالما ظلت الكتب المزيفة هي "الأقلية" في المجموعة؛ فإذا نجح المتلاعب في ملء الرف بأكمله بالكتب المزيفة، فقد ترتبك هذه الحلقة.

الحلقة 3: لجنة القضاة (إجماع النماذج اللغوية الكبيرة المتعددة - Cross-LLM Consensus)
إذا نجت الكتب من الحلقتين الأولى والثانية ووصلت إلى "الأوراكل"، تتدخل الحلقة الثالثة. بدلاً من سؤال روبوت واحد لإعطاء إجابة، تطلب هذه الحلقة من ثلاثة روبوتات مختلفة (تحديداً نماذج تسمى Claude و Mistral Small و Llama 3.2) قراءة نفس الكتب والإجابة على السؤال. هذه الروبوتات تم بناؤها من قبل شركات مختلفة ولديها "شخصيات" مختلفة. إذا اتفقت الروبوتات الثلاثة على الإجابة، فهذا رائع! ولكن إذا اختلفوا، يفترض النظام وجود خطب ما. بعد ذلك، يستبعد النظام الكتب الأكثر إثارة للشك ويطلب من الروبوتات المحاولة مرة أخرى باستخدام مجموعة جديدة من الكتب. نظام "التصويت" هذا يضمن أنه حتى لو تعرض روبوت واحد لخداع كتاب مزيف وماكر، فقد يكتشف الاثنان الآخران الكذبة ويصححان المسار.

ما وجدته الورقة (وما لم تثبته بعد)

أجرى المؤلفون اختباراً باستخدام مكتبة تضم 5,000 مقال من ويكيبيديا و 10 أسئلة محددة. زرعوا 5 كتب مزيفة لكل سؤال، مصممة لخداع النظام. بدون أي دفاعات، وقع النظام في الفخ 91% من المرات. وعندما قاموا بتفعيل نظام TriShieldRAG الكامل، انخفض معدل الخداع إلى 13%.

ومع ذلك، فإن الورقة صادقة جداً بشأن ما لم تثبته بعد. "المتلاعب" الذي اختبروه كان غير متكيف (non-adaptive)، مما يعني أن المتلاعب لم يكن يعرف عن الحلقات الثلاث واستخدم حيلة قياسية فقط. يقر المؤلفون بأن متلاعباً أكثر ذكاءً، يعرف بالضبط كيف يعمل الحارس وأمينة المكتبة، قد يتمكن من تمرير كتاب مزيف من خلالهما. كما يشيرون إلى أن قاعدة "أقلية السموم" (الحلقة 2 و3 تعملان بشكل أفضل عندما تكون الكتب المزيفة أقل من الحقيقية) كانت مستمدة من الرياضيات والمنطق، لكنهم لم يجروا تجربة ضخمة لإثبات صمودها في كل السيناريوهات بعد.

كما يلاحظ المؤلفون أن نظامهم أبطأ وأكثر تكلفة للتشغيل لأنه يتطلب سؤال ثلاثة روبوتات مختلفة للحصول على رأي. في تطبيق واقعي، قد يستخدمون هذا الفحص المكثف للأسئلة الصعبة فقط، وليس لكل سؤال.

الخلاصة

ليس TriShieldRAG عصا سحرية تجعل تسميم البيانات مستحيلاً. بدلاً من ذلك، هو درع قوي متعدد الطبقات يجعل نجاح المتلاعب أمراً صعباً للغاية. من خلال فحص الكتب عند وصولها، وإعادة فحصها عند اختيارها، ووجود لجنة من القضاة للتحقق من الإجابة النهائية، ينجح النظام في كشف معظم الحيل. تشير الورقة إلى أنه بينما لا يمكننا إيقاف كل الهجمات بعد، فإن نهج الحلقات الثلاث يعد خطوة كبيرة للأمام في حماية أصدقائنا من الذكاء الاصطناعي من التعرض للخداع بالمعلومات المزيفة. يخطط المؤلفون بالفعل لاختبار هذا ضد متلاعبين أكثر ذكاءً وفي مكتبات أكبر، ولكن في الوقت الحالي، أظهروا أن ثلاثة رؤوس (وثلاث حلقات) هي بالتأكيد أفضل من رأس واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →