SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning
تقدم الورقة البحثية SilentRetrieval، وهو هجوم تسميم بيانات ثنائي المراحل يختطف أنظمة التوليد المعزز بالاسترجاع (RAG) عبر حقن مستندات عدائية مصاغة بطلاقة تحافظ على تصنيفات استرجاع عالية وتنجح في تلاعب مخرجات النماذج اللغوية الكبيرة مع التهرب من الكشف عبر الحفاظ على التماسك الدلالي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل نظام "التوليد المعزز بالاسترجاع" (RAG) كأنه أمين مكتبة ذكي للغاية، ولكنه ينسى قليلاً. عندما تسأله سؤالاً، لا يعتمد فقط على ذاكرته (التي قد تكون قديمة أو تخترع أشياء من عندها)؛ بل يركض بسرعة إلى مكتبة ضخمة من الكتب (المتن/Corpus) ليجد الصفحات الأكثر صلة، ويقرأها، ثم يكتب لك إجابة بناءً على ما وجده.
تصف ورقة بحثية بعنوان "SilentRetrieval" طريقة جديدة وماكرة لاختراق أمين المكتبة هذا. فبدلاً من الصراخ أو كسر نوافذ المكتبة (الأمر الذي سيكون واضحاً)، يقوم المهاجم بتسلل كتاب مزيف واحد مكتوب بإتقان شديد ووضعه على الرفوف. وعندما يبحث أمين المكتبة عن الإجابة، يجد هذا الكتاب المزيف أولاً، ويقرأه، ثم يخبرك بثقة بكذبة تبدو حقيقية تماماً.
إليك كيف يعمل هذا الهجوم، مقسماً إلى خطوات بسيطة:
١. المشكلة: مكتبة "ثق بي"
أمين المكتبة يثق في الكتب الموجودة على الرف. إذا كانت الكتب نظيفة ودقيقة، فإن أمين المكتبة يقدم إجابات جيدة. ولكن إذا تسلل شخص ما ووضع كتاباً مزيفاً يبدو تماماً مثل الكتاب الحقيقي، فقد يلتقط أمين المكتبة ذلك الكتاب المزيف بدلاً من الحقائق الحقيقية، مما يؤدي إلى "هلوسة" (كذبة واثقة).
٢. الهجوم: "SilentRetrieval"
ابتكر الباحثون طريقة من خطوتين لإنشاء هذا الكتاب المزيف دون التعرض للقبض عليهم.
الخطوة ١: "الملاءمة المثالية" (البحث الشعاعي المنسق - Coordinated Beam Search)
تخيل أنك تريد استبدال فقرة في مدخل موسوعة حقيقية بكذبة، لكن لا يمكنك مجرد الكتابة فوقها بكلمات غير مفهومة، وإلا سيطردها أمين المكتبة فوراً.
- الطريقة القديمة: كان المخترقون السابقون يكتبون كلاماً غير مفهوم أو سخيفاً واضحاً. وكان "فلتر الطلاقة" الخاص بأمين المكتبة (وهو أداة تتحقق مما إذا كان النص يبدو طبيعياً) يكتشف ذلك فوراً ويرفضه.
- طريقة SilentRetrieval: يستخدم المهاجم خوارزمية متطورة لتعديل كلمات مقال حقيقي بما يكفي لتضمين كذبته، مع الحفاظ على هيكل الجملة وانسيابيتها بحيث تظل تبدو كمدخل موسوعة طبيعي. الأمر يشبه تعديل وصفة طعام لتكتب "أضف سماً" بدلاً من "أضف ملحاً"، ولكن بأسلوب دقيق جداً يجعل الوصفة لا تزال تبدو كأنها وصفة عادية ولذيذة.
- الهدف: التأكد من أن الكتاب المزيف هو الأكثر صلة بالموضوع الذي سيجده أمين المكتبة عند البحث عنه.
الخطوة ٢: "الانتقال السلس" (توليد المحفز المتكيف مع السياق - Context-Adaptive Trigger Generation)
بمجرد تجهيز الفقرة المزيفة، يحتاج المهاجم للتأكد من أن أمين المكتبة سيصدق الكذبة فعلياً أثناء القراءة.
- بدلاً من مجرد لصق جملة عشوائية في النهاية (مثل "السماء خضراء!"), يستخدم النظام ذكاءً اصطناعياً آخر لكتابة "محفز" (Trigger) يندمج تماماً مع الفقرة المزيفة.
- يبدو المحفز كخاتمة طبيعية أو "حقيقة موثقة" تتناسب مع نبرة المقال. إنه الفرق بين ملاحظة ركيكة ملصقة بصفحة وبين جملة تتدفق بشكل طبيعي كجزء من القصة.
٣. النتائج: ما مدى جودة هذا الاختراق؟
اختبر الباحثون هذا على مكتبتين رقميتين ضخمتين (إحداهما تحتوي على ٣٦١,٠٠٠ صفحة والأخرى ٨.٨ مليون).
- التخفي: كانت الوثائق المزيفة لا يمكن تمييزها تقريباً عن الوثائق الحقيقية. عندما نظر المراجعون البشريون إليها، صنفوها كوثائق "مشبوهة" بنسبة ١٥٪ فقط، مقارنة بـ ٨٣٪ لطرق الاختراق القديمة والبدائية. وبالنسبة للكمبيوتر الذي يفحص "الأنماط اللغوية الغريبة"، بدت الكتب المزيفة طبيعية تماماً مثل الكتب الحقيقية.
- النجاح: عندما سُئل أمين المكتبة سؤالاً، تم العثور على الكتاب المزيف بنسبة ٨٤.٦٪ (في المكتبة الأصغر). وبمجرد العثور عليه، صدق أمين المكتبة الكذبة وأعطى إجابة خاطئة بنسبة ٥٧.٥٪ من المرات.
- اختبار "المكتبة الكبيرة": حتى عندما اختبروا ذلك في مكتبة تضم ٢١ مليون صفحة (على نطاق واسع جداً)، ظل الكتاب المزيف يصل إلى أعلى نتائج البحث بنسبة ٧٤.٢٪ من المرات.
٤. الدفاع: كيف نوقف ذلك؟
اختبرت الورقة أيضاً كيفية حماية أمين المكتبة:
- "الرأي الثاني" (إعادة الترتيب - Reranking): إذا قام أمين المكتبة بفحص أفضل النتائج باستخدام "أمين مكتبة ثانٍ" أكثر صرامة ونقداً (Cross-encoder)، فمن غير المرجح أن يتم اختيار الكتاب المزيف.
- "تصويت المجموعة" (عزل الفقرات - Passage Isolation): بدلاً من ترك أمين المكتبة يقرأ صفحة واحدة فقط ويقرر، تجعله يقرأ خمس صفحات مختلفة ويصوت على الإجابة. إذا كان الكتاب المزيف هو الوحيد الذي يحتوي على الكذبة، فإن الكتب الأربعة الحقيقية الأخرى ستتغلب عليه في التصويت.
- النتيجة: استخدام مزيج من هذه الدفاعات (أمين مكتبة ثانٍ + تصويت المجموعة) قلل من نجاح الهجوم من ٥٧.٥٪ إلى ٢١.٣٪. ومع ذلك، جعل هذا أمين المكتبة أبطأ (حوالي ٦ مرات أبطأ).
الخلاصة
تظهر هذه الورقة أن أنظمة RAG لديها نقطة ضعف خفية وهي: سلامة المتن (Corpus Integrity). إذا تمكن المهاجم من حقن عدد قليل من الوثائق المزيفة "المتخفية" والمكتوبة بإتقان في قاعدة البيانات، فيمكنه السيطرة على إجابات النظام دون أن يدرك النظام أي شيء خاطئ.
الفكرة الجوهرية هي أن الطلاقة سلاح ذو حدين. جعل نص الهجوم يبدو مثالياً للغاية يجعل من الصعب على الفلاتر البسيطة اكتشافه، ولكنه يجعل الهجوم أكثر خطورة لأن الذكاء الاصطناعي (والبشر) أكثر عرضة لتصديقه. تقترح الورقة أنه لضمان السلامة، نحتاج إلى "دفاعات متعددة الطبقات" — باستخدام عمليات تحقق وتوازنات متعددة — بدلاً من الاعتماد فقط على طريقة واحدة لكشف الأخبار المزيفة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.