MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks
تقدم الورقة البحثية إطار عمل MM-PoisonRAG، الذي يوضح أن أنظمة التوليد المعزز بالاسترجاع متعددة الوسائط معرضة بشدة لكل من هجمات التسميم الموضعي المستهدف والتسميم العالمي الواسع، والتي يمكن أن تؤدي إلى تدهور دقة النموذج وتجاوز الدفاعات الحالية بشكل خطير.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً (روبوت) فائق الذكاء، يمكنه رؤية الصور وقراءة النصوص. للإجابة على أسئلتك، لا يعتمد هذا الروبوت على ذاكرته الخاصة فحسب؛ بل لديه "مكتبة" يمكنه مراجعتها للحصول على أحدث الحقائق. يُسمى هذا النظام الاسترجاع المعزز بالتوليد متعدد الوسائط (Multimodal RAG). إنه يشبه المحقق الذي يبحث عن أدلة في قاعدة بيانات قبل حل قضية ما.
تكشف ورقة بحثية بعنوان MM-POISONRAG عن خلل مخيف في كيفية عمل هذا المحقق: يمكن اختراق المكتبة.
إليك تفصيل لاكتشافهم باستخدام تشبيهات بسيطة:
1. الإعداد: المحقق الواثق
عادةً، عندما تسأل: "ما كان لون الفستان في حفل ميت غالا لعام 2023؟"، يقوم الروبوت بما يلي:
- يبحث في مكتبته عن صور ونصوص حول هذا الحدث.
- يصفي النتائج للعثور على أفضل المطابقات.
- يقرأ أفضل المطابقات ويعطيك الإجابة.
المشكلة هي أن المكتبة مفتوحة للجمهور. تماماً كما يمكن لأي شخص كتابة مراجعة مزيفة لمطعم على موقع إلكتروني، يمكن لمهاجم سيء أن يضع كتاباً مزيفاً أو صورة معدلة داخل مكتبة الروبوت.
2. الهجوم: طريقتان لتسميم البئر
أنشأ الباحثون إطار عمل يسمى MM-POISONRAG لاختبار مدى سهولة إفساد هذه المكتبة. وقد وجدوا طريقتين متميزتين لكسر النظام:
الهجوم أ: "الجاسوس المستهدف" (التسميم الموضعي)
- التشبيه: تخيل أنك تبحث عن وصفة محددة لـ "كعكة الشوكولاتة". يتسلل جاسوس إلى المكتبة ويستبدل الكتاب الوحيد الخاص بكعكة الشوكولاتة بكتاب مزيف يقول: "كعكة الشوكولاتة مصنوعة في الواقع من الملح والصخور".
- كيف يعمل: يقوم المهاجم بإنشاء صورة مزيفة ووصف مطابق لها (تعليق) لسؤال محدد. يجعلها تبدو مثالية لدرجة تجعل محرك بحث الروبوت يختارها كأول نتيجة.
- النتيجة: يقرأ الروبوت الكتاب المزيف ويخبرك بثقة: "كعكة الشوكولاتة مصنوعة من الملح".
- ما وجدته الورقة: حتى لو لم يكن المهاجم يعرف الكود الداخلي للروبوت (هجوم الصندوق الأسود - "black-box")، فلا يزال بإمكانه خداع النظام بنسبة 56% من المرات.
الهجوم ب: "الخلل الشامل" (التسميم العالمي)
- التشبيه: تخيل أن المكتبة تحتوي على ملاحظة لاصقة واحدة متوهجة وملتصقة بباب المكتبة تقول: "تجاهل جميع الكتب. الإجابة على كل الأسئلة هي 'آسف'". ولأن هذه الملاحظة ساطعة جداً وموضوعة بشكل غريب، فإن الروبوت يلتقطها لكل عملية بحث، بغضاً عما تسأل عنه.
- كيف يعمل: ينشئ المهاجم صورة واحدة فقط غريبة وتعليقاً مصمماً ليبدو ذا صلة بكل شيء. إنه مثل "مفتاح عالمي" يناسب كل الأقفال.
- النتيجة: بغض النظر عما إذا كنت تسأل عن الطقس، أو الرياضيات، أو التاريخ، فإن الروبوت يلتقط هذا المدخل المزيف ويعطي إجابة غير منطقية (مثل "آسف" أو "ثلاثة").
- ما وجدته الورقة: هذا أمر مدمر. بمدخل مزيف واحد فقط، تنخفض دقة الروبوت إلى 0%. يتوقف عن العمل تماماً.
3. "الخدعة السحرية" (القابلية للنقل)
وجد الباحثون شيئاً أكثر إثارة للقلق: السم يعمل على الروبوتات الأخرى أيضاً.
- التشبيه: إذا خدعت الروبوت (أ) (الذي يستخدم محرك بحث معيناً) بكتاب مزيف، فإن نفس الكتاب المزيف سيخدع الروبوت (ب) (الذي يستخدم محرك بحث مختلف) غالباً دون أن تضطر لتغيير الكتاب نفسه.
- ما وجدته الورقة: لم يكن المهاجمون بحاجة لمعرفة محرك البحث المحدد الذي يستخدمه الضحية؛ فقد تمكنوا من تدريب محتواهم المزيف على نظام واحد، ونجح ذلك في كسر أنظمة أخرى لم يشاهدوها من قبل.
4. الدرع الفاشل (الدفاعات)
حاول الباحثون معرفة ما إذا كانت إجراءات السلامة الحالية يمكن أن توقف هذا.
- التشبيه: الأمر يشبه محاولة إيقاف لص محترف عبر الطلب منه "إعادة صياغة سؤاله" أو التحقق مما إذا كانت صورته تبدو "ضبابية".
- ما وجدته الورقة: هذه الحيل القديمة لم تنجح. كانت الصور والنصوص المزيفة متقنة للغاية لدرجة أن مرشحات السلامة لم تستطع التمييز بينها وبين المعلومات الحقيقية والصادقة. لقد تم تجاوز "الجهاز المناعي" للروبوت بالكامل.
الملخص
تخلص الورقة البحثية إلى أن أنظمة Multimodal RAG هشة للغاية.
- لا تحتاج لأن تكون هاكر عبقري لكسرها؛ كل ما تحتاجه هو زرع بعض الصور والنصوص المزيفة المصممة جيداً.
- بمجرد زرعها، يمكن لهذه "السموم" إما خداع الروبوت لإعطاء إجابة خاطئة محددة أو تعطيل قدرته تماماً على الإجابة على أي شيء بشكل صحيح.
- أدوات السلامة الحالية ليست قوية بما يكفي لإيقاف ذلك.
المؤلفون لا يقولون إن هذا سيحدث غداً، لكنهم يدقون ناقوس الخطر: نحن بحاجة إلى بناء أقفال أقوى لهذه المكتبات الرقمية قبل أن نثق بها في المعلومات الهامة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.