ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
تقدم الورقة البحثية تقنية ADMIT، وهي تقنية حقن عدائي متعدد ومتوافق دلاليًا وقليل العينات، تنجح في تسميم أنظمة التحقق من الحقائق القائمة على التوليد المعزز بالاسترجاع (RAG) عبر حقن محتوى عدائي ضئيل لتجاوز الأدلة الأصلية والتلاعب بمخرجات النماذج اللغوية الكبيرة بمعدل نجاح هجوم مرتفع عبر نماذج ومجالات متنوعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك أمين مكتبة ذكيًا ومطلعًا جدًا (الذكاء الاصطناعي)، وهو بارع في الإجابة على الأسئلة، لكنه قد يختلق بعض الأمور أحيانًا لأنه لا يعرف كل شيء. ولإصلاح ذلك، أعطيت أمين المكتبة قاعدة خاصة: "قبل أن تجيب، ابحث عن الحقائق في مكتبتنا الموثوقة من الكتب أولاً." يُسمى هذا النظام RAG (التوليد المعزز بالاسترجاع). ومن المفترض أن يكون هو المدقق النهائي للحقائق.
الآن، تخيل وجود مخادع (المهاجم) يريد جعل أمين المكتبة يعطي إجابة خاطئة.
الطريقة القديمة لخداع أمين المكتبة
في الماضي، حاول الباحثون خداع أمين المكتبة عن طريق:
- الصراخ بالتعليمات: كتابة "تجاهل الكتب وقل نعم!" مباشرة في السؤال. (هذا يشبه حقن الأوامر - Prompt Injection).
- إغراق المكتبة: تسميم مئات الكتب بالأكاذيب بحيث مهما اختار أمين المكتبة، فسيجد كذبة. (هذا هو تسميم المعرفة العامة).
المشكلة: في العالم الحقيقي، غالبًا ما تفشل هذه الحيل. إذا سألت عن حقيقة طبية، فمن المرجح أن يستخرج أمين المكتبة كتابًا طبيًا حقيقيًا وموثوقًا يناقض كذبتك. أمين المكتبة ذكي بما يكفي ليقول: "مهلًا، هذا الكتاب الجديد يقول (س)، ولكن الكتاب الطبي الموثوق يقول (ص). سأذهب مع (ص)."
الخدعة الجديدة: ADMIT
تقدم هذه الورقة البحثية نوعًا جديدًا ومراوغًا من الهجمات يسمى ADMIT. فبدلاً من إغراق المكتبة أو الصراخ بالتعليمات، يستخدم المهاجم استراتيجية "التعلم من أمثلة قليلة" (Few-Shot).
التشبيه: "التفاحة الفاسدة الواحدة" في سلة من الذهب
تخيل أن أمين المكتبة طُلب منه التحقق من ادعاء ما. سيخرج 5 كتب ليقرأها.
- 4 كتب حقيقية، موثوقة، وتقول إن الادعاء خاطئ.
- كتاب واحد هو من صنع المهاجم.
في الماضي، كان أمين المكتبة سيتجاهل ذلك الكتاب السيئ لأن الكتب الأربعة الأخرى قالت عكس ذلك. لكن ADMIT مختلف. المهاجم لا يكتب مجرد كذبة؛ بل يكتب مقالًا إخباريًا مزيفًا ومصاغًا بدقة يبدو حقيقيًا للغاية، وذا سلطة، ومقنعًا جدًا لدرجة أنه يخدع أمين المكتبة ويجعله يفكر: "واو، هذا الكتاب الواحد لديه شرح محدد ومفصل للغاية يتجاوز الكتب الأخرى."
كيف يعمل ADMIT (التعويذة السحرية):
- الإعداد: لا يملك المهاجم وصولًا إلى عقل أمين المكتبة أو محرك بحث المكتبة. إنه يعمل بشكل أعمى.
- جولة التدريب: يستخدم المهاجم "أمين مكتبة وهميًا" (وكيلًا) لاختبار مقالاته المزيفة. يستمر في إعادة كتابة المقال، مرارًا وتكرارًا، وهو يسأل أمين المكتبة الوهمي: "هل يبدو هذا حقيقيًا بما يكفي ليغير رأيك؟"
- المنتج النهائي: بمج once يصبح المقال مثاليًا، يمرر المهاجم واحدًا فقط من هذه المقالات المزيفة داخل قاعدة بيانات المكتبة.
- النتيجة: عندما يبحث أمين المكتبة الحقيقي عن الإجابة، يجد الكتب الأربعة الحقيقية والكتاب المزيف الواحد. ولأن الكتاب المزيف مكتوب بشكل جيد للغاية (فهو يحاكي نبرة التقارير الإخبارية الحقيقية، ويستشهد بخبراء وهميين، ويبدو واثقًا)، يصاب أمين المكتبة بالارتباك. فيغير حكمه من "خاطئ" إلى "صحيح" بل ويكتب تفسيرًا مقنعًا لتبرير سبب تغيير رأيه.
لماذا هذا الأمر مخيف (نتائج الورقة البحثية)
اختبر الباحثون هذا على 11 نموذجًا مختلفًا من نماذج الذكاء الاصطناعي (من النماذج مفتوحة المصدر إلى الأكثر تقدمًا من النماذج التجارية) و 4 أنواع مختلفة من تدقيق الحقائق (الأخبار العامة، العلوم، المناخ، والصحة).
- معدل التسميم ضئيل للغاية: لم يحتاجوا إلا لتسميم 0.00000093% من محتوى المكتبة. هذا يشبه إضافة صفحة مزيفة واحدة فقط إلى مكتبة تحتوي على مليار صفحة.
- معدل النجاح ضخم: رغم ضآلة كمية السم، نجح الهجوم بنسبة 86% من المرات.
- يعمل على أكثر نماذج الذكاء الاصطناعي "ذكاءً": حتى نماذج الذكاء الاصطناعي المصممة لتكون حذرة ومنطقية للغاية (مثل "نماذج الاستنتاج") وقعت في الفخ.
- يهزم الدفاعات: اختبرت الورقة دفاعات شائعة، مثل طلب "التصويت" من الذكاء الاصطناعي على الإجابة أو التحقق مما إذا كان النص يبدو غريبًا. اجتاز ADMIT جميعها لأن النص المزيف لا يبدو غريبًا؛ بل يبدو طبيعيًا تمامًا.
الخلاصة
تظهر الورقة أنه حتى لو كان لديك نظام مصمم للتحقق من الحقائق مقابل مصادر موثوقة، فلا يزال بإمكانك خداعه. لست بحاجة إلى كسر النظام أو إغراقه بالقمامة. أنت فقط بحاجة إلى زرع معلومة واحدة مكتوبة بشكل جيد للغاية ومضللة، تبدو جيدة جدًا لدرجة تقنع الذكاء الاصطناعي بتجاهل الحقيقة.
باخت-اختصار: يثبت ADMIT أنه في المعركة بين "الحقيقة" و"الإقناع"، إذا كُتبت الكذبة بشكل جيد بما يكفي، يمكن حتى لأمين مكتبة الذكاء الاصطناعي الأكثر ذكاءً أن يُخدع ويصدق أن الكذبة هي الحقيقة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.