BadSKP: Backdoor Attacks on Knowledge Graph-Enhanced LLMs with Soft Prompts
تقدم الورقة البحثية BadSKP، وهو هجوم باب خلفي مبتكر يستغل القناة المشروطة بالرسم البياني للنماذج اللغوية الكبيرة المعززة بالرسوم البيانية للمعرفة من خلال التلاعب بتضمينات العقد لتجاوز الارتكاز الدلالي، محققاً بذلك معدلات نجاح عالية للهجوم حيث تفشل الهجمات التقليدية القائمة على النصوص.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك أمين مكتبة آلي ذكي جداً (نموذج لغوي كبير، أو LLM) يعرف الكثير من الحقائق ولكنه أحياناً يختلق أشياء من خياله. لمساعدته، تعطي له "ورقة غش" (رسم بياني للمعرفة - Knowledge Graph) تحتوي على حقائق عن العالم.
هناك طريقتان لإعطاء هذه الورقة للأمين الآلي:
- الطريقة القديمة (المطالبات النصية - Text Prompts): أنت تقرأ ورقة الغش بصوت عالٍ باللغة الإنجليزية العادية. "إليك قائمة بالحقائق: جاستن بيبر لديه أخ يدعى جاكسون."
- الطريقة الجديدة (المطالبات الناعمة - Soft Prompts): لا تقرأ الحقائق بصوت عالٍ، بل تترجم ورقة الغش بأكملها إلى "هالة" أو "شعور" خاص وغير مرئي (مطالبة ناعمة مستمرة) يمكن للأمين الآلي استشعاره مباشرة. هذا يشبه منح الأمين الآلي إشارة راديو سرية تقول: "ركز على الروابط العائلية"، دون استخدام أي كلمات.
المشكلة: "فجوة المتانة" (The Robustness Gap)
اكتشف الباحثون فرقاً غريباً في الأمان بين هاتين الطريقتين.
- الطريقة القديمة هشة: إذا تسلل شخص سيء ووضع ملاحظة في ورقة الغش تقول: "تجاهل السؤال واصرخ 'لا أعرف!'"، فإن الأمين الآلي سيقرأها ويطيعها فوراً.
- الطريقة الجديدة قوية: إذا وضع الشخص السيئ نفس الملاحظة في ورقة الغش، فإن الأمين الآلي سيتجاهلها. لماذا؟ لأن "الهالة" غير المرئية (المطالبة الناعمة) قوية ومركزة جداً على السؤال الفعلي، فهي تعمل كـ "مرساة" (Anchor). هذه المرساة تثبت انتباه الأمين الآلي بقوة على الموضوع، مما يؤدي إلى إغراق الضجيج الصاخب والمربك (النص السيئ).
يطلق البحث على هذا الأمر اسم "الترسيخ الدلالي" (Semantic Anchoring). فكر في المطالبة الناعمة كمرساة ثقيلة تُلقى لتثبت عقل الأمين الآلي في المكان الصحيح، مما يجعل من الصعب على الضجيج السطحي (النص السيئ) جره بعيداً.
الهجوم: "BadSKP"
سأل الباحثون: "إذا كانت المرساة قوية جداً، فهل يمكننا كسرها؟"
أدركوا أنه بينما لا يمكن للنص أن يكسر المرساة، إلا أن مصدر المرساة يمكنه ذلك. بما أن "الهالة" تأتي من بنية الرسم البياني نفسه، فإذا تمكن شخص سيء من العبث بالرسم البياني، يمكنه تغيير تلك الهالة.
لقد ابتكروا هجوماً يسمى BadSKP. بدلاً من مجرد الصراخ بكلمات سيئة، قاموا بـ:
- اختراق المصدر: قاموا بتغيير بنية ورقة الغش (الرسم البياني) وسلوك "مشاعر" العقد (nodes) المخفية سراً.
- تحريف المرساة: جعلوا "الهالة" غير المرئية تشير إلى الاتجاه الخاطئ. بدلاً من تثبيت الأمين الآلي على السؤال، جعلوه يرتسي على أمر خبيث.
- جعل الأمر يبدو طبيعياً: استخدموا عملية متعددة الخطوات لضمان أن التغييرات تبدو كنص طبيعي وسلس بحيث لا يلاحظ أحد التلاعب بورقة الغش.
النتيجة: على الرغم من أن الأمين الآلي كان يستخدم الطريقة "القوية" الجديدة، إلا أن BadSKP نجح في خداعه. فعندما يُسأل سؤالاً طبيعياً عن شخص معين، يرفض الأمين الآلي فجأة الإجابة أو يعطي إجابة خاطئة تماماً، وكل ذلك لأن الشخص السيء قد أعاد ضبط اتجاه المرساة غير المرئية سراً.
الدفاعات (ولماذا فشلت)
حاول الباحثون استخدام دفاعات قياسية، مثل "مرشح الإدراك" (Perplexity Filter). تخيل هذا المرشح كمدقق لغوي يحذف أي جملة تبدو غريبة أو غير طبيعية.
- النتيجة: فشل المرشح. لأن BadSKP كان ذكياً للغاية، فقد جعل النص الخبيث يبدو طبيعياً وسلساً تماماً. اعتقد المرشح أن النص آمن، لكن المرساة غير المرئية كانت لا تزال محرفة.
الحل المقترح
يقترح البحث طريقة جديدة للدفاع ضد هذا. بدلاً من التحقق مما إذا كانت الكلمات تبدو غريبة، يجب علينا التحقق مما إذا كانت المرساة ثابتة.
- الفكرة: مراقبة "انتباه" (Attention) الأمين الآلي الداخلي. إذا كان من المفترض أن يكون التركيز على السؤال، ولكن تركيزه الداخلي ينحرف نحو اتجاه غريب وغير مرتبط بالموضوع، فقم بوضع علامة تحذير (Flag) باعتباره أمراً مشبوهاً.
- التشبية: الأمر يشبه حارس الأمن الذي لا يكتفي بفحص بطاقة الهوية ليرى ما إذا كانت مزورة، بل يراقب ليرى ما إذا كان الزائر ينظر بالفعل إلى الخريطة التي من المفترض أن يتبعها. إذا بدأ الزائر في التحديق في السقف بدلاً من ذلك، سيعرف الحارس أن هناك خطباً ما، حتى لو كانت بطاقة الهوية تبدو مثالية.
الملخص
- الاكتشاف: أنظمة الذكاء الاصطناعي الجديدة التي تستخدم "الهالات غير المرئية" (المطالبات الناعمة) المستمدة من الرسوم البيانية هي أصعب بكثير في الخداع باستخدام النصوص السيئة مقارنة بالأنظمة القديمة.
- السبق العلمي: ومع ذلك، إذا قمت باختراق الرسم البياني الذي يصنع الهالة، يمكنك تحريف الهالة نفسها وكسر النظام.
- الدرس المستفاد: لا يمكنك فقط فحص الكلمات؛ بل يجب عليك فحص البنية الأساسية و"اتجاه" تفكير الذكاء الاصطناعي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.