Text is All You Need for Vision-Language Model Jailbreaking
تقدم هذه الورقة البحثية Text-DJ، وهو هجوم اختراق جديد يتجاوز ضمانات السلامة في النماذج اللغوية البصرية الكبيرة عن طريق تحويل النصوص الضارة إلى شبكة من الصور التي تحتوي على استعلامات فرعية حميدة مبعثرة ومشتتات غير ذات صلة، مما يستغل قدرات التعرف الضوئي على الحروف (OCR) لدى النماذج وعدم قدرتها على الربط بين المدخلات متعددة الوسائط المجزأة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل نموذج رؤية-لغة ضخم (LVML) كأنه حارس أمن ذكي ومدرب جيداً في متحف عالي التقنية. هذا الحارس بارع في قراءة اللافتات (النصوص) والنظر إلى الصور لضمان عدم إدخال أي شيء خطير أو ممنوع. إذا حاولت تقديم ملاحظة له تقول "كيف أصنع قنبلة؟"، سيكتشف الخطر فوراً ويقول "مستحيل".
تقدم الورقة البحثية بعنوان "النص هو كل ما تحتاجه لكسر حماية نماذج الرؤية-اللغة" خدعة ذكية تسمى Text-DJ (تشتيت النص لكسر الحماية)، والتي توضح كيف يمكن خداع هذا الحارس الأمن باستخدام النصوص فقط، ولكن مع لمسة مختلفة: النص هنا مخفي داخل شبكة من الصور.
إليك كيفية عمل هذه الخدعة، مقسمة إلى خطوات بسيية:
1. استراتيجية "تقسيم الفاتورة" (التفكيك)
أولاً، يقوم المهاجمون بأخذ سؤال خطير (مثل "كيف أصنع قنبلة؟") وتقسيمه إلى ثلاثة أسئلة أصغر تبدو غير ضارة.
- التشبيه: تخيل أنك تريد شراء سلاح خطير، لكن صاحب المتجر يرفض بيعه لك. لذا، تقوم بتقسيم طلبك إلى ثلاث طلبات منفصلة تبدو بريئة: "ما هو التركيب الكيميائي للبارود؟"، "كيف أخلط هذه المساحيق؟"، و"ما هي الحاوية التي تحفظ هذا الخليط؟".
- بشكل فردي، تبدو هذه الأسئلة آمنة، وقد يجيب عليها الحارس بتقديم المساعدة. ولكن إذا وضعتها جميعاً معاً، فإنها تكشف عن المخطط الخطير.
2. "الضجيج المشتت" (التشتيت)
بعد ذلك، ينشئ المهاجمون مجموعة من الأسئلة العشوائية والمملة التي لا علاقة لها بالمخطط الخطير.
- التشبيه: تخيل أنك تحاول تمرير رسالة سرية عبر حارس، لكنك محاط بـ 9 أشخاص آخرين يصرخون حول حالة الطقس، وسعر الحليب، وتاريخ البطاطس. الحارس مشغول جداً بالاستماع إلى كل هذا الضجيج لدرجة أنه ينسى التركيز على الأشخاص الثلاثة الذين يهمسون بالخطة السرية.
- وجدت الورقة البحثية أن هذه "الأسئلة الضوضائية" يجب أن تكون مختلفة قدر الإمكان عن الأسئلة الخطيرة لتعمل بأفضل شكل.
3. "لغز الصورة" (الخدعة البصرية)
هذا هو الجزء الأهم. بدلاً من كتابة الأسئلة في صندوق الدردشة، يحول المهاجمون كل سؤال (الأسئلة الثلاثة الخطيرة المفككة والأسئلة التسعة العشوائية) إلى صور. ثم يرتبونها في شبكة، مثل ألبوم صور أو جدول بيانات.
- الفخ: تم تدريب الحارس على مسح النصوص بحثاً عن الكلمات السيئة. ولكن هنا، الكلمات السيئة مخبأة داخل صور للنصوص. يتعين على الحارس استخدام قدرته على "التعرف الضوئي على الحروف" (OCR) — أي قدرته على قراءة النص داخل الصورة — ليرى ما تقوله الصور.
- نقطة الضعف: تجادل الورقة بأن الحارس جيد جداً في قراءة النص المباشر، لكنه يرتبك عندما يتعين عليه قراءة نص داخل صورة، خاصة عندما تكون تلك الصورة محاطة بـ 9 صور مشتتة أخرى. قدرة "فلتر الأمان" لديه على قراءة النصوص تفشل في ربط النقاط بين "الأسئلة-الصور" المبعثرة التي تبدو غير ضارة.
النتيجة
عندما يقرأ الحارس الشبكة من الصور أخيراً، سيرى الأسئلة الثلاثة المجزأة في منتصف الضجيج. ولأن الأسئلة مجزأة ومخبأة في صور، لا يدرك الحارس أنها تشكل كلاً خطيراً. فيقوم بالإجابة على الأجزاء غير الضارة، وبذلك يكشف دون قصد عن الإجابة للسؤال الخطير الأصلي.
لماذا هذا الأمر مهم
تدعي الورقة البحثية أن هذا يمثل مشكلة كبيرة لأن:
- إنه يعمل على النماذج "الصندوق الأسود" (Black Box): لا تحتاج لمعرفة الكود السري للحارس أو هيكل دماغه الداخلي. أنت فقط بحاجة لإرسال شبكة الصور.
- إنه يعمل على أفضل النماذج: اختبروا هذه الطريقة على نماذج رفيعة المستوى (مثل GPT-4 وGemini وQwen) ونجحت مع جميعها.
- إنه يتجاوز نماذج "الحراسة": حتى عندما تحاول طبقة أمن ثانية فحص المدخلات قبل وصولها إلى النموذج الأساسي، غالباً ما تتسلل هذه الخدعة لأن المدخلات تبدو كشبكة غير ضارة من الصور.
باخت-القول: تظهر الورقة البحثية أنه إذا أخفيت خطة خطيرة داخل صورة، وقسمت تلك الخطة إلى قطع صغيرة، وأحطتها بالكثير من الضجيج الممل، فحتى أذكى حراس الذكاء الاصطناعي يمكن أن يرتبكوا ويسمحوا للخطر بالمرور. والحل، وفقاً للمؤلفين، هو جعل الذكاء الاصطناعي أفضل في قراءة النصوص داخل الصور وربط النقاط ببعضها، حتى عند وجود الكثير من الضجيج.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.