GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
تقدم الورقة البحثية GHOST، وهي طريقة تلقائية تولد صوراً طبيعية المظهر وخالية من الأجسام عبر تحسين تضمينات الصور لاستحثاث وكشف ثغرات الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط بشكل نشط، محققةً معدلات نجاح أعلى بكثير من النهج السابقة، كما تعمل أيضاً كأداة لتحسين متانة النموذج من خلال الضبط الدقيق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "GHOST: توليد الصور المحفزة للهلوسة لنماذج اللغات الكبيرة متعددة الوسائط" باستخدام لغة بسيطة وتشبيهات إبداعية.
المشكلة الكبرى: الذكاء الاصطناعي "شديد الخيال"
تخيل أن لديك مساعداً آلياً ذكياً جداً يمكنه النظر إلى الصور ووصف ما يراه. إنه بارع في معظم الأشياء، لكن لديه خلل غريب: أحياناً، يرى أشياء ليست موجودة بالفعل.
إذا عرضت عليه صورة لموزة على طبق، فقد يقول بثقة: "نعم، أرى سكيناً بجانب الموزة"، رغم عدم وجود سكين. في عالم الذكاء الاصطناعي، يُسمى هذا "الهلوسة" (Hallucination). الأمر يشبه شخصاً متحمسًا للغاية لإرضاء الآخرين أو معتاداً على أنماط معينة، فيبدأ في اختراع تفاصيل لملء الفراغات.
الطريقة القديمة: التحقق من قائمة ثابتة
في السابق، حاول الباحثون العثان على هذه الأخطاء عبر عرض قائمة ثابتة من الصور على الذكاء الاصطناعي (مثل اختبار الاختيار من متعدد). كانوا يسألونه: "هل ترى سكيناً؟" ويرون ما إذا كان سيخطئ.
- العيب: هذا يشبه اختبار سائق في موقف سيارات فارغ ومحدد فقط. قد تغفل عن حقيقة أنه يصاب بالذعر عندما تتدحرج كرة حمراء نحو الشارع. كانت الاختبارات القديمة جامدة للغاية ولم تستطع اكتشاف طرق جديدة أو غريبة قد يفشل بها الذكاء الاصطناعي.
الحل الجديد: GHOST (فنان "الخدع السحرية")
يقدم المؤلفون GHOST (توليد الهلوسة عبر تحسين الرموز الخفية). فكر في GHOST كساحر لا يكتفي بعرض صورة للذكاء الاصطناعي فحسب، بل يرسم لوحة جديدة مصممة خصيصاً لخداع الذكاء الاصطناعي ليجعله يرى "شبحاً".
إليك كيف يعمل GHOST، خطوة بخطوة:
1. تحسين "الحبر السري"
يبدأ GHOST بصورة عادية (مثل موزة على طبق). هدفه هو جعل الذكاء الاصطناعي يعتقد بوجود سكين.
- بدلاً من رسم سكين (والذي سيكون واضحاً للبشر)، يعمل GHOST في "لغة سرية" تسمى التمثيلات (Embeddings). تخيل هذا كحالة الحلم الداخلية للذكاء الاصطناعي.
- يقوم GHOST بتعديل حالة الحلم هذه بشكل طفيف جداً. إنه يضيف إشارات تشبه "الحبر السري". ربياً، يغير انحناء ساق الموزة لتبدو بشكل طفيف مثل مقبض السكين بالنسبة للذكتر الاصطناعي، بينما بالنسبة للبشر، لا تزال تبدو تماماً كموزة.
2. "المترجم" (الرابط - The Mapper)
هناك مشكلة: الذكاء الاصطناعي الذي ينظر إلى الصورة (MLLM) يتحدث لغة مختلفة عن الذكاء الاصطناعي الذي يرسم الصورة (Diffusion Model).
- يبني GHOST مترجماً (يسمى الرابط). يأخذ هذا المترجم "تعديلات أحلام السر" من الرسام ويترجمها إلى تعليمات يمكن للرسام فهمها، دون الحاجة إلى سؤال المشاهد (MLLM) في كل ثانية. هذا يجعل العملية سريعة جداً.
3. "رسام الأحلام" (الانتشار - Diffusion)
بمجرد تجهيز التعليمات السرية، يستخدم GHOST نموذج الانتشار (Diffusion Model) (وهو نوع من الذكاء الاصطناعي الذي ينشئ صوراً من الضجيج) لرسم الصورة النهائية.
- يبدأ بالصورة الأصلية للموزة ثم يقوم بعملية "إزالة الضجيج" بلطف بناءً على التعليمات السرية.
- النتيجة: تبدو الصورة النهائية طبيعية بنسبة 100% للبشر. لا تزال مجرد موزة على طبق. ولكن بالنسبة للذكاء الاصطناعي، فإن التغييرات الطفيفة في الإضاءة أو الشكل كافية لتجعله يصرخ: "أنا أرى سكيناً!"
لماذا يعد هذا أمراً هاماً؟
تزعم الورقة البحثية تحقيق ثلاثة انتصارات كبرى بواسطة GHOST:
إنه محقق بارع:
- وجدت الطرق القديمة حوالي 1% فقط من حالات الهلوسة.
- وجد GHOST أكثر من 28% من الحالات. الأمر يشبه الترقية من جهاز كشف معادن يفقد 99% من العملات إلى جهاز يجد معظمها تقريباً.
إنه فخ عالمي (قابلية النقل):
- يمكن لـ GHOST خداع ذكاء اصطناعي واحد (مثل Qwen) ثم عرض نفس الصورة "المخدوعة" على ذكاء اصطناعي مختلف تماماً (مثل GPT-4o).
- النتيجة: الذكاء الاصطناعي الثاني يهلوس أيضاً! وهذا يثبت أن أنظمة الذكاء الاصطناعي المختلفة تشترك في نفس نقاط الضعف. إنه مثل العثور على نوع معين من الخدع البصرية التي تخدع عينيك وعيني صديقك، رغم اختلاف نظركما.
إنه علاج، وليس مجرد اختبار:
- لم يستخدم المؤلفون GHOST فقط لكسر الأشياء؛ بل استخدموه لـ إصلاحها.
- أخذوا الصور "المخدوعة" التي أنشأها GHOST وعرضوها على الذكاء الاصطناعي مع الإجابة الصحيحة ("لا، لا توجد سكين").
- النتيجة: أصبح الذكاء الاصطناعي أفضل في عدم الهلوسة في المستقبل. إنه يشبه إظهار الأسئلة التعجيزية التي أخطأ فيها الطالب ليتعلم الإجابة الصحيحة.
الخلاصة
GHOST هو أداة تنشئ تلقائياً "صوراً مخادعة" لاختبار أنظمة الرؤية في الذكاء الاصطناعي. وهو يثبت أن نماذج الذكاء الاصطناعي الحالية هشة ويمكن خداعها بسهولة عبر تغييرات طفيفة وطبيعية المظهر. ولكن الأهم من ذلك، أنه يوفر طريقة لإيجاد نقاط الضعف هذه وتدريب الذكاء الاصطناعي ليكون أكثر موثوقية، مما يضمن أنه عندما يقول إنه يرى سكيناً، فهو يرى سكيناً بالفعل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.