← أحدث الأبحاث
🤖 machine learning

Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models

تقدم هذه الورقة "درجة عدسة التعليمات" (InsLen)، وهي أداة جاهزة للاستخدام للكشف عن هلوسة الكائنات في النماذج اللغوية الكبيرة متعددة الوسائط، والتي تستفيد من تضمينات رموز التعليمات لتتفوق على الأساليب الحالية دون الحاجة إلى نماذج مساعدة أو تدريب إضافي.

المؤلفون الأصليون: Runhe Lai, Xinhua Lu, Yanqi Wu, Jinlun Ye, Weijiang Yu, Ruixuan Wang

نُشر 2026-05-13
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Runhe Lai, Xinhua Lu, Yanqi Wu, Jinlun Ye, Weijiang Yu, Ruixuan Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً (نموذج لغوي كبير متعدد الوسائط) يمكنه النظر إلى الصور ووصفها بالتفصيل. تسأله: "ماذا ترى؟" فيبدأ بالحديث. ولكن في بعض الأحيان، يصبح هذا الروبوت خيالياً أكثر من اللازم؛ فقد ينظر إلى صورة لجبل مغطى بالثلوج مع متزلجين ويقول بثقة: "أرى حقيبة حمراء على المتزلج"، رغم عدم وجود حقيبة في الصورة. يُسمى هذا "هلوسة الأشياء" (Object Hallucination).

تقدم الورقة البحثية أداة جديدة تسمى "درجة عدسة التعليمات" (Instruction Lens Score - InsLen) للإمساك بهذه الأكاذيب. وإليك كيف تعمل، باستخدام تشبيهات بسيطة:

المشكلة: "الكاميرا المشوشة" مقابل "المرشد الذكي"

فكر في نظام الرؤية الخاص بالروبوت ككاميرا قد ترتبك أحياناً بسبب الإضاءة السيئة أو الانعكاسات. قد ترى ظلاً يشبه الحقيبة وتخبر عقل الروبوت: "هيه، هناك حقيبة!".

عادةً، تحاول الطرق الأخرى التحقق من إجابة الروبوت عبر النظر إلى البيانات الخام للكاميرا (التمثيلات البصرية - visual embeddings). ولكن إذا كانت الكاميرا مرتبكة، فإن عملية التحقق هذه ستفشل.

لقد اكتشف المؤلفون شيئاً مفاجئاً: تعليماتك (النص الذي تكتبه، مثل "يرجى وصف الصورة") تعمل مثل "مرشد ذكي". فبالرغم من أن الكاميرا مشوشة، إلا أن المرشد الذكي لديه طريقة لتصفية هذا التشويش. فعندما يقرأ الروبوت تعليماتك، فإنه "يعرف" ضمنياً ما هو موجود بالفعل في الصورة ويمكنه تجاهل إشارة "الحقيبة" المزيفة القادمة من الكاميرا المرتبكة.

الحل: "عدسة التعليمات"

بنى الباحثون كاشفاً يسمى InsLen يعمل مثل عدسة مكبرة تركز خصيصاً على أفكار "المرشد الذكي"، بدلاً من التركونة على الكاميرا.

وهي تقسم هذا إلى فحصين رئيسيين:

1. "فحص الواقع" (درجة المعايرة المحلية - Calibrated Local Score)

  • التشبيه: تخيل أن محققاً (الكاميرا) وجد دليلاً يبدو كأنه حقيبة. لكن قاضياً حكيماً (التعليمات) ينظر إلى نفس الدليل ويقول: "لا أعتقد أن هذه حقيبة؛ إنها مجرد ظل".
  • كيف يعمل: تأخذ الطريقة "ثقة" الروبوت في رؤية الحقيبة. إذا كانت الكاميرا متحمسة بشأن الحقيبة، ولكن "المرشد الذكي" (التعليمات) متشكك جداً ويعطي احتمالية منخفضة لها، فإن النظام يعرف أنه يجب معايرة (خفض) هذه الثقة. إنه يقول فعلياً: "الكاميرا تكذب؛ المرشد يعرف الحقيقة".

2. "فحص السياق" (درجة اتساق السياق - Context Consistency Score)

  • التشبيه: تخيل أنك تحاول تحديد هوية شخص في حشد.
    • الفحص المحلي: تنظر إلى بقعة ضبابية من البكسلات تبدو وكأنها وجه.
    • فحص السياق: تسأل "المرشد الذكي": "هل يتناسب هذا الشخص مع قصة المشهد بأكمله؟". إذا كان المشهد منحدر تزلج، فإن المرشد يعرف أنه يجب أن يكون هناك متزلجون وثلوج، ولكن رب الله "حقيبة" تطفو في الهواء.
  • كيف يعمل: تنظر الطريقة إلى فهم "المرشد الذكي" للمشهد بأكمله. فهي تتحقق مما إذا كان الشيء الذي يدعي الروبوت رؤيته (مثل "حقيبة") يتناسب مع القصة الشاملة التي يرويها المرشد. إذا كانت قصة المرشد لا تدعم وجود حقيبة، فإن النظام يصنف ذلك كـ "هلوسة".

لماذا هذا أفضل؟

حاولت معظم الطرق السابقة إصلاح الروبوت عن طريق إضافة المزيد من الآلات الثقيلة (مثل سؤال ذكاء اصطناعي ثانٍ فائق التكلفة للتحقق من العمل) أو تدريب الروبوت ليكون مثالياً (وهو أمر يستغرق وقتاً طويلاً جداً).

إن InsLen مختلف لأنه:

  • "جاهز للاستخدام مباشرة" (Plug-and-Play): لا تحتاج إلى إعادة تدريب الروبوت أو إضافة أدوات جديدة باهظة الثمن. أنت فقط تستخدم أفكار "المرشد الذكي" الداخلية الخاصة بالروبوت للتحقق من عمله.
  • سريع: لا يضيف أي وقت إضافي تقريباً إلى عملية تفكير الروبوت.
  • دقيق: في اختباراتهم، أمسكت هذه الطريقة بأكاذيب أكثر من أي طريقة أخرى جربوها، حتى عندما كان الروبوت ينظر إلى صور مخادعة حيث تبدو الأشياء الحقيقية والمزيفة متشابهة جداً (مثل الملعقة والسكين).

الملخص

تزعم الورقة البحثية أنه من خلال الاستماع إلى تعليمات الروبوت (المرشد الذكي) بدلاً من مجرد الاستماع إلى عينيه (الكاميرا)، يمكننا تصفية الأشياء المزيفة بفعالية. تجمع "درجة عدسة التعليمات" (InsLen) بين "فحص الواقع" (معايرة ثقة الكاميرا) و"فحص السياق" (التأكد من ملاءمة الشيء للقصة) لإنشاء كاشف أكاذب موثوق للغاية لوصف الصور بالذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →