← أحدث الأبحاث
💻 computer science

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

تقدم هذه الورقة البحثية HALP، وهي طريقة تكتشف الهلوسة في نماذج الرؤية واللغة قبل توليد النص من خلال تحليل التمثيلات الداخلية، محققةً دقة عالية عبر بنيات متنوعة وممكنةً لتدخلات السلامة الفعالة مثل الامتناع المبكر.

المؤلفون الأصليون: Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

نُشر 2026-03-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً، ولكنه مغرور قليلاً. تعرض عليه صورة لقطة تجلس على حصيرة، وتسأله: "هل ترتدي القطة قبعة؟"

قد ينظر إنسان طبيعي بتمعن، ويدرك أنه لا توجد قبعة، فيقول: "لا". لكن هذا الروبوت، المتلهف لإرضائك والمدرب على ملايين الكتب، قد يقول بثقة: "نعم، القطة ترتدي بيريه أحمر صغيراً!" رغم عدم وجود قبعة في الصورة. وهذا ما يسمى بـ "الهلوسة" (Hallucination).

لفترة طويلة، كانت الطريقة الوحيدة للإمساك بالروبوت وهو يكذب هي الانتظار حتى ينهي جملته بالكامل، ثم قراءتها، ثم التحقق مما إذا كانت صحيحة أم لا. ولكن بحلول ذلك الوقت، يكون الروبوت قد أهدر بالفعل الوقت والطاقة في "التحدث"، وإذا كان الموقف حرجاً (مثل سيارة ذاتية القيادة أو تشخيص طبي)، فإن الانتظار حتى ينطق بالكذبة كاملة سيكون قد فات الأوان.

إليك HALP: "جهاز كشف الكذب" الذي يعمل قبل أن يفتح الروبوت فمه.

الفكرة الجوهرية: قراءة عقل الروبوت

أدرك الباحثون وراء ورقة HALP البحثية أننا لسنا بحاجة للانتظار حتى يتحدث الروبوت. يمكننا استراق النظر إلى "عقل" الروبوت (إشاراته الحاسوبية الداخلية) قبل أن يُنشئ كلمة واحدة.

فكر في الأمر كالتالي:

  • الطريقة القديمة: تنتظر الروبوت حتى يروي قصة. وبمجرد انتهائه، تتحقق من الحقائق. إذا كذب، عليك حذف القصة بأكملة والبدء من جديد.
  • طريقة HALP: تراقب نشاط عقل الروبوت أثناء تفكيره في الصورة ولكن قبل أن يبدأ في الكلام. يمكنك رؤية "إشارات التوتر" أو "شرارات الارتباك" في عقله التي تقول: "أنا لست متأكداً من هذا!" أو "أنا على وشك اختلاق شيء ما!".

كيف يعمل (المجسات الثلاثة)

بنى الباحثون "كاشفاً" صغيراً وخفيف الوزن (مسباراً) يتحقق من ثلاثة أجزاء مختلفة من عقل الروبوت خلال مسح سريع واحد:

  1. مجس "العيون" (الميزات البصرية - Visual Features): يتحقق مما يراه الروبوت قبل أن يحاول حتى فهم السؤال. يشبه الأمر التحقق مما إذا كانت عينا الروبوت مشوشتين أو إذا كان يرى أشياءً ليست موجودة.
  2. مجس "الجسر" (رموز الرؤية - Vision Tokens): يتحقق من كيفية محاولة الروبوت دمج الصورة مع السؤال. يشبه الأمر مراقبة الروبوت وهو يحاول ربط قطعة من الصورة بقطعة من السؤال. إذا لم تتطابق القطع، يضيء مجس الجسر.
  3. مجس "التفكير" (رموز الاستعلام - Query Tokens): هذا هو الأقوى. يتحقق من عقل الروبوت مباشرة بعد أن نظر إلى الصورة وقرأ السؤال، ولكن قبل أن يبدأ في كتابة الإجابة. يشبه الأمر ضبط الروبوت تماماً وهو على وشك التحدث، حيث تشعر بتردده أو "ثقته المزيفة" في أفكاره.

النتائج: بلورة سحرية للحقيقة

اختبر الفريق هذه التقنية على ثمانية نماذج ذكاء اصطناعي حديثة مختلفة (مثل Llama وGemma وQwen). وإليكم ما وجدوه:

  • إنه يعمل: كان "مجس التفكير" (Query Tokens) بارعاً للغاية في التنبؤ بالأكاذيب. بالنسبة لبعض النماذج، بلغت دقة معرفة ما إذا كان الروبوت على وشك الهلوسة 93%، دون أن ينطق الروبوت بكلمة واحدة.
  • إنه سريع: بما أنه يقوم فقط بمسح سريع واحد للدماغ، فهو سريع للغاية ولا يضيف أي تأخير تقريباً إلى العملية.
  • روبوتات مختلفة، عقول مختلفة: وجدوا أن نماذج الذكاء الاصطناعي المختلفة "تفكر" بشكل مختلف.
    • بعض النماذج (مثل Gemma) تظهر "إشارات الكذب" الخاصة بها بوضوح في نهاية عملية التفكير تماماً.
    • نماذج أخرى (مثل Qwen) تظهر الإشارات بوضوح بمجرد النظر إلى الصورة، حتى قبل البدء في التفكير في السؤال.
    • كان أحد النماذج (FastVLM) غريباً؛ حيث أظهر "إشارات الكذب" في منتصف تفكيره، وليس في نهايته.

لماذا يهم هذا: علامة "ممنوع الدخول"

تخيل حارس أمن عند بوابة.

  • قبل HALF: يسمح الحارس للجميع بالدخول، ويستمع إلى قصصهم، ثم يطردهم بعد ذلك إذا تبين أنهم يكذبون. هذا أمر بطيء ومزعج.
  • مع HALP: يمتلك الحارس ماسحاً ضوئياً سحرياً يصدر صوتاً (بييب) إذا كان شخص ما على وشك الكذب. إذا أصدر الماسح الصوت، يقول الحارس: "توقف! لا أعتقد أنك تعرف الإجابة. دعنا لا نضيع الوقت".

هذا يسم يسمح لأنظمة الذكاء الاصطناعي بـ:

  1. رفض الإجابة: إذا كانت مخاطر الكذب عالية، يمكن للذكاء الاصطناعي ببساطة أن يقول: "أنا لست متأكداً"، بدلاً من اختلاق حقيقة مزيفة.
  2. التوجيه الذكي: إذا كانت المخاطر عالية، يمكن للنظام إرسال السؤال إلى ذكاء اصطناعي فائق الذكاء (ولكنه بطيء)، بينما يترك الأسئلة السهلة للذكاء الاصطناعي السريع والأقل تكلفة.
  3. توفية المال والوقت: يمنع الذكاء الاصطناعي من إضاعة الطاقة في توليد قصص طويلة مزيفة يجب التخلص منها لاحقاً.

الخلاصة

HALP يشبه جهاز كشف "الجريمة قبل وقوعها" للذكاء الاصطناائي. هو لا يمنع الذكاء الاصطناعي من امتلاك أفكار سيئة، ولكنه يمنحنا طريقة لرصد تلك الأفكار السيئة قبل أن تتحول إلى كلمات. هذا يجعل الذكاء الاصطناعي أكثر أماناً، وأسرع، وأكثر موثوقية، خاصة في المواقف التي تكون فيها دقة الحقائق مسألة حياة أو موت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →