← أحدث الأبحاث
🤖 AI

Causal Decoding for Hallucination-Resistant Multimodal Large Language Models

تقترح هذه الورقة إطار عمل للفك المسبب (causal decoding) يتدخل أثناء عملية التوليد لتخفيف الاعتمادات الزائفة، مما يقلل بفعالية من هلاوس الكائنات في النماذج اللغوية الكبيرة متعددة الوسائط مع الحفاظ على جودة وصفية عالية وتحقيق أعلى مستويات الأمانة (state-of-the-art faithfulness).

المؤلفون الأصليون: Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang

نُشر 2026-02-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً ومطلعاً واسع المعرفة يُدعى MLLM (نموذج لغوي كبير متعدد الوسائط). تعرض عليه صورة لبيتزا على طاولة وتسأله: "ماذا يوجد في هذه الصورة؟"

من الناحية المثالية، يجب أن يقول الروبوت: "أرى بيتزا على طبق".

ولكن أحياناً، يصبح هذا الروبوت مبدعاً أكثر من اللازم. ولأنه قرأ ملايين القصص عن حفلات البيتزا، قد يقول بثقة: "أرى بيتزا، وطبقاً، وسكين، وشوكة".

المشكلة هي أنه لا يوجد سكين أو شوكة في الصورة. الروبوت هنا يهلوس. إنه يخترع أشياء ليست موجودة لأنه يعتمد كثيراً على ما يتوقعه بناءً على الكلمات التي كتبها للتو، بدلاً من الاعتماد على ما يراه فعلياً.

تقدم هذه الورقة البحثية طريقة جديدة تسمى COAD (فك التشفير القائم على الوعي السببي بالأشياء) لإصلاح هذه المشكلة. وإليك كيف تعمل، مشروحة ببساطة.

المشكلة: تأثير "غرفة الصدى"

فكر في عقل الروبوت كأنه غرفة صاخبة.

  1. الصورة: تعرض على الروبوت صورة لبيتزا.
  2. النص: يبدأ الروبوت في الكتابة: "قطعة من البيتزا..."
  3. الخلل: بمجرد كتابة كلمة "بيتزا"، يبدأ عقله بالتفكير في "حفلات البيتزا". يبدأ بتخيل سكين وشوكة، رغم عدم وجودهما في الصورة. ثم يكتب: "...مع سكين وشوكة".

الروبوت محاصر في غرفة صدى. هو يسمع كلماته السابقة ("بيتزا") ويفترض أنها يجب أن يتبعها كلمات أخرى مرتبطة بالبيتزا ("سكين")، متجاهلاً الدليل البصري الفعلي. الأمر يشبه شخصاً يروي قصة، فيندمج في الحبكة لدرجة أنه يخترع شخصيات لم تظهر أبداً في القصة.

الحل: COAD (الروبوت "مدقق الحقائق")

قام المؤلفون ببناء نظام يسمى COAD لإيقاف هذا. يستخدمون حيلتين رئيسيتين: المحقق والمسافر عبر الزمن.

1. المحقق (كاشف الأشياء)

قبل أن يبدأ الروبوت في كتابة قصته، يستعين COAD بـ محقق متخصص (أداة كشف الأشياء).

  • ينظر المحقق إلى الصورة ويقول: "أرى بيتزا. أرى طبقاً. أنا لا أرى سكيناً. أنا لا أرى شوكة".
  • تُقدم هذه القائمة من الحقائق إلى الروبوت كقاعدة صارمة.

2. المسافر عبر الزمن (الاستدلال السببي)

هذا هو الجزء الذكي. عادة ما يكتب الروبوت قصته كلمة بكلمة. إذا كتب "بيتزا"، فقد يغتر بكتابة "سكين" تالياً.

  • الروبوت العادي: "أرى بيتزا... ربما سكين؟" (هو يخمن بناءً على ذاكرته).
  • روبوت COAD: يستخدم النظام حيلة رياضية تسمى الاستدلال السببي. هو يسأل الروبوت جوهرياً: "إذا أزلنا تأثير الكلمات التي كتبتها للتو، ونظرنا فقط إلى قائمة المحقق والصورة، فماذا ستقول؟"

الأمر يشبه سؤال شاهد في قاعة المحكمة: "تجاهل ما قاله لك المحامي للتو. بناءً على ما رأيته بعينيك فقط، ماذا حدث؟"

من خلال "قطع السلك" بين تخمينات الروبوت السابقة وتخمينه التالي، يجبر COAD الروبوت على الاعتماد على قائمة المحقق (الحقيقة البصرية) بدلاً من خيال الروبوت نفسه (صدى النص).

كيف يعمل الأمر في الممارسة العملية

تخيل أنك تكتب قصة عن شاطئ.

  • بدون COAD: تكتب "الشمس حارة". عقلك يفكر: "الشمس الحارة تعني شاطئاً"، لذا تكتب "هناك لوح تزلج". ولكن مهلاً، لا يوجد لوح تزلج في الصورة! لقد هلوست للتو لأن "الشمس" و"لوح التزلج" غالباً ما يجتمعان في بيانات تدريبك.
  • مع COAD:
    1. المحقق يفحص الصورة ويقول: "شمس: نعم. لوح تزلج: لا".
    2. النظام السببي يتدخل. يخبر الكاتب: "توقف عن التخمين بناءً على كلمة 'شمس'. انظر إلى ملاحظة المحقق. الملاحظة تقول 'لا يوجد لوح تزلج'. لذلك، لا تكتب 'لوح تزلج'".
    3. الكاتب يقول: "الشمس حارة. الرمال ذهبية". (دقيق وصادق).

النتائج

اختبر الباحثون هذا على العديد من الصور والأسئلة المختلفة.

  • الطريقة القديمة: كان الروبوت يخترع أشياء (مثل السكين والشوكة) في حوالي 30% من الحالات في بعض الاختبارات.
  • طريقة COAD: كان الروبوت يخترع أشياء في أقل من 6% من الحالات.

إنه يشبه أخذ قاصّ يحب اختلاق الأمور وإعطائه محرراً صارماً يمسك عدسة مكبرة فوق الصورة، لضمان أن كل كلمة تطابق الواقع.

لماذا هذا مهم

هذا أمر بالغ الأهمية للاستخدامات في العالم الحقيقي.

  • الطب: إذا نظر روبوت إلى صورة أشعة سينية، فلا ينبغي له أن يخترع عظمة مكسورة ليست موجودة.
  • القانون: إذا وصف روبوت صورة لمسرح جريمة، فلا ينبغي له أن يهلس بسلاح لم يكن موجوداً.

COAD لا يكتفي فقط بـ "المحاولة بجهد أكبر" ليكون دقيقاً؛ بل يغير كيفية تفكير الروبوت. إنه يجبر الروبوت على التوقف عن الاستماع إلى ثرثرته الداخلية والبدء في الاستماع إلى الدليل البصري، مما يجعله مساعداً أكثر موثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →