← أحدث الأبحاث
🤖 AI

Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

تقدم هذه الورقة البحثية إطار عمل "التحسين المباشر للتفضيلات المشروط بالاستدلال" (RC-DPO)، وهو إطار تدريب مبتكر يقلل من الهلوسة في نماذج الاستدلال اللغوية الكبيرة متعددة الوسائط من خلال مواءمة توليد الإجابات صراحةً مع سلاسل استدلال منطقية متسقة بصرياً بدلاً من معاملتها كمخرج واحد متجانس.

المؤلفون الأصليون: Jiawei Kong, Hao Fang, Shunxiang Liao, Jinyu Li, Bin Chen, Hao Wu, Shu-Tao Xia, Min Zhang

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiawei Kong, Hao Fang, Shunxiang Liao, Jinyu Li, Bin Chen, Hao Wu, Shu-Tao Xia, Min Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "التفكير مهم: الحد من الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط عبر تحسين التفضيل المشروط بالتفكير" باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة: "الكاذب الواثق"

تخيل طالباً ذكياً جداً (الذكاء الاصطناعي) يخوض اختباراً حول صورة ما. هذا الطالب بارع في حل المسائل الصعبة، لكن لديه عادة سيئة: غالباً ما يهلوس.

في الماضي، إذا أخطأ الطالب في الإجابة النهائية، كان المعلمون يكتفون بقول: "لا، هذه الإجابة غير صحيحة". لكن هذه الورقة البحثية اكتشفت مشكلة جديدة في "نماذج التفكير" (الذكاء الاصطنا الذي يفكر بصوت عالٍ قبل الإجابة).

هذه النماذج لا تخطئ في الإجابة النهائية فحسب؛ بل إنها غالباً ما تكذب أثناء عملية التفكير.

  • السيناريو: ينظر الطالب إلى صورة شاحنة في صحراء.
  • الكذبة: في خطوات "تفكيره" (سلسلة الأفكور - Chain-of-Thought)، يبتكر قصة: "أرى طاولة طعام زرقاء في المقدمة". (لا توجد طاولة أصلاً).
  • النتيجة: ولأن الطالب أقنع نفسه بوجود الطاولة، فإنه يجيب بثقة: "نعم، توجد طاولة طعام".

تجادل الورقة بأن طرق التدريب الحالية تشبه المعلمين الذين يصححون الإجابة النهائية فقط. إنهم يرون "نعم" و"لا" ويحاولون إصلاح ذلك، لكنهم يتجاهلون حقيقة أن عملية تفكير الطالب كانت مليئة بالأكاذيب. يتعلم الطالب تخمين الإجابة الصحيحة عن طريق الحظ أو حفظ الاختصارات، دون أن يتعلم فعلياً كيفية النظر إلى الصورة بشكل صحيح.

الحل: RC-DPO (مدرب التفكير)

يقترح المؤلفون طريقة تدريب جديدة تسمى RC-DPO (تحسين التفضيل المباشر المشروط بالتفكير).

فكر في هذا كطريقة جديدة لمدرب يدرب رياضياً. بدلاً من مجرد قول: "لقًد ركضت في السباق ببطء، حاول مجدداً"، يقوم المدرب بتفكيك الأمر:

  1. الشرط: يقول المدرب: "إذا ركضت بـ وضعية جيدة (عملية تفكير صادقة)، فستحصل على ميدالية ذهبية. أما إذا ركضت بـ وضعية سيئة (عملية تفكير كاذبة)، فستحصل على عقوبة، حتى لو تمكنت بطريقة ما من عبور خط النهاية أولاً".
  2. الهدف: يتعلم الذكاء الاصطناعي أن "الإجابة الجيدة" لا تكون صالحة إلا إذا كانت مدعومة بـ "عملية تفكير جيدة". هذا يجبر الذكاء الاصطناعي على مواءمة تفكيره مع الأدلة البصرية.

كيف بنوا بيانات التدريب (استراتيجية "البحث والتقليم")

لتعليم الذكاء الاصطناعي هذا الدرس الجديد، احتاج الباحثون إلى أمثلة لـ "التفكير الجيد" مقابل "التفكير السيئ". لم يطلبوا من البشر كتابتها؛ بل بنوا نظاماً لتوليدها تلقائياً:

  1. إيجاد "التفكير الجيد" (MCTS):
    تخيل محققاً يحاول حل لغز ما. بدلاً من التخمين عبر مسار واحد، يجرب المحقق مسارات عديدة ومختلفة (باستخدام طريقة تسمى البحث في شجرة مونت كارلو - Monte Carlo Tree Search). يتحقق من كل مسار ليرى: "هل تتوافق هذه الخطوة مع الصورة؟ هل المنطق سليم؟"
  • يختار المسار الأكثر منطقية ودقة من الناحية البصرية. وهذا يصبح العينة الإيجابية (مثال "التفكير الجيد").
  1. إنشاء "التفكير السيئ" (تقليم الانتباه):
    لتعليم الذكاء الاصطناعي ما يجب ألا يفعله، أخذوا إجابة عادية وقاموا بتخريبها عمداً. نظروا إلى الكلمات الأكثر ارتباطاً بالصورة في جزء "التفكير" (مثل "أحمر"، "شاحنة"، "غبار").
  • قاموا بـ تقليم (قص) تلك الكلمات البصرية المهمة.
  • نتج عن ذلك "تفكير سيئ" يبدو وكأنه تفكير، لكنه في الواقع يتجاهل الصورة. وهذا يصبح العينة السلبية.

النتيجة: مفكر أكثر صدقاً

من خلال تدريب الذكاء الاصطناعي على تفضيل مسار "التفكير الجيد" على مسار "التفكير السيئ" (حتى عندما تكون الإجابة النهائية هي نفسها)، تعلم النموذج التوقف عن الكذب أثناء عملية التفكير.

  • قبل: كان الذكاء الاصطنا-ي يهلوس بوجود طاولة، ويفكر فيها، ثم يجيب بـ "نعم".
  • بعد: ينظر الذكاء الاصطناعي إلى الصورة، ويرى عدم وجود طاولة، ويفكر: "أرى شاحنة ومستودعاً، ولكن لا توجد طاولة"، ثم يجيب بـ "لا".

الملخص

تزعم الورقة البحثية أنه لإيقاف الذكاء الاصطناعي عن الهلوسة (اختلاق الأشياء)، لا يمكننا فقط إصلاح الإجابة النهائية. يجب علينا إصلاح عملية التفكير نفسها. طريقتهم الجديدة، RC-DPO، تعمل كمدرب صارم يقول: "لا يمكنك الحصول على الإجابة الصحيحة إذا كان استنتاجك كذبة". من خلال تدريب النموذج على ربط الإجابات الجيدة بدقة بعمليات تفكير جيدة قائمة على الأدلة، قللوا بشكل كبير من عدد حالات الهلوسة في هذه النماذج اللغوية البصرية المعقدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →