← أحدث الأبحاث
💻 computer science

PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment

يُعد PalMR إطار عمل مبتكر يعزز من موثوقية النماذج اللغوية الكبيرة متعددة الوسائط من خلال محاذاة كل من عملية الاستدلال والنتائج عبر طبقة بيانات متوافقة مع الإدراك ومخطط دمج مكافآت هرمي، مما يقلل بشكل كبير من الهلوسة البصرية مع تحقيق أداء رائد على المقاييس الرئيسية.

المؤلفون الأصليون: Yantao Li, Qiang Hui, Chenyang Yan, Kanzhi Cheng, Fang Zhao, Chao Tan, Huanling Gao, Jianbing Zhang, Kai Wang, Xinyu Dai, Shiguo Lian

نُشر 2026-03-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yantao Li, Qiang Hui, Chenyang Yan, Kanzhi Cheng, Fang Zhao, Chao Tan, Huanling Gao, Jianbing Zhang, Kai Wang, Xinyu Dai, Shiguo Lian

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً ذكياً جداً ولكنه مشاكس قليلاً كيفية حل لغز ما. هذا الطالب هو نموذج ذكاء اصطناعي (مثل تلك التي تدردش معك أو تنظر إلى الصور).

المشكلة: الطالب "المحظوظ بالتخمين"

في الماضي، عندما كنا نعلم هؤلاء الطلاب من الذكاء الاصطناائي، كنا نهتم فقط بـ الإجابة النهائية.

  • السيناريو: تعرض للطالب صورة لثلاث تفاحات وتسأله: "كم عدد التفاحات الموجودة هنا؟"
  • الطريقة القديمة: إذا كتب الطالب مقالاً طويلاً ومربكاً يدعي فيه وجود "خمس تفاحات وموزة" (يهلوس بأشياء ليست موجودة أصلاً) ولكنه كتب في النهاية "3" بشكل سحري، فإننا نمنحه درجة امتياز (A+).
  • النتيجة: تعلم الطالب الغش؛ حيث كان يخمن الإجابة الصحيحة بناءً على أنماط نصية حفظها، متجاهلاً الصورة الفعلية. وإذا سألته عن كيفية وصوله إلى الإجابة، فإنه يختلق الأسباب. وهذا ما يسمى بـ "الهلوسة" (Hallucination).

الحل: PaLMR (المعلم "الأمين")

تقدم الورقة البحثية طريقة جديدة تسمى PaLMR (محاذاة العمليات للاستنتاج متعدد الوسائط). فكر في PaLMR ليس فقط كمعلم يهتم بتصحيح الاختبار النهائي، بل كمدرب صارم يراقب كل خطوة من خطوات تفكير الطالب.

إليك كيف يعمل PaLMR، باستخدام تشبيه بسيط:

1. "دفتر التحقق من الحقائق" (طبقة البيانات)

قبل أن يبدأ الطالب التدريب، يقوم PaLMR بإنشاء "دفتر خاص للتحقق من الحقائق".

  • بدلاً من مجرد إعطاء الطالب سؤالاً وإجابة، يستخدم PaL_MR ذكاءً اصطناعياً فائق الذكاء (مثل Gemini) لكتابة وصف موضوعي ومفصل للصورة أولاً.
  • التشبيه: تخيل أنه قبل أن ينظر الطالب إلى اللغز، يكتب المعلم: "هناك بالضبط 3 أسطوانات حمراء وكرة زرقاء واحدة". هذا يصبح هو "الحقيقة المطلقة" (Ground Truth). لا يمكن للطالب مجرد التخمين؛ بل يجب عليه مطابقة أفكاره مع هذا الدفتر.

2. نظام التصحيح "ثنائي الخطوات" (طبقة التحسين)

هذا هو الجزء السحري. عندما يحاول الطالب حل مشكلة ما، لا ينظر PaLMR فقط إلى الرقم النهائي. بل يستخدم نظام مكافأة هرمي:

  • الخطوة أ: حارس البوابة "هل نظرت حقاً؟"
    قبل أن يتحقق المعلم حتى مما إذا كانت الإجابة صحيحة، فإنه يتحقق من خطوات استنتاج الطالب.

    • الطالب يقول: "أرى 5 أسطوانات..."
    • المعلم يتحقق من الدفتر: "مهلاً، الدفتر يقول إن هناك 3 فقط."
    • العقوبة: يقوم المعلم فوراً بالضغط على زر "إيقاف". حتى لو خمن الطالب الرقم الصحيح في النهاية، فإنه يحصل على صفر من النقاط لأنه لم ينظر إلى الصورة بشكل صحيح.
    • التشبيه: الأمر يشبه اختبار رياضيات حيث إذا كتبت أرقاماً خاطئة في قسم خطوات الحل، فلن تحصل على أي درجات، حتى لو كانت إجابتك النهائية صحيحة. يجب أن توضح خطوات عملك بشكل صحيح.
  • الخطوة ب: فحص "هل هي صحيحة؟"
    فقط إذا اجتاز الطالب الخطوة (أ) (أي وصف الصورة بدقة)، يقوم المعلم حينها بالتحقق مما إذا كانت الإجابة النهائية صحيحة.

3. القاضي "المقارن" (المقارنة)

للتأكد من أن التصحيح عادل، لا يسأل PaLMR المعلم ببساطة: "هل هذا صحيح؟" بل يسأله: "أي من هاتين الإجابتين أكثر صدقاً؟"

  • يعرض على المعلم طريقتين مختلفتين حاول بهما الطالب حل المشكلة.
  • يقارن المعلم بينهما وبين "دفتر التحقق من الحقائق" ويختار الإجابة التي التزمت بالواقع بشكل أكبر.
  • يساعد هذا الطالب على تعلم أن كونه صادقاً بشأن ما يراه هو أمر أكثر أهمية من كونه محظوظاً.

لماذا يهم هذا الأمر؟

بدون PaLMR، تكون نماذج الذكاء الاصطناعي مثل المنجمين: قد يعطونك الإجابة الصحيحة بالصدفة، لكنهم يختلقون الأشياء أثناء العملية. إذا سألتهم عن شرحهم، فإنهم يكذبون.

مع PaLMR، تصبح نماذج الذكاء الاصطناعي مثل المحققين:

  1. يفحصون الأدلة بعناية (الصورة).
  2. يسردون الحقائق التي يرونها (دون تخمين).
  3. لا يستخلصون استنتاجاً إلا إذا كانت الحقائق تدعم ذلك.

النتيجة

تظهر الورقة البحثية أنه عندما دربوا نموذج الذكاء الاصطناعي الخاص بهم (Qwen2.5-VL-7B) باستخدام طريقة "المعلم الأمين" الجديدة هذه:

  • أخطاء أقل: توقف الذكاء الاصطناعي عن اختلاق أشياء غير موجودة في الصورة.
  • منطق أفضل: أصبح أفضل بكما في مهام الاستنتاج البصري (مثل المسائل الرياضية التي تحتوي على رسوم بيانية أو هندسة).
  • موثوقية: إذا قال الذكاء الاصطناعي "أرى مكعباً أزرق"، يمكنك حقاً الوثوق بوجود مكعب أزرق في الصورة.

باخت مختصره: يعلم PaLMR الذكاء الاصطناعي أن الرحلة (كيف تفكر) لا تقل أهمية عن الوصول (الإجابة). إنه يجبر الذكاء الاصطناعي على أن "يرى" قبل أن "يتحدث".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →