← أحدث الأبحاث
💻 computer science

DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning

تقدم الورقة البحثية DeFacto، وهو إطار عمل للاستدلال القائم على التفكير المضاد يستفيد من مسار توجيهي لغوي لتوليد مجموعة بيانات متخصصة، ويستخدم التعلم المعزز القائم على تحسين السياسة من خلال المكافآت المتعددة (GRPO) مع مكافآت متعددة الأوجه لتحسين كل من دقة الإجابة والاتساق المستند إلى الأدلة في النماذج اللغوية متعددة الوسائط بشكل كبير.

المؤلفون الأصليون: Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تخوض اختباراً حيث يتعين عليك الإجابة على أسئلة حول صورة. معظم برامج الكمبيوتر الذكية (التي تسمى النماذج اللغوية الكبيرة متعددة الوسائط) تشبه الطلاب الذين يجيدون التخمين بناءً على ما قرأوه في الكتب، لكنهم غالباً ما يتجاهلون الصورة الفعلية الموجودة أمامهم. قد يعطونك الإجابة الصحيحة، ولكن لأسباب خاطئة، أو قد ينظرون إلى الجزء الخطأ من الصورة تماماً.

تقدم هذه الورقة البحثية طريقة جديدة تسمى DeFacto (اختصاراً لـ "De Facto"، والتي تعني "في الواقع") لإصلاح هذا الأمر. فكر في DeFacto كمعلم صارم يجبر الطالب على إثبات أنه ينظر بالفعل إلى الصورة قبل أن يُسمح له بكتابة الإجابة.

إليك كيف يعمل ذلك، مقسماً عبر تشبيهات بسيطة:

1. المشكلة: "الخبير المزيف"

تعاني نماذج الذكاء الاصطوي الحالية من ثلاث عادات "غش" محددة:

  • التخمين الأعمى: ينظرون إلى الجزء الخطأ من الصورة ويصلون إلى الإجابة الخاطئة.
  • التخمين المحظوظ: ينظرون إلى الجزء الخطأ من الصورة ولكنهم بطريقة ما يخمنون الإجابة الصحيحة (بمجرد الحظ أو حفظ النصوص).
  • الخطأ الصادق: ينظرون إلى الجزء الصحيح من الصورة ولكنهم لا يزالون يخطئون في الإجابة لأنهم لا يستطيعون ربط الأمور ببعضها.

تجادل الورقة بأن كونك "ذكياً" ليس كافياً؛ بل يجب أن يكون الذكاء الاصطناعي أميناً (Faithful)، مما يعني أن إجابته يجب أن تكون مرتبطة مباشرة بما يراه بالفعل.

2. الحل: لعبة "القطعة المفقودة"

لتعليم الذكاء الاصطناعي التوقف عن الغش، ابتكر الباحثون لعبة تدريبية خاصة تسمى التفكير المضاد للواقع (Counterfactual Thinking). تخيل أنك تلعب لعبة "أين والدو؟" (Where's Waldo?) ولكن مع لمسة مختلفة:

  • الجولة الأولى (الحالة الإيجابية): تعرض الصورة الكاملة مع ظهور الأدلة. يجب على الذكاء الاصط_ي العثور على الأدلة (مثل قبعة حمراء أو لافتة معينة) والإجابة على السؤال. إذا أجاب بشكل صحيح، يحصل على نجمة ذهبية.
  • الجولة الثانية (حالة المضاد للواقع): هذا هو الجزء السحري. يأخذ الباحثون الأدلة الدقيقة التي يحتاجها الذكاء الاصطناعي (مثل القبعة الحمراء) ويغطونها بصندوق أسود (Masking). الآن، يُسأل الذكاء الاصطناعي نفس السؤال.
    • إذا حاول التخمين على أي حال، فإنه يتعرض لعقوبة كبيرة.
    • إذا قال: "لا أعرف، الدليل مفقود"، فإنه يحصل على نجمة ذهبية.
    • لماذا هذا مهم: هذا يعلم الذكاء الاصطناوي أنه إذا لم يكن الدليل موجوداً، فلا ينبغي له التظاهر بمعرفة الإجابة. إنه يتعلم الاعتراف بالجهل بدلاً من الهلوسة.
  • الجولة الثالثة (حالة الحجب العشوائي): يقوم الباحثون بتغطية أجزاء من الصورة لا تهم (مثل السماء أو شجرة في الخلفية). يجب على الذكاء الاصطناعي أن يظل يجيب بشكل صحيح. هذا يمنع الذكاء الاصطناعي من تعلم أن "الصناديق السوداء" تعني دائماً "لا تجب". إنه يتعلم التمييز بين "الدليل المفقود" و"الخلفية غير ذات الصلة".

3. عملية التدريب: "الواجب المنزلي المصحح"

لم يقم الباحثون بكتابة هذه الأسئلة يدوياً (لأن ذلك سيستغرق وقتاً طويلاً جداً)، بل بنوا خط إنتاج آلي (Robot Pipeline) يقوم بـ:

  1. قراءة السؤال.
  2. العثور تلقائياً على الأجزاء المهمة من الصورة (مثل "النص الموجود على القميص" أو "الأوراق الموجودة على الشجرة").
  3. إنشاء الآلاف من هذه النسخ "المغطاة" للصور.

لقد أنشأوا مجموعة بيانات ضخمة تسمى DeFacto-100K (100,000 مثال) لتدريب الذكاء الاصطناعي.

ثم استخدموا طريقة تدريب خاصة تسمى GRPO (تحسين السياسة النسبي للمجموعات). فكر في الأمر كمدرب يشاهد الذكاء الاصطناعي وهو يلعب 4 جولات متتالية. إذا كان أداء الذكاء الاصطناعي أفضل في جولة واحدة من متوسط الجولات الثلاث الأخرى، فإنه يحصل على مكافأة. يساعد هذا الذكاء الاصطناعي على التعلم ليكون متسقاً: ابحث دائماً عن الدليل، وإذا اختفى، قل "لا أعرف".

4. النتائج: طالب أفضل

عندما اختبروا نموذج "DeFacto" الجديد مقابل نماذج رائدة أخرى:

  • حصل على أسئلة أكثر صحة.
  • كان من الصعب جداً خداعه. عندما تم إخفاء الأدلة، قال DeFacto "لا أعرف" بشكل صحيح أكثر بكثير من النماذج الأخرى التي استمرت في التخمين.
  • كان أكثر صدقاً. توقف عن اختلاق أسباب لإجاباته. إذا أشار إلى جزء معين من الصورة لتبرير إجابته، فإن ذلك الجزء كان يحتوي بالفعل على الإثبات.

ملخص

باختاًصار، DeFacto هي طريقة تدريب تعلم نماذج الذكاء الاصطناعي أن يكونوا محققين صادقين. فبدلاً من مجرد تخمين الإجابة بناءً على ما يعتقدون أنه قد يكون صحيحاً، يتم تدريبهم على:

  1. العثور على الدليل البصري المحدد.
  2. إذا كان الدليل مفقوداً، الاعتراف بأنهم لا يعرفون.
  3. إذا كان الدليل موجوداً، استخدامه لإثبات إجابتهم.

وتزعم الورقة أن هذا يجعل تفكير الذكاء الاصطناعي أكثر موثوقية وترسيخاً في الواقع، مما يمنع اختلاق قصص تبدو جيدة ولكنها ليست حقيقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →