← أحدث الأبحاث
💬 NLP

DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification

يُعد DecomposeRL إطار عمل للتحقق من الادعاءات شبه مُشرف وقابل للتتبع، يستفيد من قمع تنقية البيانات والتعلم التعزيزي القائم على GRPO لتدريب نموذج مدمج بحجم 7 مليار بارامتر، محققاً أداءً يضاهي النماذج المرجعية الأكبر حجماً بكثير مع إنتاج مسارات استدلال قابلة للتفسير.

المؤلفون الأصليون: Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro

نُشر 2026-05-28
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث DECOMPOSERL، مقسمة إلى مفاهيم بسيطة باستخدام تشبيهات من الحياة اليومية.

المشكلة الكبرى: "الصندوق الأسود" مقابل "المحقق البطيء"

تخيل أنك تحاول التحقق من إشاعة جامحة، مثل: "مؤلف رواية '1984' فاز بجائزة نوبل".

حالياً، هناك طريقتان يحاول الكمبيوتر من خلالهما حل هذه المشكلة:

  1. مصنف "الصندوق الأسود" (The Black Box Classifier): هذا يشبه حارس أمن فائق السرعة ينظر إلى الإشاعة ويصرخ فوراً: "خطأ!". إنه سريع وغالباً ما يكون مصيباً، ولكن إذا سألته: "لماذا؟"، سيكتفي بهز كتفيه. هو لا يعطيك أي دليل. في المواقف عالية الخطورة (مثل الطب أو السياسة)، لا يمكنك الوثوق بالحكم دون رؤية الأدلة.
  2. "المحقق البطيء" (التفكيك - Decomposition): هذا يشبه محققاً يفكك الإشاعة إلى أسئلة صغيرة: "من كتب 1984؟" -> "هل فاز ذلك الشخص بجائزة نوبل؟". إنه يكتب كل خطوة، بحيث يمكنك رؤية الدليل. ومع ذلك، فإن هؤلاء المحققين غالباً ما يكونون بطيئين، ويرتكبون الأخطاء، ويجدون صعوبة في التعلم من الحالات الجديدة دون أن يمسك بهم معلم بشري من أيديهم.

DECOMPOSERL هو نظام جديد يحاول أن يكون الأفضل في العالمين: محقق سريع ودقيق يترك أثراً واضحاً وقابلاً للفحص لكل إجابة.


كيف يعمل: "السائل الذكي"

بدلاً من مجرد تخمين الإجابة، تم تدريب DECOMPOSERL ليكون محققاً بارعاً. مهمته ليست الإجابة على الادعاء مباشرة؛ بل مهمته هي طرح المجموعة المثالية من الأسئلة لمعرفة الحقيقة.

فكر في الأمر كأنه لعبة "العشرين سؤالاً"، ولكن الكمبيوتر يلعب ضد نفسه لإيجاد المسار الأكثر كفاءة نحو الحقيقة.

1. "نظام المكافأة" (المدرب)

لتعليم هذا الذكاء الاصطناعي كيفية طرح أسئلة جيدة، لم يكتفِ الباحثون بقول "عمل جيد" أو "عمل سيء". بل بنوا نظام مكافأة متعدد الأوجه (مثل مدرب صارم لديه قائمة تحقق). يحصل الذكاء الاصطناعي على نقاط فقط إذا استوفت أسئلته ثلاثة معايير محددة:

  • المفيد (تغيير قواعد اللعبة): إذا قمت بإزالة هذا السؤال، هل تتغير الإجابة النهائية؟
    • تشبيه: تخيل هيئة محلفين. إذا سأل أحد المحلفين: "هل كان يملك سيارة حمراء؟" وظل الحكم كما هو، فقد كان هذا السؤال غير مفيد. لكن إذا سأل: "هل كان في مسرح الجريمة؟" وغير ذلك من الحكم، فقد كان هذا السؤال مفيداً. يتعلم DECOMPOSERL الاحتفاظ فقط بالأسئلة التي تغير النتيجة فعلياً.
  • المعلوماتي (قاعدة "الحقائق فقط"): يجب أن يكون السؤال قابلاً للإجابة باستخدام الأدلة المقدمة فقط، ويجب أن يكون حقيقة واحدة واضحة.
    • تشبيه: سؤال مثل "هل هذا الادعاء صحيح؟" هو سؤال سيء لأنه يكرر المشكلة فقط. وسؤال مثل "كم عدد صفحات الكتاب؟" هو أمر سيء إذا كان طول الكتاب لا يهم. يتعلم الذكاء الاصطناعي طرح أشياء مثل: "من كتب الكتاب؟" وهو حقيقة محددة ومستندة إلى نص.
  • المتنوع (قاعدة "عدم التكرار"): لا ينبغي أن تكون الأسئلة مكررة.
    • تشبيه: إذا سألت "من كتب الكتاب؟" ثم سألت "من هو مؤلف الكتاب؟"، فقد أضعت الوقت. يتعلم الذكاء الاصطناي طرح أسئلة مختلفة تغطي أجزاءً مختلفة من اللغز.

2. "قمع البيانات" (المصفاة)

تدريب ذكاء اصطناعي ذكي يتطلب عادةً ملايين الأمثلة، وهو أمر مكلف وبطيء. استخدم الباحثون خدعة ذكية: قمع البيانات (The Data Funnel).

  • بدأوا بمجموعة ضخمة مكونة من 155,000 مثال للتحقق من الحقائق من الإنترنت.
  • مرروها عبر سلسلة من الفلاتر (مثل فلتر القهوة):
    • الفلتر 1: التخلص من الادعاءات التي هي قصيرة جداً أو طويلة جداً.
    • الفلتر 2: التخلص من الادعاءات السهلة للغاية (التي يمكن لأي ذكاء اصطناعي بسيط حلها) أو الفوضوية جداً.
    • الفلتر 3: إزالة المكررات.
  • النتيجة: قاموا بتصفية تلك المجموعة الضخمة لتصل إلى "جوهر" صغير وعالي الجودة مكون من 5,000 ادعاء فقط.
  • تشبيه: تخيل أنك تحاول تعلم الطبخ عن طريق تذوق 155,000 طبق عشوائي، معظمها محترق أو بلا طعم. بدلاً من ذلك، قام مبتكرو DECOMPOSERL بتصفية ذلك إلى 5,000 وصفة مثالية بجودة الطهاة. تعلم الذكاء الاصطناعي بشكل أسرع وأفضل من هذه المجموعة الصغيرة عالية الجودة مقارنة بالمجموعة الضخمة الفوضوية.

3. "التعلم شبه الموجه" (التعلم بدون معلم)

عادةً، لتدريب ذكاء اصطناعي، تحتاج إلى إنسان ليقيم كل إجابة (العلامات الذهبية/Gold Labels). لكن البشر بطيئون ومكلفون.

يمتلك DECOMPOSERL وضعاً خاصاً حيث يمكنه التعلم حتى لو كانت 90% من الإجابات غير مقيمة.

  • كيف؟ يستخدم تقنية "الاتساق الذاتي" (Self-Consistency). يقوم الذكاء الاصطناعي بإنشاء عدة "مسارات" (مجموعات من الأسئلة) مختلفة لنفس الادعاء. إذا اتفقت 7 من أصل 8 مسارات على النتيجة النهائية، يفترض الذكاء الاصطناعي أن هذه النتيجة صحيحة ويستخدمها كـ "علامة زائفة" (pseudo-label) ليعلم نفسه.
  • تشبيه: تخيل طالباً يؤدي اختباراً بدون نموذج إجابة. إذا حل الطالب المسألة بخمس طرق مختلفة وحصل على نفس الإجابة في كل مرة، فإنه يكتسب الثقة في أنه على حق، حتى بدون معلم يصحح له.

النتائج: صغير ولكن قوي

اختبر الباحثون نموذجهم الذي يحتوي على 7 مليارات معلمة (وهو صغير نسبياً في عالم الذكاء الاصطناعي) مقابل نماذج أكبر بكثير (32 مليار معلمة) وحتى أنظمة مملوكة رفيعة المستوى مثل GPT-4.

  • الدقة: طابق DECOMPOSERL أداء نماذج أكبر منه بـ 4 مرات.
  • الكفاءة: حقق ذلك باستخدام مجموعة بيانات صغيرة ومنتقاة مكونة من 5,000 ادعاء فقط.
  • نجاح التعلم شبه الموجه: حتى عندما تم تدريبه باستخدام 10% فقط من البيانات المصنفة (و90% من التصحيح الذاتي)، فإنه لا يزال يتفوق على جميع النماذج الأخرى من نفس حجمه.

"الأثر" (مسار الورقة)

الميزة الأهم في DECOMPOSERL هي أنه لا يعطيك مجرد إجابة "صواب/خطأ". بل يعطيك أثراً (Trace).

  • تشبيه: إذا كان الذكاء الاصطناعي العادي مثل ساحر يخرج أرنباً من القبعة (ترى النتيجة ولكن لا ترى الخدعة)، فإن DECOMPOSERL هو ساحر يريك القبعة الفارغة، والأرنب، واللحظة الدقيقة التي وضع فيها الأرنب، خطوة بخطوة.
  • يبدو المخرج كأنه محادثة:
    1. السؤال: "من كتب 1984؟" -> الإجابة: "جورج أورويل".
    2. السؤال: "هل فاز جورج أورويل بجائزة نوبل؟" -> الإجابة: "لا، المستند يقول إنه لم يفز".
    3. الحكم: مُفند (REFUTED) (الادعاء خاطئ).

هذا يسمح للبشر بمراجعة العمل. إذا ارتكب الذكاء الاصطناعي خطأً، يمكنك النظر في "الأثر" ومعرفة أي سؤال أو إجابة أدت إلى الخطأ.

الملخص

DECOMPOSERL هو نظام فحص حقائق ذكي وفعال يتعلم كيفية طرح الأسئلة الصحيحة لحل اللغز. يستخدم "فلتر" للتعلم من مجموعة بيانات صغيرة وعالية الجودة، ونظام "تحقق ذاتي" للتعلم حتى عندما لا يكون لديه معلم. النتيجة هي نظام يتمتع بدقة الحواسيب العملاقة الضخمة، ولكنه ينتج شرحاً واضحاً وخطوة بخطوة لكيفية وصوله إلى استنتاجه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →