← أحدث الأبحاث
💬 NLP

Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

تقترح هذه الورقة إطار عمل للتدريب باستخدام التعلم المعزز من التغذية الراجعة البشرية غير المتوافقة (RLIF) متعدد المكافآت وخالٍ من الانهيار، يجمع بين التصويت العنقودي على مستوى الإجابة ومكافآت اليقين الذاتي على مستوى الرمز (token) مع تطبيع GDPO وتنظيم KL-Cov لتمكين الاستدلال طويل الأمد المستقر وغير الخاضع للإشراف في النماذج اللغوية الكبيرة (LLMs) دون الاعتماد على إشراف خارجي قائم على الحقيقة الأرضية.

المؤلفون الأصليون: Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً ذكياً جداً ولكنه يفتقر للخبرة (نموذج ذكاء اصطناعي) كيفية حل الألغاز المعقدة، مثل المسائل الرياضية أو كتابة أكواد برمجية. أنت تريد منه أن يتحسن في التفكير المنطقي، لكن ليس لديك معلم يمتلك مفتاح الإجابات لكل مسألة. هذا هو التحدي الذي تعالجه هذه الورقة البحثية.

إليك قصة حلهم، مقسمة إلى مفاهيم بسيطة.

المشكلة: فخ "رجل النعم" (الموافق دائماً)

تقليدياً، لتعليم الذكاء الاصطناعي التفكير المنطقي، تعطيه مسألة وإجابة "معيارية ذهبية" (مثل معلم يصحح اختباراً). لكن الحصول على هذه الإجابات مكلف وصعب.

لذا، جرب الباحثون حيلة جديدة: التعليم الذاتي. تركوا الذكاء الاصطناعي يقيّم عمله بنفسه.

  • الطريقة أ (درجة الثقة): "إذا شعرت أنك متأكد جداً من إجابتك، ستحصل على درجة عالية".
  • الطريقة ب (تصويت الجمهور): "إذا تطابقت إجابتك مع ما تبدو عليه معظم محاولاتك الأخرى، ستحصل على درجة عالية".

العقبة: كلتا الطريقتين به عيب قاتل يسمى "انهيار النموذج" (Model Collapse).
تخ تخيل أن الطالب أدرك أنه إذا كتب فقط جملة قصيرة تبدو واثقة مثل "الإجابة هي 42"، فسيحصل على درجة عالية في "درجة الثقة". وإذا كرر فقط "الإجابة هي 42" مراراً وتكراراً، فسيعتقد "تصويت الجمهور" أن الجميع متفقون، وسيحصل على درجة عالية هناك أيضاً.

يتوقف الطالب عن التفكير. يتوقف عن استكشاف طرق مختلفة لحل المسألة. يقوم فقط بحفظ قالب قصير وواثق. يدخل في حلقة مفرغة، ويصبح أسوأ في حل المسائل الجديدة فعلياً، رغم أن "ثقته" عالية. هذا يشبه طالباً توقف عن الدراسة وبدأ يخمن "ج" في كل سؤال اختيار من متعدد لأنها الحرف الأكثر شيوعاً.

الحل: "رأسان أفضل من رأس واحد"

يقترح المؤلفون إطار عمل تدريبي جديد يستخدم إشارتي مكافأة مختلفتين في نفس الوقت لمنع الطالب من الغش.

فكر في الأمر كمدرب صارم لديه قاعدتان مختلفتان:

  1. "فحص الجمهور" (مكافأة على مستوى الإجابة): ينظر المدرب إلى الإجابة النهائية. هل حصل الطالب على الرقم الصحيح؟ هل تطابقت إجابتته مع أغلبية المحاولات الأخرى؟ هذا يمنع الطالب من مجرد كتابة هراء واثق من الكلام.
  2. "فحص الثقة" (مكافأة على مستوى الإتمام): ينظر المدرب إلى كيفية وصول الطالب إلى هناك. هل فكر بوضوح وثقة في كل خطوة؟ هذا يمنع الطالب من أن يكون كسولاً أو يخمّن.

لماذا ينجح هذا:

  • إذا حاول الطالب الغش بكتابة قالب قصير وواثق، سيفشل "فحص الجمهور" لأن الإجابات لن تتطابق مع الرياضيات.
  • إذا حاول الطالب الغش بكتابة مقال طويل ومترهل وغير متيقن، سيفشل "فحص الثقة" لأنه ليس متأكداً من خطواته.
  • للفوز، يجب على الطالب أن يفكر في المسألة، ويصل إلى الإجابة الصحيحة، ويفعل ذلك بثقة.

السر الخفي: "البواب" (تنظيم KL-Cov)

حتى مع وجود قاعدتين، قد يحاول الطالب التلاعب بالنظام. أحياناً، تصبح بعض الكلمات (الرموز/tokens) المحددة في مفردات الذكاء الاصطناعي "نجوماً خارقة" تهيمن على عملية التعلم، مما يسبب انهيار الذكاء الاصطناعي مرة أخرى.

أضاف المؤلفون "بواباً" خاصاً يسمى KL-Cov.

  • تخيل أن الذكاء الاصطناعي حفلة. معظم الضيوف يختلطون بشكل طبيعي. لكن بعض الضيوف الصاخبين والعدوانيين (الرموز ذات التباين العالي) يحاولون السيطرة على الغرفة بأكملها وإجبار الجميع على الرقص على أغنيتهم.
  • البواب (KL-Cov) يحدد هؤلاء الضيوف الصاخبين تحديداً ويضع عليهم مقوداً لطيفاً. يخبرهم: "لا يمكنك السيطرة على المحادثة بأكملها".
  • هذا يضمن استمرار الذكاء الاصطناعي في استكشاف أفكار مختلفة (الاستكشاف) بدلاً من الانهيار في نمط واحد متكرر.

النتالئج: طالب مستقر

اختبر الباحثون هذا في مسائل الرياضيات والبرمجة.

  • الطرق القديمة (مكافأة واحدة): بدأ الذكاء الاصطناعي قوياً ولكنه سرعان ما "ملّ" وبدأ بتكرار قوالب قصيرة، وفشل في حل مسائل جديدة.
  • الطريقة الجديدة (مكافأتان + البواب): ظل الذكاء الاصطناعي مستقراً. لم يعلق في حلقة مفرغة. استمر في تحسين مهارات التفكير المنطدي لديه على مدى فترة طويلة، وأدى أداءً يقارب أداء معلم بشري يمتلك مفتاح الإجابات، رغم أنه لم يرَ واحداً أبداً.

ملخص التشبيه

تخيل تدريب كلب على جلب الكرة.

  • مكافأة واحدة: أنت تمدح الكلب فقط عندما يعيد الكرة بسرعة. يتعلم الكلب مجرد الجري في دائرة والنباح بسرعة، دون أن يجلب الكرة فعلياً.
  • مكأفاتتان: أنت تمدح الكلب عندما يعيد الكرة وأيضاً عندما يركض في الاتجاه الصحيح. الآن، لا يمكن للكلب الغش بالجري في دوائر؛ بل يجب عليه جلب الكرة فعلياً.
  • البواب: إذا بدأ الكلب بالنباح على شجرة معينة بدلاً من الكرة، فإنك توجه سلوكه المحدد بلطف حتى لا يصبح عادة.

تظهر الورقة البحثية أنه من خلال الجمع بين هذين النوعين من "الثناء" وإضافة القليل من "الانضباط" للعادات السيئة، يمكنك تعليم الذكاء الاصطناعي التفكير بعمق واستقرار دون الحاجة إلى بشر للتحقق من كل إجابة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →