← أحدث الأبحاث
💬 NLP

CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models

تقدم الورقة البحثية CARE-RFT، وهي طريقة جديدة للضبط الدقيق بالتعزيز تستخدم تباعد كيه إل العكسي المائل (skew reverse KL divergence) لحل المقايضة بين أداء الاستدلال وموثوقية النموذج، محققةً قدرات الاستدلال العالية للضبط الدقيق بالتعزيز غير المقيد مع الحفاظ على المعايرة والموثوقية للنموذج الأساسي.

المؤلفون الأصليون: Shuozhe Li, Jincheng Cao, Bodun Hu, Aryan Mokhtari, Leqi Liu, Amy Zhang

نُشر 2026-02-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shuozhe Li, Jincheng Cao, Bodun Hu, Aryan Mokhtari, Leqi Liu, Amy Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً ذكياً ومطلعاً جداً (النموذج الذكي) كيفية حل الألغاز المعقدة. تريد منه أن يصبح بارعاً في التفكير، قادراً على التفكير خطوة بخطوة وإيجاد حلول إبداعية. ومع ذلك، تريد منه أيضاً أن يظل صادقاً وألا يختلق حقائق عندما لا يكون متأكداً.

هذه الورقة البحثية، CARE-RFT، تعالج مشكلة محددة تنشأ عندما نحاول تدريب هؤلاء الطلاب باستخدام طريقة تسمى "الضبط الدقيق بالتعزيز" (Reinforcement Finetuning - RFT).

المشكلة: "الحالم الواثق بزيادة" مقابل "البيروقراطي الحذر"

وجد المؤلفون أن طرق التدريب الحالية تجبرك على الاختيار بين خيارين سيئين:

  1. النهج غير المقيد (الحالم الواثق بزيادة):
    إذا تركت الطالب يتعلم فقط عن طريق التجربة والخطأ دون قواعد صارمة، فسيصبح بارعاً جداً في حل الألغاز الصعبة. سيبدأ في التفكير خارج الصندوق! لكنه أيضاً سيبدأ في الهلوسة. سيصبح واثقاً جداً في إجاباته لدرجة أنه سيبدأ في اختلاق حقائق مزيفة أو الكذب بشأن أشياء لا يعرفها بكل ثقة. سيفقد "معايرته" (Calibration)، مما يعني أن ثقته لن تتطابق مع دقته الفعلية.
  • تشبيه: الأمر يشبه طالباً يحفظ نموذج الإجابة لاختبار رياضيات ولكنه لا يفهم الرياضيات نفسها. إذا تغير الاختبار قليلاً، فسيبدأ في التخمين بجنون وثقة، ويصل إلى الإجابة الصحيحة بمحض الصدفة لكنه يفشل في أن يكون موثوقاً.
  1. نهج RKL المقيد (البيروقراطي الحذر):
    لإيقاف الكذب، يقوم الباحثون عادةً بإضافة "لجام سلامة" يسمى الـ KL العكسي (Reverse KL). هذا يجبر الطالب على البقاء قريباً جداً من شخصيته الأصلية التي تدرب عليها مسبقاً. هذا يبقيه صادقاً وواقعياً.
  • العيب: اللجام ضيق جداً. إنه يعاقب الطالب على محاولة تجربة أي شيء جديد أو مختلف. ولأنه يخشى الابتعاد عن المسار "الآمن"، يتوقف عن تعلم كيفية حل الألغاز الصعبة والمعقدة. يظل صادقاً، لكنه يتوقف عن كونه ذكياً.

الحل: CARE-RFT (المدرب "المثبت بالثقة")

يقترح المؤلفون طريقة جديدة تسمى CARE-RFT. فكر في هذا كمدرب ذكي يعرف تماماً متى يرخي اللجام ومتى يشده.

بدلاً من قاعدة واحدة جامدة، يستخدم CARE-RFT أداة خاصة تسمى Skew Reverse KL. إليك كيف تعمل باستخدام استعارة بسيطة:

  • مفهة "المرساة": تخيل أن الطالب هو قارب، والنموذج الأصلي المدرب جيداً هو مرساة ثقيلة.
  • الـ RKL القياسي (الطريقة القديمة): المرساة هي سلسلة ضخمة غير قابلة للكسر. إذا حاول القارب الإبحار حتى قليلاً في مياه جديدة وغير مستكشفة (استكشاف مسارات تفكير جديدة)، فإن السلسلة تسحبه بقوة للخلف. يبقى القارب آمناً لكنه لا يستكشف أبداً.
  • الـ RFT غير المقيد (الطريقة الأخرى): يتم قطع المرساة. يمكن للقارب الذهاب إلى أي مكان، لكنه قد يصطدم بالصخور (الهلوسة) أو ينحرف نحو الهاوية (سوء المعايرة).
  • CARE-RFT (الطريقة الجديدة): المرساة هي حبل ربط ذكي وقابل للتعديل.
    • عندما يكون الطالب غير متأكد: إذا انجرف القارب إلى مياه ضبابية وغير مؤكدة، فإن الحبل يشد بقوة، مما يبقي الطالب راسخاً في المعرفة الواقعية الآمنة للنموذج الأساسي. هذا يمنع الهلوسة.
    • عندما يكون الطالب واثقاً ومجزياً: إذا جرب الطالب مساراً جديداً ونجح (حصل على مكافأة عالية)، فإن الحبل يرتخي. يسمح له بالانجراف بعيداً لاستكشاف وتعلم التفكير المعقد، ولكن فقط لأنه أثبت أنه على المسار الصحيح.

ماذا يحدث عند استخدام CARE-RFT؟

أجرى المؤلفون تجارب على نماذج ذكاء اصطناعي مختلفة (مثل Qwen2.5) ووجدوا أن CARE-RFT يحقق "أفضل ما في العالمين":

  1. يحافظ على ذكاء "الحالم": أصبحت النماذج بارعة بقدر في حل مشاكل الرياضيات والتفكير الصعبة مثل النماذج غير المقيدة المعرضة للهلوسة.
  2. يحافظ على أمانة "البيروقراطي": ظلت النماذج موثوقة ودقيقة واقعياً تماماً مثل النماذج الحذرة المقيدة باللجام. توقفت عن اختلاق الحقائق وتطابقت مستويات ثقتها مع أدائها الفعلي.

سر "الإنتروبيا" (Entropy)

نظر المؤلفون أيضاً في "الإنتروبيا" (مقياس عدم اليقين) للنماذج أثناء التدريب.

  • النماذج غير المقيدة أصبحت "هشة" — انهار عدم اليقين لديها إلى الصفر بسرعة كبيرة، مما جعلها واثقة بزيادة وعرضة للأخطاء.
  • نماذج RKL ظلت "غامضة" وغير متأكدة جداً لدرجة تمنعها من تعلم المهام الصعبة.
  • وجد CARE-RFT "منطقة غولديلوكس" (المنطقة المثالية). سمح للنماذج بأن تصبح واثقة بما يكفي لحل المشكلات الصعبة، ولكن ليس واثقة لدرجة تجعلها تتوقف عن التشكيك في نفسها.

الملخص

باختاً، CARE-RFT هو تقنية تدريب جديدة تعمل كشبكة أمان ذكية. إنها تسمح لنماذج اللغات الكبيرة باستكشاف استراتيجيات تفكير جديدة ومعقدة دون فقدان تماسكها مع الواقع. وهي تثبت أنه ليس عليك الاختيار بين أن تكون مفكراً بارعاً ومدققاً موثوقاً للحقائق؛ فمع النهج الصحيح "المثبت بالثقة"، يمكنك أن تكون كلاهما.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →