← أحدث الأبحاث
🤖 machine learning

Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

تقدم هذه الورقة VIGOR، وهو أسلوب تعلّم تعزيزي خالٍ من المُحقِّق (verifier-free) يستفيد من مكافآت معيار التدرج الجوهري المستمدة من نموذج السياسة نفسه لتحسين أداء النماذج اللغوية الكبيرة في الاستدلال الرياضي وتوليد الكود بشكل فعال دون الاعتماد على مُحقِّقات خارجية أو تسميات ذهبية.

المؤلفون الأصليون: Xuexiang Wen, Hang Yu, Linchao Zhu, Gaoang Wang

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xuexiang Wen, Hang Yu, Linchao Zhu, Gaoang Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم طالب ذكي جداً ولكنه يفتقر للخبرة (الذكاء الاصطناعي) كيفية حل الألغاز المعقدة، مثل المسائل الرياضية أو كتابة أكواد الكمبيوتر.

عادةً، لتعليم هذا الطالب، تحتاج إلى معلم صارم (مُحقّق) يقوم بفحص كل إجابة. إذا كانت الإجابة صحيحة، يحصل الطالب على نجمة ذهبية. وإذا كانت خاطئة، يحصل على علامة (X) حمراء. هذا يعمل بشكل رائع في الرياضيات والبرمجة لأن هناك إجابات صحيحة وخاطئة واضحة.

المشكلة:
ماذا يحدث عندما تريد من الطالب كتابة قصيدة، أو تقديم نصيحة، أو حل مشكلة لا توجد لها إجابة واحدة "صحيحة"؟ لا يمكنك استئجار معلم صارم لكل مهمة لأنك لا تملك الإجابات مسبقاً. وبدون معلم، لن يعرف الطالب ما إذا كان يؤدي عملاً جيداً، وقد يبدأ بمجرد التخمين العشوائي أو يشعر بالتعثر.

الحل: VIGOR (مكافأة "الشعور الداخلي")
تقدم الورقة البحثية طريقة جديدة تسمى VIGOR. بدلاً من انتظار معلم خارجي ليقيم العمل، تطلب VIGOR من الطالب الاستماع إلى مشاعره الداخلية حول مدى "سلاسة" إجابته.

إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:

1. "المنحدر الشديد" مقابل "الوادي المنبسط"

تخيل أن عقل الطالب هو عبارة عن تضاريس من التلال والوديان.

  • الإجابة السيئة تشبه الوقوف على جرف صخري شديد الانحدار. إذا حاول الطالب تعديل تفكيره ولو قليلاً، فسوف ينزلق بعنف. في المصطلحات الرياضية، هذا يسمى "تدرج كبير" (تغير كبير ومهتز).
  • الإجابة الجيدة تشبه الوقوف في وادي مسطح وهادئ. إذا قام الطالب بتعديل تفكيره قليلاً، فسيظل في مكانه تماماً. هذا يسمى "تدرج صغير" (تغير سلس ومستقر).

قاعدة VIGOR: يُطلب من الذكاء الاصطناعي تفضيل الإجابات التي تشبه الوادي المنبسط (التدرجات الصغيرة) بدلاً من الجرف الشديد. المنطق هو: "إذا كانت إجابتي تبدو مستقرة ولا تتطلب هزة ذهنية كبيرة لتصبح منطقية، فهي على الأرجح إجابة جيدة".

2. "فخ الطول" (لماذا احتاجت الورقة إلى إصلاح)

لاحظ الباحثون خدعة ماكرة. إذا كتب الطالب إجابة طويلة جداً، فإن "شدة" الجرف ستبدو بطبيعتها أصغر لأن المنحدر يتوزع على مسافة طويلة. يمكن للطالب محاولة "الغش" عبر كتابة مقالات ضخمة ومسهبة للحصول على درجة عالية، حتى لو كان المحتوى غير مفهوم.

الإصلاح (تصحيح T\sqrt{T}):
تضيف الورقة البحثية "مسطرة" رياضية بسيطة للنظام. تقول: "سنقوم بقياس الشدة، ولكننا سنعدل النتيجة بناءً على طول الإجابة". هذا يمنع الطالب من الغش عبر كتابة المزيد من الكلمات، ويضمن أن النتيجة تعكس جودة التفكير، وليس فقط طول النص.

3. "تصويت الفصل الدراسي" (الترتيب)

أحياناً، يختلف "الشعور" بالاستقرار بشكل كبير بين الأسئلة المختلفة. قد يبدو سؤال ما مستقراً جداً، بينما يبدو آخر مهتزاً، مما يجعل من الصعب مقارنتهما مباشرة.

الإصلاح (الترتيب):
بدلاً من إعطاء درجة خام، تطلب VIGOR من الذكاء الاصطناعي توليد عدة إجابات مختلفة لنفس السؤال، ثم ترتيبها مقابل بعضها البعض.

  • "أي من هذه الإجابات الثمانية يشعر بأنه الأكثر استقراراً؟" -> هذه الإجابة تحصل على أعلى مكافأة.
  • "أي منها يشعر بأنه الأكثر اهتزازاً؟" -> هذه الإجابة تحصل على أدنى مكافأة.
    هذا يحافظ على تدريب عادل ومستقر، بغض النظر عن مدى صعوبة السؤال المحدد.

ماذا حدث عندما جربوا ذلك؟

اختبر الباحثون هذه الطريقة على Qwen2.5، وهو نموذج ذكاء اصطناعي شهير.

  • الرياضيات والبرمجة: قاموا بتدريب الذكاء الاصطناعي على مسائل رياضية باستخدام "مكافأة الشعور الداخلي" هذه فقط (دون السماح باستخدام مفتاح الإجابة). أصبح الذكاء الاصطناعي أفضل بشكل ملحوظ في الرياضيات.
  • التدريب المتقاطع: ومن المثير للدهشة، عندما قاموا بتدريب الذكاء الاصطناعي على الرياضيات فقط باستخدام هذه الطريقة، أصبح أيضاً أفضل في البرمجة، رغم أنه لم يرَ مسألة برمجية واحدة أثناء التدريب.
  • الاستقرار: الطرق الأخرى التي تحاول تخمين "الثقة" غالباً ما تجعل الذكاء الاصطناعي يخرج عن السيطرة ويبدأ في تكرار نفسه أو كتابة كلام غير مفهوم بعد فترة. أما VIGOR فقد حافظت على سلاسة واستقرار التدريب، مثل نهر هادئ بدلاً من عاصفة هائجة.

باختصار

VIGOR هي وسيلة لتعليم الذكاء الاصطناعي دون الحاجة لمعلم. إنها تخبر الذكاء الاصطناعي: "لا تكتفِ بالتخمين؛ بل ابحث عن الإجابة التي تشعر أنها الأكثر استقراراً وسلاسة في عقلك". ومن خلال إصلاح بعض الأخطاء التقنية (مثل خدعة الطول)، جعلوا هذا "التحقق الذاتي" قوياً بما يكفي لتحويل ذكاء اصطناعي أساسي إلى مفكر أكثر ذكاءً، وكل ذلك دون الحاجة لمعرفة الإجابات الصحيحة مسبقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →