← أحدث الأبحاث
💬 NLP

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

تقدم هذه الورقة البحثية "التفكير مع المعايير" (Think-with-Rubrics)، وهو نموذج جديد يحول المعايير من مقيمات خارجية إلى توجيه استدلالي داخلي عبر جعل النماذج اللغوية الكبيرة تولد المعايير جنباً إلى جنب مع الاستجابات أثناء التدريب، مما يؤدي إلى تحسينات مستمرة في الأداء مقارنة بالنماذج المرجعية القائمة على المكافأة.

المؤلفون الأصليون: Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

نُشر 2026-05-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية كتابة قصة، أو حل لغز، أو اتباع مجموعة معقدة من التعليمات. في الماضي، كنا نعلم هذه الروبوتات عبر تركها تخمن، ثم تقييم عملها بعد انتهائها. إذا أخطأت، كنا نخبرها: "هذه هي الدرجة، حاول مرة أخرى". هذا يشبه معلمًا يعيد ورقة اختبار وعليها علامة "F" باللون الأحمر في الأسفل، دون أي ملاحظات حول كيفية إصلاح الأخطاء المحددة.

تقترح ورقة البحث "Think-with-Rubrics" (التفكير باستخدام المعايير) طريقة أذكى للتعليم. فبدلاً من مجرد تقييم الإجابة النهائية، هي تُعلم الروبوت كيف يكتب ورقة التقييم الخاصة به قبل أن يبدأ العمل حتى.

إليك كيف تفصل الورقة ذلك، باستخدام تشبيهات بسيطة:

1. المشكلة: الناقد "ما بعد المباراة"

حالياً، تستخدم معظم عمليات تدريب الذكاء الاصطناوي المعايير كجوائز (Rubrics as Rewards). فكر في هذا كمدرب رياضي لا يظهر إلا بعد انتهاء المباراة. ينظر المدرب إلى النتيجة النهائية ويقول: "لقد أخطأت في الكرة ثلاث مرات". يتعلم اللاعب من النتيجة، لكنه لم يمتلك قائمة التحقق الخاصة بالمدرب في ذهنه أثناء اللعب؛ لم يستطع استخدام القواعد لتوجيه حركاته في الوقت الفلي.

2. الحل: المدرب "ما قبل المباراة"

تقدم الورقة مفهوم Think-with-Rubrics. هذا يغير عملية تفكير الروبوت. الآن، قبل أن يكتب الروبوت كلمة واحدة من الإجابة، يجب عليه أولاً إنشاء معيار (Rubric) (قائمة تحقق من القواعد) لنفسه.

  • التشبيه: تخيل أنك تخبز كعكة.
    • الطريقة القديمة: تخبز الكعكة، تتذوقها، ثم يقول الحكم: "إنها مالحة جداً والزينة غير مرتبة". تحاول مرة أخرى في المرة القادمة.
    • الطريقة الجديدة (Think-with-Rubrics): قبل أن تشعل الفرن، تكتب قائمة تحقق: "1. استخدم كوبين من الدقيق بالضبط. 2. لا ملح. 3. يجب أن تكون الزينة ناعمة". ثم تخبز الكعكة بينما تتحقق باستمرار من قائمتك الخاصة.

من خلال إجبار الذكاء الاصطناعي على كتابة القواعد أولاً، تصبح القواعد جزءًا من "عملية التفكير" لديه بدلاً من كونها مجرد درجة خارجية.

3. كيف يعمل التدريب (نظام "التحقق المزدوج")

تصف الورقة عملية تدريب تتكون من مرحلتين رئيسيتين، مثل طالب يستعد لامتحان كبير:

  • المرحلة 1: تعلم التنسيق (SFT Warm-up)
    يتم عرض أمثلة للروبوت حول كيفية كتابة قائمة تحقق متبوعة بإجابة. يتعلم الهيكل: <Rubric> ثم <Answer>. إنه يشبه تعليم الطالب كيفية تنسيق واجبه المنزلي بشكل صحيح حتى يتمكن المعلم من قراءته.

  • المرحلة 2: التعلم التعزيزي (مرحلة "المدرب")
    هنا يحدث السحر. يقوم الروبوت بإنشاء قائمة التحقق والإجابة الخاصة به. ثم يقوم "المُحقِّق" (حكم ذكي) بفحص شيئين:

    1. التحقق الذهبي: هل تطابقت الإجابة مع قائمة التحقق المثالية والمصنوعة بشرياً؟ (هذه هي الدرجة الخارجية).
    2. التحقق الذاتي: هل اتبعت الإجابة بالفعل قائمة التحقق الخاصة بالروبوت نفسه؟ (هذا هو الاتساق الداخلي).

الرؤية الجوهرية:
وجدت الورقة أنه إذا استخدمت فقط "التحقق الذهبي" (الدرجة البشرية)، فسيصبح الروبوت أفضل في اتباع القواعد البشرية، ولكنه قد يظل فوضوياً في تفكيره الخاص. ولكن إذا أضفت "التحقق الذاتي"، فإن الروبوت يتعلم أن يكون متسقاً مع نفسه.

4. الاكتشاف المذهل: التطور الذاتي

الاكتشاف الأكثر إثارة في الورقة هو أن الروبوت يمكنه تعليم نفسه دون الحاجة إلى قائمة تحقق من معلم بشري على الإطلاق!

  • التشبيه: تخيل طالباً بارعاً جداً في صنع أدلة الدراسة الخاصة به ثم الالتزام بها، لدرجة أنه يتفوق في النهاية على الطلاب الذين يعتمدون فقط على نموذج الإجابة الخاص بالمعلم.
  • النتيجة: تظهر الورقة أن النموذج الذي تم تدريبه فقط على اتباع قوائم التحقق التي أنشأها بنفسه (دون قوائم "ذهبية" بشرية) قد أدى بشكل جيد، وأحياناً بشكل أفضل، من النماذج التي تدربت باستخدام القوائم البشرية. هذا يشير إلى أن الذكاء الاصطناعي يمكنه "التطور ذاتياً" من خلال التحسن في وضع قواعده الخاصة ثم اتباعها.

5. لماذا تعمل هذه الطريقة بشكل أفضل؟

يوضح المؤلفون أن هذه الطريقة تعمل لأنها تعالج مشكلة محددة وهي: عدم الاتساق.
غالباً ما قد يفكر الذكاء الاصطناعي: "يجب أن أكون مختصراً"، ولكنه يكتب فقرة طويلة. هناك انفصال بين ما يفكر أنه يجب فعله وما يفعله حقاً.

  • Think-with-Rubrics تجبر الذكاء الاصطناعي على قول: "سأكون مختصراً"، ثم تثبت ذلك فوراً بكتابة إجابة قصيرة.
  • يكافئ التدريب الذكاء الاصطناعي ليس فقط لكونه على صواب، بل لكونه متسقاً مع خطته.

ملخص النتائج

اختبرت الورقة هذا الأسلوب على عدة اختبارات معيارية (مثل IFEval و IFBench) ووجدت:

  • تفوقت الطريقة الجديدة باستمرار على طرق "المعايير كجوائز" القديمة بمتوسط قدره حوالي 3.87 نقطة.
  • عملت بشكل جيد مع النماذج الكبيرة والصغيرة من الذكاء الاصطناعي.
  • جعلت عملية تفكير الذكاء الاصطناعي أقصر وأكثر كفاءة (عبر تكثيف "التفكير" في قائمة تحقق مهيكلة).

باخت de خلاصة: تعلم الورقة الذكاء الاصطناعي التوقف عن التخمين والبدء في التخطيط. من خلال جعل الذكاء الاصطناعي يكتب كتاب قواعده الخاص قبل البدء في العمل، ثم مكافأته على الالتزام بكتاب القواعد هذا، يصبح الذكاء الاصطناعي أكثر موثوقية، وأكثر اتساقاً، وقادراً على تحسين نفسه دون إشراف بشري مستمر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →