← أحدث الأبحاث
🤖 AI

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

تقدم الورقة البحثية "Rulers"، وهو إطار عمل ثلاثي المراحل أثناء الاستنتاج يعمل على تحويل المعايير البشرية إلى مواصفات مغلقة، ويفرض استناداً هيكلياً للأدلة، ويطبق معايرة لاحقة للتغلب على أوضاع الفشل الشائعة وتحقيق تقييم أكثر موثوقية ومواءمة للبشر من قبل النماذج اللغوية الكبيرة عبر مهام تقييم النصوص المتنوعة.

المؤلفون الأصليون: Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك معلم تقوم بتصحيح مئات المقالات لطلابك. لديك نموذج تقييم مفصل (قائمة من القواعد) يقول: "المقال الحاصل على درجة عالية يجب أن يحتوي على حجة واضحة، وأدلة جيدة، وخلو من الأخطاء الإملائية".

الآن، تخيل أنك استعنت بروبوت فائق الذكاء (ذكاء اصطناعي) لمساعدتك في تصحيح هذه المقالات. تعطي الروبوت نموذج التقييم والمقالات، فيقوم هو بإخراج الدرجة.

المشكلة هي أن الروبوت "روح حرة" بعض الشيء؛ فإذا سألته نفس السؤال بطريقة مختلفة قليلاً، أو إذا غيرت ترتيب القواعد، فقد يعطيك درجة مختلفة تماماً لنفس المقال. الأمر يشبه سؤال إنسان: "ما مدى ارتفاع ذلك المبنى؟" فيجيب بـ "10 طوابق"، أو "30 متراً"، أو "مرتفع نوعاً ما"، اعتماداً على كيفية صياغتك للسؤال.

يقدم هذا البحث نظاماً جديداً يسمى RULERS لإصلاح ذلك. فكر في RULERS ليس كروبوت جديد، بل كـ مدير صارم يعلم الروبوت كيفية اتباع القواعد بدقة في كل مرة.

إليك كيف يعمل RULERS، مقسماً إلى ثلاث خطوات بسيطة:

1. "المخطط المقفل" (المرحلة الأولى)

عادةً، عندما تطلب من الذكاء الاصطناعي تصحيح شيء ما، فإنك تقوم بلصق نموذج التقييم في الدردشة في كل مرة. يقرأ الذكاء الاصطناعي النموذج وكأنه يراه لأول مرة في كل مرة، مما يؤدي إلى الارتباك.

يغير RULERS هذا الأمر. فقبل تصحيح مقال واحد، يأخذ نموذج التقييم البشري ويحوله إلى مخطط مقفل وغير قابل للتغيير.

  • التشبيه: تخيل أنك تخبز كعكة. بدلاً من قراءة كتاب الوصفات في كل مرة تخبز فيها (حيث قد تقرأ كوباً من السكر على أنه كوب من الدقيق بالخطأ)، تقوم بكتابة المقادير الدقيقة على بطاقة دائمة، ثم تضع تلك البطاقة داخل صندوق زجاجي وتغلقه. مهما كان عدد الكعكات التي تخبزها، ستستخدم نفس تلك البطاقة بالضبط.
  • ماذا يفعل: يقوم بتحويل نموذج التقييم المكتوب بلغة طبيعية فوضوية إلى قائمة مرجعية صارمة مع خانات محددة للتحقق منها (0، 1، أو 2). وبمجرد إنشاء هذا "المخطط"، فإنه لا يتغير أبداً لهذه المهمة المحددة.

2. "محقق الأدلة" (المرحلة الثانية)

في الطريقة القديمة، قد يقول الذكاء الاصطناعي: "هذا المقال جيد لأنه يبدو جيداً". وهذا أمر يصعب الوثوق به.

يجبر RULERS الذكاء الاصطناء على العمل كـ محقق. لا يمكنه مجرد إعطاء درجة؛ بل يجب عليه الإشارة إلى الجملة المحددة في المقال التي تثبت وجهة نظره.

  • التشبيه: تخيل قاضياً في قاعة المحكمة. لا يمكن للقاضي أن يقول فقط: "أعتقد أن المتهم مذنب". بل يجب أن يقول: "المتهم مذنب بسبب هذا الجزء المحدد من الأدلة الموجود في هذا الجزء المحدد من الفقرة".
  • ماذا يفعل: لكل بند في قائمة التحقق، يجب على الذكاء الاصطناٍء اقتباس الجزء الدقيق من مقال الطالب الذي يدعم قراره. فإذا قال الذكاء الاصطناعي: "المقال يحتوي على حجة واضحة"، يجب عليه تسليط الضوء على الجملة التي تظهر فيها تلك الحجة. هذا يجعل عملية التصحيح قابلة للتدقيق (يمكنك مراجعة العمل).

3. "مترجم الدرجات" (المرحلة الثالثة)

حتى مع وجود مخطط مقفل ومحقق، قد يختلف "الشعور" الداخلي للذكاء الاصطناعي بشأن الدرجة عن شعور البشر. قد يعتقد الذكاء الاصطناعي أن "4" هي درجة رائعة، بينما يرى البشر أن "4" هي درجة متوسطة.

يضيف RULERS خطوة أخيرة وهي: المعايرة (Calibration).

  • التشبيه: تخيل أن الذكاء الاصطناعي يتحدث "لغة الروبوت" والبشر يتحدثون "اللغة البشرية". يقول الذكاء الاصطناعي: "هذا المقال درجته 4.5!"، بينما يتوقع البشر الحصول على 3 أو 5. يستخدم RULERS مجموعة صغيرة من المقالات التي قام البشر بتصحيحها بالفعل لبناء مترجم. إنه يتعلم أن: "عندما يقول الذكاء الاصطناعي 4.5، فإن البشر يقصدون عادةً 4". ثم يقوم بتعديل الدرجة النهائية لتتطابق مع توقعات البشر.
  • ماذا يفعل: يأخذ درجات الذكاء الاصطناعي المهيكلة ويقوم بتحريكها رياضياً لتتماشى مع طريقة تصحيح المعلمين الحقيقيين.

لماذا يعد هذا أمراً مهماً؟

اختبرت الورقة البحثية هذا النظام على أربعة أنواع مختلفة من مهام الكتابة (مثل مقالات الطلاب، والملخصات، والكتابة الإبداعية) باستخدام نماذج ذكاء اصطناعي مختلفة.

  • النتيجة: جعل RULERS درجات الذكاء الاصطناعي تتطابق مع درجات البشر بشكل أفضل بكثير من الطرق السابقة.
  • الاستقرار: إذا قمت بتغيير صياغة نموذج التقييم قليلاً (مثل قول "كتابة جيدة" بدلاً من "كتابة عالية الجودة")، فإن RULERS استمر في إعطاء نفس الدرجات المتسقة، بينما ارتبكت الطرق الأخرى وأعطت درجات مختلفة.
  • الدليل: بما أن الذكاء الاصطناعي كان عليه تقديم "أدلة" (اقتباسات من النص)، يمكنك فعلياً رؤية سبب إعطائه لدرجة معينة. لم يعد الأمر "صندوقاً أسود" سحرياً؛ بل أصبح عملية شفافة.

باخت مختصر

تجادل الورقة البحثية بأنه للحصول على قاضٍ موثوق من الذكاء الاصطناعي، لا تحتاج فقط إلى روبوت أذكى، بل تحتاج إلى نظام يقوم بـ:

  1. قفل القواعد حتى لا تتغير.
  2. إجبار الروبوت على إظهار عمله عبر الاقتباسات.
  3. ترجمة أرقام الروبوت لتتطابق مع المعايير البشرية.

من خلال القيام بهذه الأشياء الثلاثة، يحول RULERS الذكاء الاصطناعي المتقلب إلى مصحح ثابت وجدير بالثقة يمكن للبشر الاعتماد عليه حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →