← أحدث الأبحاث
🤖 AI

CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging

تقدم الورقة البحثية CriterAlign، وهو إطار عمل يرتكز على المعايير يعمل على تعزيز التنبؤ بالتفضيلات الثنائية للأكواد من خلال استبدال التقييم المستقل بالمقارنات المباشرة على مستوى المعايير ودمج التوجيه المتوافق مع التفضيل البشري (HPAG) ليتفوق بشكل كبير على الأحكام المتجانسة الحالية.

المؤلفون الأصليون: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

نُشر 2026-05-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مدير يحاول اتخاذ قرار بشأن أي من موظفين (لنسمهما أليس وبوب) قد أدى عملاً أفضل في مشروع برمجي. لديك كود كل منهما، والنتائج التي أنتجاها، وقائمة من القواعد لاتباعها.

لفترة طويلة، كانت نماذج الذكاء الاصطوي التي تحاول القيام بهذه المهمة تعمل مثل مشرف واحد مجهد. حيث تنظر إلى عمل أليس، وتعطيه درجة من 10. ثم تنظر إلى عمل بوب، وتعطيه درجة من 10. وأخيراً تقارن بين الرقمين وتختار الفائز.

تجادل ورقة بحثية بعنوان "CriterAlign" بأن نهج "التقييم أولاً" هذا معيب في مجال البرمجة. الأمر يشبه الحكم في مسابقة طبخ عبر إعطاء كل طباخ درجة لـ "المذاق"، و"التقديم"، و"السرعة" بشكل منفصل، ثم جمعها معاً. المشكلة هي أن الذكاء الاصطناعي غالباً ما يتشتت بأشياء سطحية (مثل من كتب كلمات أكثر أو استخدم تنسيقاً أفخم) ويفقد التركيز على الفروقات الحقيقية والدقيقة التي يهتم بها البشر.

CriterAlign هو طريقة جديدة للتحكيم تغير قواعد اللعبة من "التسجيل الرقمي" إلى "المقارنة المباشرة". وإليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. "المواجهة المباشرة" (الحكم الثنائي)

بدلاً من تقييم أليس وبوب بشكل منفصل، يضعهم CriterAlign في حلبة واحدة لكل قاعدة.

  • الطريقة القديمة: "أليس تحصل على 8/10 في السرعة. بوب يحصل على 7/10 في السرعة."
  • طريقة CriterAlign: "بين أليس وبوب، من هو الأسرع فعلياً؟"
    يُجبر الذكاء الاصطنا هنا على النظر إليهما جنباً إلى جنب ليقول: "أليس تفوز في هذه النقطة المحددة"، أو "إنه تعادل"، أو "بوب يفوز". هذا يحاكي الطريقة التي يفكر بها البشر فعلياً عند مقارنة خيارين.

2. "مجهر الحكم" (التحسين القائم على التعادل)

أحياناً، ينظر الذكاء الاصطناعي إلى قاعدة (مثل "هل الكود فعال؟") ويقول: "كلاهما متعادلان، لا يمكنني تمييز الفرق".
في النظام القديم، كان الذكاء الاصطناعي يقبل هذا التعادل ويمضي قدماً. لكن CriterAlign يعامل "التعادل" كإشارة إلى أن القاعدة كانت غامضة للغاية.

  • التشبيه: تخيل عداءين أنهيا السباق في نفس الوقت تماماً. الحكم السيئ يقول: "إنه تعادل". أما الحكم الجيد فيقول: "انتظر، دعونا ننظر إلى حركة أقدامهما. هل تعثر أحدهما قليلاً؟".
    يأخذ CriterAlign هذا "التعادل" ويقوم بتفكيك القاعدة إلى أسئلة أصغر وأكثر دقة (مثلاً: "من تعامل مع الحالات الاستثنائية بشكل أفضل؟") حتى يتمكن من إيجاد فرق حقيقي.

3. "فحص العدالة" (اتساق التبديل)

نماذج الذكاء الاصطناعي معروفة بانحيازها للترتيب. إذا عرضت كود أليس أولاً، فقد يحبها الذكاء الاصطناعي أكثر لمجرد أنها ظهرت أولاً.

  • التشبيه: تخيل اختبار تذوق حيث يفضل الحكم دائماً كوب الماء الأول الذي يشربه.
    يقوم CriterAlign بإجراء "فحص للعدالة". فهو يطلب من الذكاء الاصطناعي الحكم على الزوج مرة أخرى، ولكن هذه المرة يقوم بتبديل الترتيب (بوب أولاً، ثم أليس). إذا غير الذكاء الاصطناعي رأيه لمجرد أن الترتيب تغير، فإن CriterAlign يرمي هذا الدليل المحدد في سلة المهملات. إنه يحتفظ فقط بالأحكام التي كانت مستقرة وعادلة، بغض النظر عمن جاء أولاً.

4. "همس البشر" (HPAG)

حتى مع وجود قواعد أفضل، قد يظل للذكاء الاصطناعي "شخصية" مختلفة عن البشر. قد يولي أهمية لـ "الكود النظيف" بينما يفضل البشر "التأثيرات البصرية الرائعة"، أو العكس.

  • التشبيه: تخيل حكماً آلياً لم يقابل بشراً قط. يحتاج إلى "ورقة غش" كتبها البشر تقول له: "مهلاً، عندما ترى تصميماً لموقع ويب، تذكر أن البشر يهتمون بكيفية مظهره أكثر من كيفية تنظيم الكود".
    يقوم CriterAlign بإنشاء ورقة الغش هذه (المسماة HPAG) من خلال دراسة الآلاف من الأمثلة السابقة التي أخطأ فيها الذكاء الاصطناي مقارنة بالبشر. إنه يستخرج "الفجوات" في التفكير ويحقن هذه الدروس في عقل الذكاء الاصطناعي قبل أن يبدأ في التحكيم. هذا يعلم الذكاء الاصطناعي كيف يفكر كالبشر دون الحاجة لإعادة تدريب النموذج بالكامل.

النتيجة

عندما اختبر الباحثون هذا النظام الجديد على اختبار مرجعي كبير لمهام البرمجة:

  • حصل ذكاء اصطناعي "المشرف الواحد" القديم على حوالي 60% من الإجابات الصحيحة (مطابقة لتفضيلات البشر).
  • أنظمة معايير "التقييم الرقمي" القديمة كانت في الواقع تؤدي بشكل أسوأ من "المشرف الواحد".
  • قفز CriterAlign إلى دقة بلغت 66%.

باخت de المختصر: يتوقف CriterAlign عن جعل الذكاء الاصطناعي يحاول تصحيح الأوراق بشكل فردي. بدلاً من ذلك، يجبر الذكاء الاصطناعي على التصرف كحكم بشري: يقارن بين إجابتين وجهاً لوجه، ويدقق في حالات التعادل لإيجاد الفائز الحقيقي، ويتجاهل انحياز الترتيب، ويتبع "ورقة غش بشرية" لضمان تقدير الأشياء الصحيحة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →