Evaluating Scoring Bias in LLM-as-a-Judge
تتناول هذه الورقة البحثية مسألة تحيز التقييم في أنظمة "النموذج اللغوي الكبير كحكم" (LLM-as-a-Judge) التي لم تنل حظها الكافي من الدراسة، وذلك عبر تعريف وقياس ثلاثة أنواع مستحدثة من التحيز —وهي تحيز ترتيب المعايير، وتحيز معرف الدرجة، وتحيز درجة الإجابة المرجعية— واقتراح إطار عمل شامل للتخفيف منها من خلال تحسين تصميم الأوامر البرمجية والتقييم الآلي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت معلماً آلياً ذكياً جداً، وهو عبارة عن روبوت مؤتمت لتصحيح المقالات. من المفترض أن يكون هذا الروبوت عادلاً، وموضوعياً، ومتسقاً. تعطيه مقال طالب ومعياراً (قائمة مرجعية لما يجعل المقال جيداً)، وهو يعطي المقال درجة من 1 إلى 5.
هذه الورقة البحثية تدور حول اكتشاف أن حتى معلمي الروبوتات الأكثر ذكاءً يمكن خداعهم بسهولة تامة. فهم لا ينظرون فقط إلى المقال؛ بل يرتبكون بسبب كيفية كتابة التعليمات، حتى لو كانت التعليمات تقول الشيء نفسه تماماً.
إليك تفصيل نتائج الورقة باستخدام تشبيهات بسيطة:
المشكلة الجوهرية: تأثير "المجيب السحري" (Magic 8-Ball)
وجد الباحثون أنه إذا قمت بتغيير تنسيق تعليمات التصحيح قليلاً -دون تغيير المعنى الفعلي- فإن درجة الروبوت لنفس المقال يمكن أن تتغير بشكل جذري. الأمر يشبه أن تسأل صديقاً: "ما رأيك في هذا الفيلم؟" فيجيبك بـ "5 من 5" إذا سألته بأدب، ولكن يجيبك بـ "2 من 5" إذا سألته وأنت تقف على رأسك. الفيلم لم يتغير، لكن الإجابة تغيرت.
تركز الورقة على تحيز التقييم (Scoring Bias)، وهو عندما يعطي الروبوت درجة مطلقة مختلفة (مثل 3 أو 4) لمجرد أن صياغة الأمر (البرومبت) قد عُدلت، وليس لأن الإجابة تغيرت.
الطرق الثلاث التي يرتبك فيها الروبوت
حدد الباحثون ثلاث "خدع" محددة تربك الروبوت أثناء التصحيح:
- تحيز ترتيب القائمة (ترتيب معايير التقييم):
تخيل قائمة طعام في مطعم. عادةً ما تُدرج المقبلات أولاً، ثم الأطباق الرئيسية. إذا قلبت القائمة بحيث تُدرج الأطباء الرئيسية أولاً، فهل يتغير طعم الطعام؟ لا. لكن معلم الروبوت يعتقد ذلك.
- النتيجة: إذا كانت قواعد التصحيح مدرجة من "1 إلى 5" (من المنخفض إلى العالي)، فإن الروبوت يصحح بشكل مختلف عما لو كانت مدرجة من "5 إلى 1" (من العالي إلى المنخفض) أو بترتيب عشوائي. الروبوت يرتبك بسبب التسلسل.
- تحيز بطاقة الاسم (معرّف الدرجة):
عادةً ما نستخدم أرقاماً مثل 1، 2، 3، 4، 5. ولكن ماذا لو استخدمنا الحروف (أ، ب، ج، د، هـ) أو الأرقام الرومانية (I, II, III, IV, V)؟
- النتيجة: يتفاعل عقل الروبوت بشكل مختلف مع هذه "الأسماء" المختلفة للدرجات. أحياناً يجعل استخدام الأرقام الرومانية الروبوت مصححاً أفضل، وأحياناً يجعله أسوأ. يبدو الأمر كما لو أن الروبوت لديه أبجدية مفضلة.
- تحيز "المثال المثالي" (درجة الإجابة المرجعية):
أحياناً، يقدم المعلمون "مثالاً مثالياً" للمقال ليظهروا للطلاب ما الذي يبدو عليه المستوى "5". اختبر الباحثون ما يحدث إذا أرفقنا درجة مع هذا المثال.
- النتيجة: إذا عرضت على الروبوت مثالاً مثالياً ووصفتَه بأنه "درجة 5"، يصبح الروبوت دقيقاً ومتسقاً للغاية. ومع ذلك، إذا وصفت نفس المثال المثالي بأنه "درجة 3"، فسيصاب الروبوت بالارتباك ويبدأ في إعطاء درجات منخفضة لكل شيء آخر، مفكراً: "أوه، إذا كان المثال المثالي هو 3 فقط، فلا بد أن مقال هذا الطالب سيء للغاية".
التجارب: اختبار الروبوتات
اختبر الباحثون هذا على عدة "معلمين روبوتات" (نماذج ذكاء اصطناعي)، تتراوح من الأكثر قوة (مثل GPT-4o) إلى الأصغر والأرخص.
- الروبوتات الكبيرة مقابل الروبوتات الصغيرة: كانت الروبوتات الأكثر قوة أقل عرضة للارتباك. كانت بمثابة معلم خبير يعرف المادة جيداً لدرجة أن قلب ترتيب القائمة لا يربكه. أما الروبوتات الأصغر فكانت مثل المعلمين الطلاب المتوترين؛ حيث جعلت تغييراً بسيطاً في التعليمات درجاتهم تقفز بجنون.
- المفاجأة: في بعض الأحيان، ساعدت هذه "الخدع" الروبوتات! بالنسبة لبعض الروبوتات، جعل استخدام الأرقام الرومانية أو قلب ترتيب القواعد يجعلها تصحح بدقة أكبر من الطريقة القياسية. اتضح أن "الطريقة القياسية" التي نكتب بها التعليمات عادةً ليست دائماً هي الأفضل للروبات.
الحلول: كيف يمكن الإصلاح
بناءً على تجاربهم، يقترح المؤلفون ثلاث طرق لجعل هؤلاء الحكام الآليين أكثر موثوقية:
- استخدم الروبوتات الكبيرة: إذا كنت بحاجة إلى درجة حاسمة (مثل وظيفة أو مدرسة)، فاستخدم أقوى نموذج ذكاء اصطناعي متاح. فهي بطبيعتها أكثر استقراراً وأقل عرضة للتأثر بخدع التنسيق.
- اكسر القواعد (عمداً): لا تكتفِ بنسخ القائمة القياسية "1 إلى 5". جرب إدراج القواعد من "5 نزولاً إلى 1"، أو استخدم الحروف بدلاً من الأرقام. تقترح الورقة أن القيام بشيء "غير تقليدي" قليلاً ولكن واضح يمكن أن يوقف الروبوت فعلياً عن الوقوع في فخاخ التحيز المعتادة لديه.
- اعرض المثال المثالي (مع درجة 5): إذا كنت ستعرض للروبوت إجابة "المعيار الذهبي" لمساعدته في التصحيح، فتأكد من تسميتها "درجة 5" (الدرجة الأعلى). هذا يثبت تفكير الروبوت ويجعله أكثر دقة بكثير.
الخلاصة
تخلص الورقة إلى أن "استخدام النموذج اللغوي الكبير كحكم" (استخدام الذكاء الاصطناعي لتصحيح الذكاء الاصطناعي) ليس موضوعياً كما كنا نظن. الروبوتات حساسة لـ طريقة عرض القواعد، وليس فقط للقواعد نفسها. للحصول على درجات عادلة، نحتاج أن نكون حذرين جداً بشأن كيفية كتابة تعليماتنا، وربما باستخدام أقوى النماذج وتصميم تعليماتنا بطرق تختلف قليلاً عما اعتدنا عليه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.