← أحدث الأبحاث
🤖 machine learning

When LLM Judge Scores Look Good but Best-of-N Decisions Fail

توضح هذه الورقة أن الاعتماد على مقاييس الارتباط العالمي لتقييم حكام النماذج اللغوية الكبيرة أمر مضلل في مهام اختيار "الأفضل من بين n"، حيث إن الدرجات العالمية العالية غالباً ما تحجب ضعف أداء الترتيب داخل المطالبة الواحدة ومعدلات التعادل المفرطة، والتي يمكن تحسينها بشكل كبير باستخدام التحكيم الزوجي الصريح.

المؤلفون الأصليون: Eddie Landesberg

نُشر 2026-03-16
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Eddie Landesberg

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "عندما تبدو درجات حَكَم الذكاء الاصطناعي جيدة ولكن قرارات (أفضل من N) تفشل"، مترجمة إلى لغة بسيطة وسهلة الاستخدام مع بعض التشبيهات الإبداعية.

الفكرة الكبرى: فخ "المتوسط الجيد"

تخẫل أنك مدير توظيف. لديك مساعد ذكاء اصطناعي جديد يساعدك في فحص المتقدمين للوظائف. تطلب من الذكاء الاصطناعي تقييم 100 مرشح مختلف على مقياس من 1 إلى 100.

تقوم بالتحقق من أداء الذكاء الاصطناعي بمقارنة تقييماته بقرارات التوظيف النهائية الخاصة بك. تحسب "درجة الارتباط" (وهي مقياس لمدى اتفاق الذكاء الاصطناعي معك). النتيجة هي 0.47. في عالم البيانات، تبدو هذه النتيجة "مقبولة". إنها ليست مثالية، لكنها ليست سيئة أيضاً. تعتقد قائلًا: "رائع، هذا الذكاء الاصطناعي جيد بما يكفي لمساعدتي في اختيار أفضل مرشح!"

تقول الورقة البحثية: توقف. أنت تتعرض للخداع.

بينما يتفق معك الذكاء الاصطناعي في "المتوسط"، إلا أنه في الواقع سيء جداً في اختيار المرشح الأفضل لوظيفة محددة بعينها. إذا استخدمت هذا الذكاء الاصطناعي لاختيار الفائز من بين مجموعة مكونة من 4 متقدمين، فسينجح في حوالي 21% فقط من المرات. وفي الـ 79% المتبقية، يكون الأمر بمثابة تخمين عشوائي.

التشبيه: "اختبار الفصل الدراسي" مقابل "السباق"

لفهم سبب حدوث ذلك، دعونا نستخدم تشبيه الفصل الدراسي.

السيناريو:
لديك 5,000 اختبار رياضيات مختلف (مطالبات/Prompts). في كل اختبار، هناك 4 طلاب (مرشحون) يحاولون حل نفس المسألة.

  • الحقيقة المطلقة (Oracle): أنت تعرف بالضبط من حصل على أفضل درجة في كل اختبار من الاختبارات.
  • الحَكَم (الذكاء الاصطناعي): يعطي الذكاء الاصطناعي درجة لكل طالب في كل اختبار.

الخداع (الارتباط العالمي):
الذكاء الاصطناعي بارع جداً في ملاحظة مدى صعوبة الاختبار.

  • في الاختبار السهل، يحصل جميع الطلاب على درجات عالية (في التسعينات). يعطي الذكاء الاصطناعي جميعاً 90.
  • في الاختبار الصعب، يحصل جميع الطلاب على درجات منخفضة (في الأربعينات). يعطي الذكاء الاصطناعي جميعاً 40.

لأن الذكاء الاصطناعي يتوقع بشكل صحيح أن "الاختبارات السهلة = درجات عالية" و"الاختبارات الصعبة = درجات منخفضة"، فإن اتفاقه العام معك يبدو رائعاً. الأمر يشبه خبير الأرصاد الجوية الذي يصيب في توقعاته بنسبة 90% لأنه يكتفي بقول "إنه فصل الصيف" كل يوم. هو محق بشأن الموسم، لكنه لا يستطيع إخبارك ما إذا كانت السماء ستمطر اليوم أم لا.

الفشل (الترتيب داخل المطالبة الواحدة):
الوظيفة الحقيقية ليست معرفة ما إذا كان الاختبار صعباً أم سهلاً. الوظيفة هي النظر إلى الطلاب الأربعة في اختبار محدد والقول: "الطالب (أ) أفضل قليلاً من الطالب (ب)".

في بيانات الورقة البحثية، الذكاء الاصطناعي سيء جداً في هذا الأمر.

  • مشكلة التعادل: يستخدم الذكاء الاصطناعي حوالي 20 رقماً مختلفاً فقط (مثل 1، 2، 3... وصولاً إلى 20). عندما يكون طالبان متقاربين جداً في الجودة، غالباً ما يعطيهما الذكاء الاصطناعي نفس الدرجة تماماً (مثلاً، كلاهما يحصل على "15").
  • النتيجة: عندما يحدث تعادل، لا يستطيع الذكاء الاصطناعي اختيار الفائز. يضطر إلى رمي عملة معدنية (الاختيار العشوائي). وبما أنه يتعادل في 67% من الحالات، فإنه ينتهي به الأمر باختيار الفائز عن طريق الصدفة العشوائية معظم الوقت.

مشكلة "أفضل من N" (Best-of-N)

في العالم الحقيقي، غالباً ما نستخدم الذكاء الاصطناعي للقيام بعملية اختيار "أفضل من N". وهذا يعني:

  1. اطلب من الذكاء الاصطناعي توليد 4 إجابات مختلفة لسؤال ما.
  2. اطلب من "ذكاء اصطناعي حَكَم" تقييم هذه الإجابات.
  3. اختر الإجابة ذات الدرجة الأعلى.

وجدت الورقة البحثية أنه حتى لو كان لدى "الذكاء الاصطناعي الحَكَم" درجة ارتباط عالمية "جيدة"، فإنه يفشل في هذه المهمة المحددة لأنه لا يستطيع التمييز بين الإجابات "الجيدة" والإجابات "العظيمة" عندما تكون جميعها حول نفس السؤال. الأمر يشبه حكماً يمكنه التمييز بين سيارة فيراري ودراجة هوائية، لكنه لا يستطيع التمييز بين سيارة فيراري وأخرى فيراري أسرع منها قليلاً.

الحل: تغيير قواعد اللعبة

اختبر المؤلفون عدة طرق لإصلاح ذلك:

1. توقف عن التقييم الرقمي، وابدأ بالمقارنة (الحكم الثنائي - Pairwise Judging)
بدلاً من سؤال الذكاء الاصطناعي: "قيم هذه الإجابة من 1 إلى 100"، اسأله: "أيهما أفضل: الإجابة (أ) أم الإجابة (ب)؟"

  • النتيجة: هذا نجح بشكل أفضل بكثير! من خلال إجبار الذكاء الاصطناعي على اتخاذ قرار مباشر، توقف عن إعطاء حالات التعادل. ارتفرت قدرته على اختيار الفائز من 21% إلى 61%.
  • لماذا: من الأسهل على البشر (والذكاء الاصطناعي) قول "أ أفضل من ب" بدلاً من تخصيص رقم مثالي لـ "أ" ورقم مثالي لـ "ب".

2. تحقق من المقاييس الصحيحة
لا تنظر فقط إلى "الارتباط العالمي" (الاتفاق الإجمالي). يجب أن تنظر إلى:

  • معدل الاسترداد (Recovery Rate): ما مدى تفوق اختيار الذكاء الاصطناعي مقارنة بمجرد الاختيار العشوائي؟
  • معدل التعادل (Tie Rate): كم مرة يقول الذكاء الاصطناعي "لا أعرف، إنهما متساويان"؟ إذا كان هذا الرقم مرتفعاً، فإن الذكاء الاصطناعي غير مفيد لاختيار الفائزين.

الخلاصة للجميع

إذا كنت تبني أنظمة ذكاء اصطناعي أو تستخدمها لاتخاذ القرارات:

  • لا تثق في الرقم الرئيسي. درجة ارتباط "جيدة" لا تعني أن الذكاء الاصطناعي جيد في اختيار الخيار الأفضل.
  • احذر من حالات التعادل. إذا كان الذكاء الاصطناعي يعطي باستمرار نفس الدرجة لخيارات مختلفة، فهو لا يتخذ قراراً فعلياً؛ بل يخمن فقط.
  • اطرح الأسئلة الصحيحة. إذا كنت بحاجة لاختيار فائز، اطلب من الذكاء الاصطناğu مقارنة الخيارات مباشرة (أ مقابل ب) بدلاً من طلب تقييم كل خيار على حدة.

باخت_صار: الحَكَم الذي يجيد تقييم صعوبة الامتحان ليس بالضرورة حكماً يجيد اختيار الطالب المتفوق. لاختيار الطالب المتفوق، تحتاج إلى حَكَم يمكنه رؤة الفروق الدقيقة بين أفضل المرشحين، وليس فقط الفروق الكبيرة بين الاختبارات السهلة والصعبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →