← أحدث الأبحاث
🤖 AI

When Mean CE Fails: Median CE Can Better Track Language Model Quality

تُظهر هذه الورقة أن الوسيط للإنتروبيا المتقاطعة (median cross-entropy) غالباً ما يتفوق على المتوسط المعتاد للإنتروبيا المتقاطعة (mean cross-entropy) في تتبع جودة النماذج اللغوية عبر سيناريوهات مثل تعلم الحقائق الاصطناعية وتقطير الـ K-الأعلى (top-K distillation)، وذلك لأنه يرتبط بشكل أفضل بالأداء في المهام من خلال التركيز على كتلة التوزيع بدلاً من التأثر بالقيم المتطرفة في الذيول.

المؤلفون الأصليون: Hao Guo, Simon Dennis, Rivaan Patil, Kevin Shabahang

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hao Guo, Simon Dennis, Rivaan Patil, Kevin Shabahang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك معلم تقوم بتصحيح مقال طالب. عادةً، تقوم بحساب "متوسط" الدرجة لتقرر مدى تقدم الطالب. إذا ارتفع المتوسط، تفترض أن الطالب يتحسن.

تجادل هذه الورقة البحثية بأنه بالنسبة لنماذج لغة الذكاء الاصطناği، يمكن لـ "الدرجة المتوسطة" (التي تسمى متوسط الاعتلاج المتقاطع - Mean Cross-Entropy) أن تكون كاذبة بشكل فادح. أحياناً، يرتفع المتوسط (مما يوحي بأن الذكاء الاصطناعي يزداد سوءاً)، رغم أن الذكاء الاصطناعي في الواقع يكتب قصصاً أفضل أو يجيب على الأسئلة بدقة أكبر.

إليك تفصيل بسيط لسبب حدوث ذلك وما يقترحه المؤلفون بدلاً من ذلك، باستخدام بعض التشبيهات الإبداعية.

1. المشكلة: "المتوسط" يسهل خداعه

في عالم الذكاء الاصطناعي، نقيس جودة النموذج من خلال النظر إلى "الخسارة" (Loss) الخاصة به (وهي درجة يكون فيها الرقم الأقل هو الأفضل). الطريقة القياسية للقيام بذلك هي أخذ المتمن (Mean) لجميع الأخطاء التي يرتكبها النموذج.

التشبيه: تأثير "التفاحة الفاسدة الواحدة"
تخيل سلة تحتوي على 100 تفاحة.

  • 99 تفاحة مثالية.
  • تفاحة واحدة فاسدة ورائحتها كريهة.

إذا قمت بحساب "متوسط النضارة" للسلة، فإن تلك التفاحة الفاسدة الواحدة ستخفض الدرجة الإجمالية. ستبدو السلة سيئة، رغم أن 99% منها مثالية.

وجدت الورقة أن نماذج الذكاء الاصطناعي غالباً ما تتصرف مثل هذه السلة. أثناء التدريب، يصبح النموذج جيداً جداً في التنبؤ بالكلمات "العادية" (الـ 99 تفاحة المثالية). لكنه يبدأ في ارتكاب أخطاء غريبة وعالية الخطأ في بعض الكلمات النادرة والصعبة (التفاحة الفاسدة الواحدة).

  • المتوسط (Mean) يرى التفاحة الفاسدة ويقول: "النموذج يزداد سوءاً!"
  • الواقع هو أن النموذج في الحقيقة يصبح أفضل في أداء المهمة المطلوبة منه.

2. الحل: "الوسيط" هو قائل الحقيقة

بدلاً من المتوسط، يقترح المؤلفون استخدام الوسيط (Median).

التشبيه: "الطفل الأوسط"
إذا قمت بصف جميع التفاحات من الأفضل إلى الأسوأ، فإن الوسيط هو التفاحة الموجودة في المنتصف تماماً.

  • في سلتنا المكونة من 100 تفاحة، التفاحة رقم 50 مثالية.
  • التفاحة الفاسدة موجودة في نهاية الصف.
  • الوسيط لا يهتم بتلك التفاحة الفاسدة الواحدة؛ فهو يخبرك أن "التفاحة النموذجية" في السلة طازجة.

تظهر الورقة أنه عندما ينظرون إلى درجة الوسيط بدلاً من المتوسط، فإنها تتطابق تماماً مع مدى جودة أداء الذكاء الاصطناعي في المهام (مثل سرد قصة أو استرجاع الحقائق).

3. مثالان من الواقع من الورقة البحثية

اختبر المؤلفون هذا في سيناريوهين مختلفين:

السيناريو (أ): الطالب "المفرط في التدريب" (نموذج Qwen)

  • ماذا حدث: قاموا بتعليم ذكاء اصطناعي قائمة من الحقائق المختلقة.
  • الفخ: بينما استمروا في التدريب، أصبح الذكاء الاصطناعي أفضل في معرفة الحقائق، لكنه بدأ يصاب بالارتباك تجاه بعض تراكيب الجمل المحددة والغريبة جداً.
  • النتيجة: ارتفع متوسط (Mean) الدرجات (مما بدا سيئاً)، لكن الوسيط (Median) ظل منخفضاً (مما بدا جيداً). درجات الاختبار الفعلية (مدى جودة تذكره للحقائق) اتبعت الوسيط، وليس المتوسط. كان المتوسط مجرد رد فعل لتلك الجمل المربكة القليلة.

السيناريو (ب): تقطير "Top-K" (نموذج TinyStories)

  • ماذا حدث: حاولوا تعليم ذكاء اصطناعي صغير تقليد ذكاء اصطناٍء كبير، لكنهم أخبروا الذكاء الاصطناعي الصغير أن ينتبه فقط إلى أفضل 5 كلمات (Top 5) كان سيختارها الذكاء الاصطناعي الكبير (متجاهلين البقية).
  • الفخ: جعل هذا الذكاء الاصطناعي الصغير واثقاً جداً في الكلمات الشائعة (وسيط رائع) ولكنه سيء جداً في الكلمات النادرة (متوسط سيء).
  • النتيجة: عندما قرأ البشر (أو نماذج ذكاء اصطناعي أخرى تعمل كحكام) القصص، أحبوا القصص التي كتبها طالب "Top-5". لقد كان أفضل راوٍ للقصص. ولكن إذا نظرت إلى درجة المتوسط (Mean)، فقد بدا وكأنه أسوأ طالب. أما درجة الوسيط (Median) فقد حددت بشكل صحيح أنه الأفضل.

4. فحص "التوافق" (Concordance): متى تثق في المتوسط

يقدم المؤلفون مفهوماً يسمى التوافق (Concordance). فكر في هذا كفحص "اتفاق الفريق".

  • توافق عالٍ: المتوسط، والوسيط، و"المئوية 95" (أسوأ حالة) يتفقون جميعاً على من هو النموذج الأفضل. في هذه الحالة، يكون المتوسط مناسباً للاستخدام.
  • توافق منخفض: المتوسط يقول "النموذج (أ) هو الأفضل"، لكن الوسيط يقول "النموذج (ب) هو الأفضل". هذه علامة خطر! هذا يعني أن توزيع الأخطاء قد تغير شكله (مثل سلة التفاح).

نصيحة الورقة البحثية:
لا تكتفِ بالإبلاغ عن الدرجة المتوسطة فقط. بل أبلغ عن مجموعة صغيرة من الدرجات:

  1. المتوسط (Mean): (المعدل).
  2. الوسيط (Median): (الحالة النموذجية).
  3. المئوية 95 (95th Percentile): (أسوأ حالة في الطرف).

إذا كانت هذه الأرقام الثلاثة تحكي قصصاً مختلفة، فأنت تعلم أن "المتوسط" يخدعك. يجب عليك الوثوق بـ الوسيط لاختيار النموذج الذي سيؤدي بشكل أفضل في المهام الواقعية.

الملخص

  • متوسط الاعتلاج المتقاطع (Mean CE): يمكن خداعه ببعض الأخطاء السيئة. إنه يشبه الحكم على فصل دراسي كامل بناءً على طالب واحد رسب في اختبار صعب.
  • وسيط الاعتلاج المتقاطع (Median CE): يتجاهل القيم المتطرفة ويخبرك كيف حال "الرمز" (Token) النموذجي. إنه يتتبع الأداء الواقعي بشكل أفضل بكثير.
  • الحل: تحقق دائماً من درجة "المنتصف" جنباً إلى جنب مع درجة "المتوسط". إذا اختلفا، فإن درجة "المنتصف" هي التي يجب أن تثق بها لاختيار أفضل نموذج ذكاء اصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →