LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency
تؤسس هذه الورقة إطار استدلال شبه معلمي لإكمال الموتر منخفض الرتبة في تقييم النماذج اللغوية الكبيرة، حيث تشتق حدود الكفاءة وتقدم طريقة تبييض الدرجة (score-whitening) لتمكين التقدير ذي التوزيع الطبيعي التقاربي والكمي لعدم اليقين لقدرات النموذج من المقارنات الزوجية الضئيلة والمشوبة بالضجيج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي المتطور بسرعة، برز نوع جديد من التحديات الإحصائية. فمع زيادة قدرات النماذج اللغوية الكبيرة، لم يعد السؤال يقتصر فقط على كيفية بنائها، بل حول معرفة مدى جودتها بدقة. وللإجابة على ذلك، لجأت المنصات إلى طريقة تحاكي كيفية تعلم البشر: وهي طلب مقارنة ردين جنباً إلى جنب من قبل البشر والتصويت للأفضل بينهما. تولد هذه العملية تدفقاً هائلاً من البيانات، لكنها بيانات فوضوية؛ فبعض النماذج تُقارن آلاف المرات، بينما نادراً ما يُرى بعضها الآخر. وبعض الأسئلة تُطرح باستمرار، بينما يتم تجاهل أخرى. والنتيجة هي لوحة صدارة تبدو كترتيب واضح، لكنها في الواقع مبنية على أساس من المعلومات غير المتساوية، والمشوشة، وغير المكتملة. وبدون وسيلة لقياس عدم اليقين في هذه التصنيفات، يصعب معرفة ما إذا كان النموذج قد تحسن حقاً أم أن النتيجة مجرد ضربة حظ من البيانات.
لقد عالج الباحثون في معهد ماساتشوستس للتكنولوجيا (MIT) وجامعة بوردو هذه المشكلة عبر التعامل مع تقييم نماذج الذكاء الاصطناعي هذه كأحجية من القطع المفقودة. فقد أدركوا أن قدرة النموذج ليست رقماً واحداً، بل هي ملف تعريف معقد يتغير اعتماداً على المهمة، أو اللغة، أو المستخدم. ولجعل هذا الأمر منطقياً، تخيلوا أداء كل نموذج عبر كل سيناريو محتمل كشبكة واسعة متعددة الأبعاد من الدرجات الخفية. معظم هذه الدرجات لا تُلاحظ مباشرة لأننا لا نستطيع أن نطلب من البشر مقارنة كل نموذج مع كل نموذج آخر في كل موقف. بدلاً من ذلك، نحن نرى فقط نتيجة مواجهات محددة وعشوائية. وقد طور الباحثون إطاراً رياضياً جديداً لملء هذه الدرجات المفقودة، ليس بمجرد التخمين، بل عبر حساب القيم الأكثر احتمالاً مع قياس مدى ثقتنا في تلك التخمينات بصرامة.
يتناول جوهر عملهم صعوبة محددة أغفلتها الأساليب السابقة: وهي الطبيعة غير المتساوية للبيانات. في عالم مثالي، ستكون كل مقارنة متساوية في الفائدة المعلوماتية، ولكن في الواقع، فإن المواجهة بين نموذجين متشابهين جداً توفر الكثير من المعلومات المفيدة، بينما المواجهة بين نموذج رفيع المستوى وآخر ضعيف لا تخبرنا إلا بالقليل. علاوة على على ذلك، غالباً ما يكون جمع البيانات منحازاً نحو النماذج الشهيرة أو المواضيع الرائجة. وقد وجد الباحثون أن الأدوات الإحصائية القياسية تفشل في هذه البيئة لأنها تفترض أن البيانات موحدة. واكتشفوا أن الآلية الرياضية المستخدمة لتقدير هذه الدرجات تصبح غير مستقرة عندما تكون المعلومات غير متوازنة، مما يؤدي إلى تصنيفات غير موثوقة وفترات ثقة مضللة.
ولحل ذلك، قدم الفريق تقنية يسمونها "تبييض الدرجات" (score whitening). فكر في الأمر كضبط مستوى الصوت في جهاز راديو بحيث تساهم كل المحطات، سواء كانت تبث بوضوح أو مع تشويش، بشكل متساوٍ في الصوت النهائي. ومن خلال إعادة قياس كل مقارنة رياضياً بناءً على مقدار المعلومات التي تحملها بالفعل، قاموا بتحويل البيانات الفوضوية وغير المتساوية إلى تدفق متوازن. سمح لهم ذلك ببناء نوع جديد من المقدرات التي يمكنها التعامل مع فوضى العالم الحقيقي لتقييم الذكاء الاصطناعي. وقد أثبتوا أن هذه الطريقة تسمح بإنشاء فترات ثقة دقيقة وفعالة في آن واحد، مما يعني أنها ممكنة قدر الإمكان دون التضحية بالموثوقية.
تظهر نتائجهم أنه من خلال مراعاة الهيكل منخفض الرتبة للبيانات — أي أن أداء النموذج مدفوع بعدد قليل من العوامل الأساسية مثل القدرة على الاستنتاج أو مهارة البرمجة بدلاً من الضوضاء العشوائية — فمن الممكن استعارة القوة عبر المهام والنماذج المختلفة. وهذا الاستعارة للمعلومات أمر بالغ الأهمية عندما تكون البيانات شحيحة. وقد أظهر الباحثون أن نهجهم لا يعمل فقط للأسئلة البسيطة، مثل "كم هو أفضل النموذج (أ) من النموذج (ب)؟"، بل يعمل أيضاً للأسئلة المعقدة وغير الخطية، مثل "ما هو احتمال فوز النموذج (أ) في فئة معينة؟".
وفي تجارب باستخدام كل من البيانات الاصطناعية والبيانات الواقعية من منصة "Arena" الشهيرة، أثبتت الطريقة الجديدة جدواها. فعند مقارنتها بالأساليب الحالية التي تعامل كل مهمة على حدة أو تتجاهل عدم تساوي العينات، أنتج المقدر الجديد تصنيفات بهوامش خطأ أقل بكثير. لقد نجح في معايرة مستويات الثقة الخاصة به، مما يعني أنه عندما ادعى وجود فرصة بنسبة 95% ليكون صحيحاً، فقد كان صحيحاً بنسبة 95% من الوقت. وتؤكد الدراسة أنه بينما تُعد البيانات المستمدة من التفضيلات البشرية مشوشة ومنحازة بطبيعتها، فمن الممكن استخراج صورة واضحة ورصينة إحصائياً لأداء النماذج. وهذا يوفر وسيلة منهجية للمطورين والمستخدمين لفهم ليس فقط من هو الفائز، بل مدى تأكدنا من ذلك الفوز، مما يحول مجموعة ضوضاء من الأصوات إلى مقياس موثوق للقدرات في مجال الذكاء الاصطناعي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.