← أحدث الأبحاث
💬 NLP

OpenCompass: A Universal Evaluation Platform for Large Language Models

تقدم هذه الورقة OpenCompass، وهو منصة تقييم مفتوحة المصدر، وقابلة للتوسع، وعالية التزامن، صُممت للتغلب على قيود المعايير المرجعية الاستاتيكية التقليدية من خلال توفير إطار عمل معياري وموحد للتقييم الشامل والفعال للنماذج اللغوية الكبيرة عبر مجالات متنوعة.

المؤلفون الأصليون: Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Jun Xu
نُشر 2026-05-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Jun Xu, Haochen Ye, Zhaohui Yu, Yike Yuan, Songyang Zhang, Yufeng Zhao, Fengzhe Zhou, Peiheng Zhou, Dongsheng Zhu, Lin Zhu, Jingming Zhuo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالم الذكاء الاصطناضي كموقع بناء ضخم وصاخب. لسنوات، استخدم البناؤون أدوات صغيرة ومتخصصة لبناء شيء واحد محدد في كل مرة. ولكن مؤخرًا، بدأوا في بناء "أدمغة عملاقة" (نماذج اللغات الكبيرة أو LLMs) يمكنها فعل أي شيء تقريبًا: كتابة الشعر، حل المسائل الرياضية، كتابة الأكواد البرمجية، وتقديم المشورة الطبية.

المشكلة؟ كيف تعرف ما إذا كانت هذه الأدمغة العملاقة ذكية حقًا، أم أنها مجرد ضربة حظ؟ لا يمكنك ببساطة سؤالها: "هل أنتِ جيدة؟" لأنها قد تكذب أو ترتبك. أنت بحاجة إلى اختبار صارم.

هنا يأتي دور OpenCompass. فكر في OpenCompass ليس كمجرد اختبار واحد، بل كـ مصنع اختبارات ضخم وآلي.

المشكلة: ورشة عمل فوضوية

قبل OpenCompass، كان اختبار هذه النماذج يشبه محاولة تصحيح الامتحانات في فصل دراسي فوضوي حيث يستخدم كل معلم نظام تصحيح مختلفًا.

  • الفوضى: بعض المعلمين استخدموا أقلامًا حمراء، والبعض الآخر استخدم أقلامًا زرقاء. بعضهم كان يدقق في الإملاء بدقة، والبعض الآخر كان ينظر إلى "روح" الإجابة. بعض الاختبارات كانت ورقية، والبعض الآخر كان عبر الكمبيوتر.
  • عنق الزجاجة: إذا أردت اختبار نموذج في 100 موضوع مختلف (مثل التاريخ، البرمجة، والعلوم)، كان عليك تشغيل 100 عملية منفصلة وبطيئة يدويةً. كان الأمر بطيئًا، ومجزأً، ويصعب فيه مقارنة النتائج.

الحل: مصنع OpenCompass

بنى المؤلفون OpenCompass ليكون مركز اختبار شامل وعالمي. لقد صمموه بفلسفة "الليغو" (Lego): كل شيء فيه نمطي (Modular). يمكنك تركيب أجزاء مختلفة معًا لبناء الاختبار الدقيق الذي تحتاجه.

إليك كيف يعمل هذا المصنع، مقسمًا إلى خطوات بسيية:

1. المخطط (نظام التكوين - Configuration System)

قبل أن يبدأ المصنع، تحتاج إلى مخطط. في OpenCompass، هذا هو نظام التكوين.

  • ماذا يفعل: أنت تخبر النظام: "أريد اختبار النموذج (أ) على مجموعة بيانات الرياضيات باستخدام أسلوب معين من الأسئلة".
  • السحر: إنه مثل مترجم عالمي. سواء كنت تستخدم نموذجًا من Hugging Face، أو واجهة برمجة تطبيقات (API) سريعة، أو دماغًا مصممًا خصيصًا، فإن OpenCompass يتحدث لغتهم ويضع القواعد بحيث يلتزم الجميع بنفس المعايير.

2. خط التجميع (التقسيم والتوازي - Partitioning & Parallelism)

اختبار نموذج عملاق على آلاف الأسئلة يستغකර وقتًا طويلاً. إذا قمت بذلك سؤالًا تلو الآخر، فسيستغرق الأمر للأبد.

  • الاستراتيجية: يستخدم OpenCompass مُقسّمًا (Partitioner) لتقطيع كومة الأسئلة الضخمة إلى قطع صغيرة سهلة الهضم.
  • القوة: تخيل وجود فريق من 100 عامل (أجهزة كمبيوتر) بدلًا من عامل واحد. يقوم المُشغّل (Runner) بإرسال هذه القطع الصغيرة إلى جميع العمال الـ 100 في نفس الوقت. هذا ما يسمى التوازي العالي (High Concurrency). إنه يحول مهمة قد تستغرق أيامًا إلى مهمة تستغرق ساعات.

3. العمال (المهام - Tasks)

بمجرد تجهيز القطع، تبدأ المهام في العمل. هناك نوعان رئيسيان من العمال:

  • عامل الاستدلال (Inference Worker): هذا العامل يغذي نموذج الذكاء الاصطناعي بالأسئلة ويجمع الإجابات.
  • عامل التصحيح (Grading Worker): هذا العامل يأخذ إجابات الذكاء الاصطناعي ويقارنها بالإجابات الصحيحة (أو "المعيار الذهبي").

4. نظام التصحيح (المُقيّمون - Evaluators)

كيف يتم تصحيح الإجابات؟ يحتوي OpenCompass على ثلاث طرق ذكية، مثل مدرسة بها أنواع مختلفة من المعلمين:

  • المعلم القائم على القواعد (Rule-Based Teacher): بالنسبة لمسائل الرياضيات أو أسئلة الاختيار من متعدد، يستخدم هذا المعلم قواعد صارمة (مثل الآلة الحاسبة). إذا كانت الإجابة "42"، فهي صحيحة. وإذا كانت "43"، فهي خاطئة. سريع وغير مكلف.
  • معلم "الحكم الذكي" (AI Judge Teacher): بالنسبة للكتابة الإبداعية أو المناظرات المعقدة، لا توجد إجابة واحدة "صحيحة". لذا، يقوم OpenCompass باستئجار ذكاء اصطناعي آخر ليعمل كحكم. يقرأ هذا "الحكم الذكي" الإجابة ويعطيها درجة بناءً على مدى منطقيتها، وسلاستها، أو مدى فائدتها.
  • المعلم الهجين (Hybrid Teacher): هذا هو أفضل ما في العالمين. أولاً، يقوم المعلم القائم على القواعد بالتحقق السريع من الأشياء السهلة. إذا كانت الإجابة معقدة، يمررها إلى "الحكم الذكي". هذا يوفر المال والوقت مع الحفاظ على دقة عالية.

5. الشهادة المدرسية (التصور - Visualization)

أخيرًا، تُجمع كل الدرجات في لوحة تحكم للتصور (Visualization).

  • بدلًا من جدول بيانات فوضوي، تحصل على شهادة مدرسية واضحة وملونة. تظهر لك بالضبط أين يعتبر الذكاء الاصطناعي عبقريًا (مثل: "بارع في البرمجة!") وأين يعاني (مثل: "سيء في القصص الطويلة").

ماذا يمكنه أن يختبر؟

OpenCompass يشبه "السكين السويسري" للاختبار. فهو يدعم أكثر من 100 نوع مختلف من الاختبارات، بما في ذلك:

  • المعرفة: هل يعرف الذكاء الاصطناعي حقائق التاريخ والعلوم؟
  • الاستنتاج: هل يمكنه حل الألغاز المنطقية؟
  • الرياضيات والبرمجة: هل يمكنه حل التفاضل والتكامل أو كتابة برمجيات؟
  • اللغة: هل يمكنه التحدث بلغات مختلفة بطلاقة؟
  • النصوص الطويلة: هل يمكنه قراءة كتاب كامل وتذكر تفاصيله؟

الخلاصة

يدعي البحث أن OpenCompass يحل مشكلة "ورشة العمل الفوضوية". من خلال جعل عملية الاختبار نمطية، وسريعة، ومعيارية، فإنه يمنح الباحثين والشركات وسيلة موثوقة لمعرفة مدى جودة نماذج الذكاء الاصطناعي الخاصة بهم بدقة. هو لا يخبرك فقط إذا كان النموذج ذكيًا، بل يخبرك أين هو ذكي وأين يحتاج إلى المزيد من الدراسة.

لقد جعل المؤلفون هذا "المصنع" مفتوح المصدر، مما يعني أن أي شخص يمكنه تحميله، وبناء خط الاختبار الخاص به، والمساعدة في تحسين مستقبل الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →