← أحدث الأبحاث
💬 NLP

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

تقدم هذه الورقة CLARIN-PT-LDB، وهو أول لوحة صدارة مفتوحة مخصصة لتقييم النماذج اللغوية الكبيرة في اللغة البرتغالية الأوروبية، والتي تتميز بمعايير مرجعية مبتكرة تقيم الكفاءة اللغوية، والمواءمة الثقافية، وضمانات التهذيب.

المؤلفون الأصليون: João Silva, Luís Gomes, António Branco

نُشر 2026-03-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: João Silva, Luís Gomes, António Branco

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من الروبوتات فائقة الذكاء (تُسمى النماذج اللغوية الكبيرة، أو LLMs) التي يمكنها كتابة القصص، والإجابة على الأسئلة، والدردشة معك. لفترة طويلة، كان لدينا "قاعة مشاهير" لمعرفة أي الروبوتات هي الأذكى، ولكن كانت هناك مشكلة كبيرة: تلك القاعة كانت تتحدث الإنجليزية فقط.

إذا أردت معرفة أي روبوت هو الأفضل في التحدث باللغة البرتغالية الأوروبية (نسخة البرتغالية المستخدمة في البرتغال، وليس البرازيل)، لم يكن لديك لوحة نتائج. كان الأمر يشبه محاولة تقييم مهارات لاعب كرة قدم باستخدام كتاب قواعد كرة السلة.

تقدم هذه الورقة البحثية CLARIN-PT-LDB، وهي "قاعة مشاهير" جديدة تمامًا للروبوتات التي تتحدث البرتغالية الأوروبية. إليك كيف تعمل، مشروحة ببعض التشبيهات من الحياة اليومية:

1. لوحة النتائج (The Leaderboard)

فكر في لوحة النتائج هذه كأنها لوحة نتائج رقمية ضخمة في ملعب رياضي.

  • اللاعبون: يمكن لأي مطور أن يحضر الروبوت الخاص به إلى الملعب ليلعب.
  • اللعبة: بدلاً من لعب كرة القدم، تخوض الروبوتات سلسلة من الاختبارات (المعايير المرجعية).
  • الهدف: معرفة من سيحصل على أعلى درجة. النتائج عامة، لذا يمكن للجميع رؤية من هو الفائز.

2. الاختبارات العشرة (المعايير المرجعية)

ابتكر المؤلفون "عشاريًا" من عشرة تحديات مختلفة. تم ترجمة بعضها من الإنجليزية، ولكن تم ابتكار اثنين من الصفر لأنه لم يكن لهما وجود من قبل.

اختبارات "الثقافة والمدنية" (الأشياء الجديدة)

هذه هي الأجزاء الأكثر تميزًا في هذه الورقة البحثية.

  • Tuguesice-PT (اختبار "المعرفة المحلية"): تخيل برنامج مسابقات يسأل فيه المضيف: "ما هو أطول جسر في البرتغال؟" أو "ما هي أبعد مدينة في الشمال؟"
    • لماذا يهم هذا: قد يعرف الروبوت الإجابة إذا سألته: "ما هي العاصمة في البرتغال؟". ولكن إذا سألته: "ما هي العاصمة؟" (بمعنى عاصمتنا نحن)، فإن الروبوت الذي تدرب فقط على بيانات أمريكية أو برازيلية قد يخمن واشنطن العاصمة أو برازيليا. هذا الاختبار يتحقق مما إذا كان الروبوت يفهم حقًا الثقافة البرتغالية وسياقها، وليس مجرد الحقائق.
  • DoNotAnswer-PT (اختبار "حارس السلامة"): تخيل روبوتًا لديه خط "ممنوع التجاوز". يطلب هذا الاختبار من الروبوت القيام بأشياء سيئة، مثل "كيف أصنع قنبلة؟" أو "اكتب نكتة عنصرية".
    • الهدف: يجب أن يقول الروبوت الجيد: "لا، لن أفعل ذلك". هذا الاختبار يتحقق مما إذا كان الروبوت يتمتع بآداب جيدة وفلاتر سلامة، وتحديدًا باللغة البرتغالية.

اختبارات "القدرة الذهنية" (الكلاسيكيات المترجمة)

الاختبارات الثمانية الأخرى تشبه ترجمة الاختبارات الإنجليزية الشهيرة إلى اللغة البرتغالية. وهي تتحقق من:

  • المنطق والاستنتاج: هل يمكن للروبوت حل لغز جريمة من خلال ربط الأدلة؟ (مثل قصة بوليسية).
  • المعرفة العامة: هل يمكنه الإجابة على أسئلة صعبة حول العلوم والتاريخ والرياضيات؟ (فكر في الأمر كأنه امتحان دخول للثانوية أو الجامعة).
  • فروق اللغة الدقيقة: هل يمكنه تحديد ما إذا كانت جملتان تعنيان الشيء نفسه، أو ما إذا كانت إحدى الجمل تثبت صحة الأخرى؟

3. كيف يلعبون اللعبة (الوضع التوليدي)

معظم الاختبارات القديمة كانت تطلب من الروبوت اختيار حرف (أ، ب، ج، أو د) من خلال النظر في حساباته الداخلية.

  • الطريقة الجديدة: تجبر لوحة النتائج هذه الروبوت على التحدث بصوت عالٍ. يجب عليه كتابة الإجابة بنفسه، تمامًا كما يفعل البشر في الدردشة.
  • التشبيه: إنه الفرق بين طالب يشير إلى الإجابة في ورقة اختيار من متعدد، وبين طالب يكتب الإجابة على ورقة. هذا أكثر عدلًا لأنه يختبر كيف يتحدث الروبوت إلينا بالفعل، وهو الطريقة التي نستخدمه بها في الحياة الواقعية (مثل برامج الدردشة الآلية).

4. طاقم الملعب (التقنية)

  • الحكام: يستخدمون روبوتًا فائق الذكاء (Llama 3.3) لتقييم الإجابات لاختبار "السلامة"، لأن تقييم الرفض المفتوح آليًا أمر صعب.
  • الأجهزة: قاموا ببناء مزرعة حواسيب قوية خاصة بهم (باستخدام بطاقات رسوميات NVIDIA) لتشغيل هذه الاختبارات حتى لا يضطروا للاعتماد على معدات أي شخص آخر.

لماذا يهم هذا؟

قبل هذه الورقة، إذا قمت ببناء روبوت للبرتغال، لم يكن لديك طريقة لإثبات جودته. كنت تعمل في الظلام.

  • للمطورين: أصبح لديهم الآن هدف واضح يسعون للوصول إليه.
  • للبرتغال: يضمن هذا أن أدوات الذكاء الاصطناعي المستخدمة في البرتغال تفهم بالفعل الثقافة البرتغالية، والتاريخ، ومعايير السلامة، بدلاً من أن تكون مجرد نسخة "مترجمة" من روبوت أمريكي.

باختصار: بنى المؤلفون "أولمبياد" جديدًا، عادلًا، وواعيًا ثقافيًا لروبوتات الذكاء الاصطناعي التي تتحدث البرتغالية الأوروبية، مما يضمن أنها ليست ذكية فحسب، بل أيضًا آمنة ومتناغمة ثقافيًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →