← أحدث الأبحاث
💬 NLP

Nsanku: Evaluating Zero-Shot Translation Performance of LLMs for Ghanaian Languages

تقدم هذه الورقة البحثية "نسانكو" (Nsanku)، وهو معيار شامل لتقييم أداء الترجمة من نوع "التعلم الصفري" لـ 19 نموذجاً من نماذج اللغات الكبيرة عبر 43 لغة غانية، كاشفةً أنه في حين تحقق النماذج الرائدة مثل "Gemini-2.5-flash" درجات متوسطة، إلا أنه لا يوجد نموذج حالي يُظهر في آن واحد أداءً عالياً واتساقاً، مما يشير إلى أنها ليست جاهزة بعد للاستخدام الموثوق في الترجمة واسعة النطاق لهذه اللغات.

المؤلفون الأصليون: Stephen E. Moore, Mich-Seth Owusu, Akwasi Asare, Lawrence Adu Gyamfi, Paul Azunre, Joel Budu, Jonathan Asiamah, Elias Dzobo, Kelvin Newman, Edmund O. Benefo, Gerhardt Datsomor, Onesimus Addo Appiah, A
نُشر 2026-05-07
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Stephen E. Moore, Mich-Seth Owusu, Akwasi Asare, Lawrence Adu Gyamfi, Paul Azunre, Joel Budu, Jonathan Asiamah, Elias Dzobo, Kelvin Newman, Edmund O. Benefo, Gerhardt Datsomor, Onesimus Addo Appiah, Ama Branoa Banful, Lucas Woedem Kpatah, Saani Mustapha Deishini, John Ayernor

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تقرير نسانكو (Nsanku): اختبار المترجمين الآليين على لغات غانا

تخيل أن لديك مكتبة ضخمة تضم 19 "عقلاً خارقاً" مختلفاً (نماذج ذكاء اصطنا-ي). بعضها مملوك لعمالقة التكنولوجيا، والبعض الآخر مشاريع مفتوحة المصدر بناها مجتمعات برمجية. أنت تريد أن تعرف: هل يمكن لأي من هذه العقول ترجمة الإنجليزية إلى 43 لغة مختلفة تتحدث بها غانا دون أن تكون قد تعلمت هذه اللغات تحديداً من قبل؟

هذا هو بالضبط ما فعله بحث "نسانكو". اسم "نسانكو" يأتي من لغة الأكان ويعني "الآلات الموسيقية". تماماً كما تحتاج الفرقة الموسيقية إلى آلات مختلفة لصنع الموسيقى، احتاج هذا المشروع إلى نماذج ذكاء اصطنا-ي مختلفة لاختبار مدى قدرتها على التعامل مع "الموسيقى" المتنوعة للغات الغانية.

إليك قصة ما وجدوه، مشروحة ببساه.


1. الإعداد: اختبار "الصفر المعرفة" الصارم

فكر في هذه النماذج كطلاب يخوضون امتحاناً مفاجئاً.

  • القاعدة: لم يُسمح لهم بالدراسة مسبقاً. لم يكن بإمكانهم "الضبط الدقيق" (إعادة التدريب) على بيانات غانية. كان عليهم الاعتماد كلياً على ما يعرفونه بالفعل من تدريبهم العام. هذا ما يسمى باختبار "الصفر المعرفة" (zero-shot).
  • مادة الاختبار: كانت أسئلة الامتحان عبارة عن 300 جملة من الكتاب المقدس، مترجمة إلى 43 لغة غانية مختلفة. استخدم الباحثون الكتاب المقدس لأنه أحد الأماكن القليلة التي يمكنك أن تجد فيها نسخاً مكتوبة لمعظم هذه اللغات في مكان واحد.
  • نظام التصحيح: استخدموا نظامين مختلفين للتصحيح:
    • BLEU: مثل معلم صارم يتحقق مما إذا كان الطالب قد استخدم الكلمات الصحيحة تماماً.
    • chrF: مثل معلم أكثر مرونة يتحقق مما إذا كان الطالب قد ضبط الصوت العام وبنية الجملة بشكل صحيح، حتى لو كانت الكلمات نفسها مختلفة قليلاً.

2. النتائج: من نجح؟ ومن رسب؟

"الطلاب النجباء" (النماذج المملوكة)

تفوقت ثلاثة نماذج ذكاء اصطنا-ي شهيرة من شركات تقنية كبرى (Google وAnthropic وOpenAI).

  • تصدر Gemini-2.5-flash المرتبة الأولى كأفضل طالب في الفصل بأعلى درجة.
  • جاء Claude-sonnet-4-5 و GPT-4.1 خلفه مباشرة.
  • التشبيه: هؤلاء يشبهون الطلاب الذين التحقوا بأغلى المدارس الخاصة. لقد شاهدوا الكثير من البيانات ويمكنهم تخمين الإجابات بشكل أفضل من أي شخص آخر، لكنهم لا يزالون غير مثاليين.

"طلاب المجتمع" (النماذج مفتوحة الأوزان)

بقية النماذج كانت مفتوحة المصدر (مجانية للاستخدام والتعديل).

  • كان أفضل هذه المجموعة هو kimi-k2-instruct، لكنه سجل درجة أقل بكثير من "الطلاب النجباء".
  • الفجوة: هناك فجوة واضحة بين النماذج الخاصة والمكلفة وبين النماذج المجانية المتاحة للمجتمع. النماذج الخاصة حالياً أفضل بكثير في فهم هذه اللغات.

عامل "صعوبة اللغة"

لم تكن جميع اللغات متساوية في سهولة الترجمة.

  • كانت لغة Siwu هي "الأسهل" للذكاء الاصطنا-ي في الترجمة (أعلى درجة).
  • وكانت لغة Nkonya هي "الأصعب" (أدنى درجة).
  • المفاجرة: من المثير للدهشة أن اللغات الأكثر انتشاراً (مثل Twi) لم تحصل دائماً على أعلى الدرجات. أحياناً، حصلت اللغات التي يتحدث بها عدد أقل من الناس على درجات أعلى. لماذا؟ لأن ترجمة الكتاب المقدس المستخدمة لتلك اللغات كانت أكثر وضوحاً واكتمالاً من تلك المستخدمة للغات الشعبية. الأمر يشبه امتلاك خريطة أكثر وضوحاً لقرية صغيرة منها لمدينة كبيرة.

3. المشكلة الكبرى: قضية "الصديق غير الموثوق"

هذه هي النتيجة الأكثر أهمية في البحث. لم ينظر الباحثون إلى متوسط الدرجة فحسب؛ بل نظروا إلى الاتساق.

  • التشبيه: تخيل أن لديك صديقاً بارعاً في طبخ الطعام الإيطالي ولكنه سيء جداً في طبخ الطعام التايلاندي. إذا طلبت منه طبخ وجبة عشوائية، فلن تعرف أبداً ما إذا كنت ستحصل على عشاء لذيذ أم على طعام محترق.
  • النتيجة: لا يوجد نموذج ذكاء اصطنا-ي واحد كان "عالي الأداء" و"متسقاً" في آن واحد.
    • النماذج الأفضل كانت "عالية الأداء ولكن غير متسقة". قد تترجم لغة Siwu بشكل مثالي ولكنها تفشل فشلاً ذريعاً في لغة Nkonya.
    • النماذج المتسقة كانت "متسقة ولكن متوسطة المستوى". قدمت نفس النتيجة المتواضعة لكل لغة، فلم تفشل بشكل سيء أبداً ولكنها لم تنجح بشكل جيد أيضاً.
    • مربع "القادة": رسم الباحثون مخططاً بأربعة أركان. الركن العلوي الأيمن هو منطقة "القادة" (جودة عالية + اتساق عالٍ). لم ينتهِ أي نموذج أو لغة في هذه المنطقة.

4. ماذا يعني هذا (وفقاً للبحث)

يخلص البحث إلى أنه على الرغم من أن نماذج الذكاء الاصطنا-ي هذه مثيرة للإعجاب، إلا أنها ليست موثوقة بما يكفي بعد لاستخدامها في المهام الواقعية (مثل ترجمة الوثائق الحكومية، أو النصائح الطبية، أو الأخبار) للغات الغانية.

  • "حد النصوص المقدسة": تم إجراء الاختبار باستخدام آيات من الكتاب المقدس. يحذر المؤلفون من أن هذه النماذج قد تؤدي بشكل أسوأ في المحادثات اليومية، أو الأخبار، أو النصوص القانونية لأنها لم تشهد هذا النوع من الكلمات في تدريبها.
  • مشكلة "البيانات": الدرجات المنخفضة ليست لأن اللغات "صعبة" أو "محطمة"، بل لأن الذكاء الاصطنا-ي لم يرَ أمثلة كافية عليها. الأمر يشبه محاولة تعلم لغة عن طريق قراءة كتاب واحد فقط؛ قد تفهم الفكرة العامة، لكنك ستفتقد التفاصيل الدقيقة.

الملخص

بنى مشروع Nsanku لوحة نتائج ضخمة لاختبار 19 نموذج ذكاء اصطنا-ي على 43 لغة غانية.

  1. نماذج الشركات الكبرى هي الأفضل حالياً، لكن النماذج المجانية بدأت تلحق بها.
  2. التقييم القائم على الحروف (chrF) هو طريقة أفضل للحكم على هذه اللغات من التقييم كلمة بكلمة (BLEU).
  3. والأهم من ذلك: لا يوجد ذكاء اصطنا-ي موثوق بما يكفي حالياً ليُعتمد عليه في هذه اللغات. إنهم يشبهون طالباً يحصل أحياناً على درجة امتياز وأحياناً أخرى على درجة رسوب، اعتماداً على اللغة المحددة. وحتى نرى نموذجاً يتسم بالاتساق في جودته، لا يمكننا الوثوق بهم تماماً في المهام الهامة.

لقد جعل البحث كل بياناته وأكواده متاحة للجمهور حتى يتمكن الباحثون من الاستمرار في اختبار وتحسين هذه النماذج، على أمل ملء مربع "القادة" في نهاية المطاف.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →