ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
تقدم هذه الورقة البحثية ArabicNumBench، وهو معيار شامل لتقييم 71 نموذجاً من النماذج اللغوية الكبيرة في مهام قراءة الأرقام العربية عبر سياقات واستراتيجيات تحفيز متنوعة، كاشفةً أنه في حين أن تقنية "سلسلة الأفكار" (Chain-of-Thought) في وضع التعلم من أمثلة قليلة تعزز الدقة بشكل كبير، فإن الأداء الرقمي العالي غالباً ما يفشل في الارتباط بالتوليد المتسق للمخرجات المهيكلة.
المؤلفون الأصليون:Anas Alhumud, Abdulaziz Alhammadi, Muhammad Badruddin Khan
تخيل أنك استأجرت فريقاً من 71 روبوتاً مختلفاً لمساعدتك في قراءة الأرقام بصوت عالٍ من وثائق عربية. بعض هذه الوثائق تستخدم الأرقام التي نراها في الإنجليزية (1, 2, 3)، بينما تستخدم وثائق أخرى الأرقام العربية التقليدية (١, ٢, ٣). هدفك هو جعل هذه الروبوتات لا تكتفي بقراءة الأرقام بشكل صحيح فحسب، بل كتابتها أيضاً في قائمة مرتبة ومنظمة يمكن لحاسوبك معالجتها بسهولة.
هذه الورقة البحثية، ArabicNumBench، هي تقرير الدرجات لهذه التجربة. إليك قصة ما وجدوه، مشروحة ببساة:
1. المشكلة الكبرى: "الإجابة صحيحة، لكن التنسيق خاطئ"
اكتشف الباحثون خللاً غريباً في العديد من أذكى الروبوتات.
السيناريو: تسأل الروبوت، "كم سعر هذا المنتج؟"
النتيجة: الروبوت يفكر، ويحسب، ويعرف أن السعر هو بالضبط 50 دولاراً. لقد أجرى العملية الحسابية بشكل صحيح!
الخلل: بدلاً من أن يقول: "السعر هو 50 دولاراً"، قد يقول: "حسناً، دعني أفكر... المنتج باهظ الثمن، ربما حوالي خمسين دولاراً، في الواقع إنه 50، لذا نعم، 50".
لماذا يهم هذا الأمر: إذا كنت تبني تطبيقاً، فأنت تحتاج من الروبوت أن يقول فقط "50" حتى يتمكن حاسوبك من حفظها. إذا أطال الروبوت في الكلام أو أخفى الرقم داخل فقرة، فسيصاب حاسوبك بالارتباك. الروبوت هنا ذكي (يعرف الرقم) ولكنه خرق (لا يستطيع اتباع تعليمات "أعطني الرقم فقط").
2. الخدعة السحرية: "أرِني، ولا تكتفِ بالإخبار"
جرب الفريق أربع طرق مختلفة للتحدث مع الروبوتات لمعرفة أيها يعمل بشكل أفضل.
"البداية الباردة" (Zero-Shot): طرح السؤال مباشرة. النتيجة: كانت الروبوتات سيئة، حيث أصابت في حوالي 29% من المرات فقط. كان الأمر كأنك تطلب من طالب حل مسألة رياضية دون أن تريه طريقة الحل.
"الخدعة السحرية" (Few-Shot Chain-of-Thought): قدم الباحثون للروبوتات ثلاثة أمثلة أولاً. أظهروا للروبوت: "هذا سؤال، وهذه هي عملية التفكير الخاصة بي، وهذا هو الجواب النهائي". ثم طرحوا السؤال الحقيقي.
النتيجة: كان هذا تغييراً جذرياً في قواعد اللعبة. فقد قفزت الدقة إلى 80%. الأمر يشبه إظهار مثال محلول لطالب قبل الاختبار؛ وفجأة، يصبح مدركاً لقواعد اللعبة.
3. الاكتشاف الصادم: "النخبة" مقابل "الخرقاء"
حتى مع "الخدعة السحرية"، انقسمت الروبوتات إلى مجموعتين مختلفتين تماماً:
مجموعة النخبة (الأولمبيون): حوالي 6 نماذج (مثل Qwen3 Max و Llama 3.1) كانت مثالية. لقد حصلت على الأرقام صحيحة و اتبعت التعليمات لتنسيق الإجابة بشكل أنيق. كانوا مثل طاهٍ محترف لا يقدم وجبة مثالية فحسب، بل يزين طبقها بجمال أيضاً.
المجموعة الخرقاء (عباقرة بـ خط يد سيء): العديد من النماذج الأخرى (مثل Gemini 2.5 Pro) كانت عباقرة في الرياضيات. لقد حصلوا على الأرقام صحيحة بنسبة 99%! لكنهم فشلوا في تنسيق الإجابة. كانوا مثل عالم عبقري يحل المعادلة على منديل ورقي مغطى بقع القهوة، مما يجعل من المستحيل على المساعد المختبري قراءتها.
4. الدرس للعالم الحقيقي
تختتم الورقة البحثية بتحذير هام جداً لأي شخص يبني برمجيات عربية:
لا تنظر إلى النتيجة النهائية فقط! إذا اخترت نموذج روبوت لمجرد أن لديه "درجة دقة" عالية (فهو يعرف الأرقام)، فقد ينتهي بك الأمر بنظام يتعطل لأن الروبوت لا يستطيع اتباع قواعد التنسيق البسيطة.
الخلاصة:
علمهم من خلال الأمثلة: دائماً أظهر للذكاء الاصطناعي بضعة أمثلة لكيفية رغبتك في الحصول على الإجابة (Few-Shot).
افحص خط اليد: عند اختيار نموذج ذكاء اصطناعي، لا تسأل فقط "هل يمكنك القيام بالرياضيات؟"، بل اسأل "هل يمكنك إعطائي الإجابة في قائمة نظيفة؟".
اختر الأداة المناسبة: عدد قليل فقط من نماذج "النخبة" يمكنها القيام بكل من الرياضيات والتنسيق بشكل مثالي. إذا كنت بحاجة إلى نظام موثوق، فعليك اختيار أحد تلك النماذج المحددة، وليس مجرد النموذج الذي يمتلك أعلى درجة في الرياضيات.
باختيط شديد: الذكاء وحده لا يكفي؛ يجب أن تكون مطيعاً أيضاً.
إليك ملخص تقني مفصل لورقة البحث بعنوان "ArabicNumBench: تقييم قراءة الأرقام باللغة العربية في النماذج اللغوية الكبيرة".
١. بيان المشكلة
بينما أظهرت النماذج اللغوية الكبيرة (LLMs) قدرات قوية في معايير الاستدلال الرياضي (مثل GSM8K وMATH)، إلا أن أداءها في قراءة الأرقام العربية لا يزال غير مقيم بشكل كافٍ ويعاني من مشكلات. وتتمثل التحديات الجوهرية المحددة فيما يلي:
الأنظمة الرقمية المزدوجة: تستخدم السياقات العربية نظامين رقميين متميزين: الأرقام العربية الشرقية (المستخدمة في العديد من الدول العربية) والأرقام العربية الغربية (0-9، المستخدمة في دول أخرى). وغالبًا ما تجد النماذج صعوبة في التمييز بينهما أو التطبيق المتسق للنظام الصحيح بناءً على السياق.
اتباع التعليمات مقابل الدقة: تقيس المعايير الحالية بشكل أساسي ما إذا كانت الإجابة صحيحة أم لا، متجاهلة كيفية توليدها. في بيئات الإنتاج، يجب على النماذج ألا تكتفي بالحساب بشكل صحيح فحسب، بل يجب أن تلتزم أيضًا بتنسيقات مخرجات صارمة (المخرجات المهيكلة) وتتبع سلاسل استدلال محددة (سلسلة الأفكولة - Chain-of-Thought).
الافتقار إلى التقييم التفصيلي: تركز معايير معالجة اللغة الطبيوية العربية السابقة على الفهم الدلالي أو المعرفة الواقعية، لكنها تفشل في تتبع طرق الاستخراج أو الاتساق في النظام الرقمي.
٢. المنهجية
قدم المؤلفون ArabicNumBench، وهو معيار شامل مصمم لتقييم 71 نموذجاً لغوياً كبيراً من 10 مزودين مختلفين.
مجموعة البيانات:
النطاق: 210 حالة اختبار فريدة، مما نتج عنه 59,010 عملية تقييم إجمالية (71 نموذجاً × 4 استراتيجيات × 210 حالة).
الفئات: تغطي المهام ست فئات دلالية:
الأرقام العربية الشرقية الصرفة.
الأرقام العربية الغربية الصرفة.
العناوين السياقية (استخراج أرقام متعددة).
التواريخ السياقية.
الكميات السياقية.
الأسعار السياقية.
النماذج: 71 نموذجاً من 10 مزودين (بما في ذلك Qwen، وMistral، وOpenAI، وMeta، وGoogle، وAnthropic، وCohere، وDeepCogito، وMicrosoft، وMoonshotAI).
استراتيجيات التلقين (Prompting): تم اختبار أربع استراتيجيات متميزة:
Zero-Shot (التلقين الصفري): سؤال مباشر.
Zero-Shot CoT (التلقين الصفري مع سلسلة الأفكولة): سؤال مباشر مع تعليمة "فكر خطوة بخطوة".
Few-Shot (التلقين بلقطات قليلة): 3 أمثلة توضيحية بدون سلاسل استدلال.
Few-Shot CoT (التلقين بلقطات قليلة مع سلسلة الأفكولة): 3 أمثلة توضيحية مع سلاسل استدلال صريحة مكيفة لتناسب القواعد العربية.
مقاييس التقييم:
الدقة الإجمالية: صحة الإجابة الرقمية.
نسبة المخرجات المهيكلة (%): نسبة الاستجابات التي تم استخراجها بنجاح عبر طرق مهيكلة (مثل المحددات الخاصة مثل #### أو علامات سلسلة الأفكولة العربية مثل "الإجابة النهائية"، أو الكلمات المفتاحية العامة) مقابل طرق التراجع (مثل استخراج آخر رقم تم العثور عليه).
الحفاظ على التنسيق: الاتساق في استخدام النظام الرقمي الصحيح (الشرقي مقابل الغربي) كما هو مطلوب من السياق.
٣. المساهمات الرئيسية
معيار ArabicNumBench: أول معيار شامل يستهدف تحديداً قراءة الأرقام العربية عبر الأنظمة الرقمية المزدوجة والسياقات المتنوعة.
مقاييس مبتكرة: تقديم تتبع طريقة الاستخراج للتمييز بين النماذج التي "تخمن" الرقم الصحيح وبين تلك التي تتبع التعليمات لإنتاج مخرجات مهيكلة وقابلة للتحليل.
تحديد فجوة القدرات: تكشف الورقة عن انفصال حرج بين الاستدلال الرقمي (الحصول على الرقم الصحيح) واتباع التعليمات (تنسيق المخرجات بشكل صحيح).
مقارنة المزودين: تحليل دقيق لـ 10 مزودين رئيسيين للذكاء الاصطناعي، يسلط الضوء على أن الدقة العالية لا تضمن الجاهزية للإنتاج.
٤. النتائج الرئيسية
تباين الأداء: تباينت الدقة بشكل كبير عبر النماذج والاستراتيجيات، حيث تراوحت بين 14.29% و99.05%.
تأثير التلقين:
كانت استراتيجية Few-Shot CoT هي الأفضل، حيث حققت متوسط دقة بلغ 80.06%، وهو أعلى بمقدار 2.8 ضعف من نهج Zero-Shot الذي سجل (28.76%).
أدت أيضاً استراتيجية Few-Shot CoT إلى زيادة توليد المخرجات المهيكلة بمقدار 4.8 ضعف مقارنة بـ Few-Shot وحدها (34.12% مقابل 7.14%).
مفارقة "الدقة مقابل الهيكلة":
من النتائج المثيرة للاهتمام أن العديد من النماذج "النخبوية" (مثل Gemini 2.5 Pro بدقة 99.05%) تنتج بشكل أساسي مخرجات غير مهيكلة (92.86% تعتمد على طريقة التراجع/Fallback).
6 نماذج فقط (8.5%) حققت باستمرار مخرجات مهيكلة بنسبة ≥90% حتى تحت تلقين Few-Shot CoT الأمثل. تشمل هذه النماذج "النخبوية": Qwen3 Max، وLlama 3.1 405B، وCommand A، وGPT-4o-mini، وClaude 3 Opus، وQwen3 235B.
رؤى المزودين:
حقق Google وQwen أعلى دقة لنموذج واحد (99.05%)، لكنهما أظهرا أداءً متوسطاً أقل بسبب ضعف النماذج الأصغر في عائلاتهما.
أظهر Cohere وMicrosoft أداءً أكثر اتساقاً عبر عائلات نماذجهما.
٥. الأهمية والآثار المترتبة
إعادة تعريف الجاهزية للإنتاج: تجادل الورقة بأن الدقة الرقمية وحدها غير كافية لنشر النماذج اللغوية الكبيرة في أنظمة معالجة اللغة العربية. يمكن للنموذج أن يكون صحيحاً رياضياً ولكنه يفشل في الإنتاج إذا لم يتمكن من إخراج البيانات بتنسيق مهيكل (مثل JSON، أو محددات معينة) مطلوب للمعالجة اللاحقة.
سقف التلقين: تشير الدراسة إلى وجود "سقف للتلقين" حيث لا يمكن لأي قدر من هندسة الأوامر (Prompt Engineering) تحويل نموذج ضعيف في اتباع التعليمات إلى نموذج قوي. اختيار النموذج هو الأكثر أهمية من هندسة الأوامر للمهام التي تتطلب مخرجات مهيكلة.
التوجيه الاستراتيجي:
يجب على الممارسين الاعتماد افتراضياً على تلقين Few-Shot CoT.
يجب أن يعطي اختيار النماذج الأولوية لـ نسبة المخرجات المهيكلة (% Structured Output) جنباً إلى جنب مع الدقة.
تمثل النماذج الستة "النخبوية" المحددة الخيارات الوحيدة المتاحة حالياً لمهام معالجة الأرقام العربية عالية الموثوقية.
في الختام، يكشف ArabicNumBench عن فجوة جوهرية في تقييم النماذج اللغوية الكبيرة الحالية: القدرة على الاستدلال رقمياً لا تعني بالضرورة القدرة على اتباع تعليمات التنسيق. يوفر هذا العمل الخطوط الأساسية والمقاييس اللازمة لسد هذه الفجوة من أجل تطبيقات معالجة اللغة العربية في العالم الحقيقي.