MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese
تقدم هذه الورقة Math-PT، وهي مجموعة بيانات مرجعية جديدة تضم 1,729 مسألة رياضية باللغتين البرتغالية الأوروبية والبرازيلية مستمدة من مسابقات واختبارات محلية، والتي تكشف أنه بينما تؤدي النماذج اللغوية الكبيرة المتطورة بشكل جيد في الأسئلة متعددة الخيارات، فإن قدراتها تتراجع في المهام البصرية والمهام مفتوحة النهاية.
المؤلفون الأصليون:Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins
المؤلفون الأصليون: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins
تخيل النماذج اللغوية الكبيرة (LLMs) كطلاب عباقرة قرأوا كل كتاب في مكتبة العالم تقريباً. لسنوات، اختبرنا قدراتهم الرياضية باستخدام امتحانات مكتوبة حصرياً باللغة الإنجليزية. هذا يشبه إعطاء طالب اختبار قيادة باللغة الإنجليزية فقط، ثم افتراض أنه يستطيع القيادة ببراعة بأي لغة أخرى لمجرد أنه اجتاز ذلك الاختبار الوحيد.
تجادل ورقة البحث MATH-PT بأن هذا النهج يحتوي على نقطة عمياء ضخمة. فهي تقدم "اختبار قيادة" جديداً مكتوباً خصيصاً باللغة البرتغالية (بنسختيها الأوروبية والبرازيلية) للتحقق مما إذا كان بإمكان هؤلاء الطلاب من الذكاء الاصطائي التعامل حقاً مع الرياضيات عندما تتغير اللغة.
إليك تفصيل نتائجهم باستخدام تشبيهات بسيطة:
1. المشكلة: المكتبة "المقتصرة على الإنجليزية"
معظم المعايير المرجعية للرياضيات (مثل MATH أو MathVista) تشبه مكتبة حيث كل الكتب فيها مكتوبة بالإنجليزية. وحتى عندما يحاول الباحثون اختبار لغات أخرى، فإنهم يكتفون بمجرد ترجمة الكتب الإنجليزية. يقول المؤلفون إن هذا غير عادل، لأنه لا يخبرنا ما إذا كان الذكاء الاصطناعي يفهم حقاً المفاهيم الرياضية أم أنه قد حفظ ببساطة الأنماط الإنجليزية. لقد أرادوا بناء مكتبة لمسائل رياضية ولدت في البرتغالية، مستمدة من الأولمبيادات الرياضية والامتحانات المدرسية البرتغالية والبرازيلية الحقيقية.
2. الاختبار الجديد: MATH-PT
أنشأ الفريق مجموعة بيانات تسمى MATH-PT تحتوي على 1,729 مسألة.
المصدر: لم يكتفوا بالترجمة؛ بل بحثوا في الأرشيفات الأصلية للمسابقات مثل الأولمبياد البرتغالي للرياضيات و OBMEP البرازيلية.
التنوع: يغطي الاختبار كل شيء بدءاً من ألغاز الصف الخامس وصولاً إلى التحديات التي تسبق الدراسات الجامعية.
التنسيق: يتضمن أسئلة الاختيار من متعدد (مثل ورقة الإجابة) وأسئلة مفتوحة (حيث يجب عليك كتابة الإجابة من الصفر). والأهم من ذلك، أن العديد من الأسئلة تحتوي على رسوم توضيحية وتخطيطات (مثل الأشكال الهندسية)، والتي حافظ الفريق عليها بعناية باستخدام الكود لكي يتمكن الذكاء الاصطناعي من "رؤيتها".
3. النتائج: "الذكي" مقابل "المتعثر"
قاموا باختبار 13 نموذجاً مختلفاً من الذكاء الاصطناي، من نماذج "الحدود" (Frontier) الأكثر قوة (العباقرة الخارقين) إلى النماذج الأصغر مفتوحة المصدر (الطلاب العاديين).
ميزة الاختيار من متعدد: فكر في أسئلة الاختيار من متعدد كأنها لعبة "أوجد الفروق". كانت نماذج الذكاء الاصطناي جيدة جداً في هذا. حتى النماذج الأصغر كانت غالباً ما تخمن الحرف الصحيح (A، B، C، D، أو E).
المعاناة مع الأسئلة المفتوحة: عندما تحول الاختبار إلى الأسئلة المفتوحة (حيث يجب على الذكاء الاصطناي توليد الإجابة بنفسه)، انخفضت الدرجات بشكل كبير. إنه الفرق بين التعرف على وجه في طابور وبين رسم ذلك الوجه من الذاكرة. واجه الذكاء الاصطناي صعوبة أكبر بكثير عندما كان عليه أن "يفكر" ويكتب الإجابة بنفسه بدلاً من مجرد اختيار واحدة.
مشكلة "الصورة": كان هذا هو العائق الأكبر. عندما احتوت المسألة على رسم توضيحي (صورة)، انهار أداء الذكاء الاصطناي. حتى النماذج الأكثر ذكاءً أصيبت بالارتباك عندما كان عليها تفسير شكل مرئي بجانب النص. الأمر يشبه مطالبة طالب بحل مسألة هندسية وهو يرتدي عصابة على عينيه؛ يمكنه قراءة الكلمات، لكنه لا يستطيع "رؤية" الشكل.
4. الفائزون والخاسرون
الأبطال: كانت نماذج "الحدود" (مثل GPT-5 و Qwen3-235B) هي الفائزة بوضوح. لقد تعاملت مع الرياضيات البرتغالية بشكل جيد، خاصة أسئلة الاختيار من متعدد.
المتعثرون: وجدت النماذج الأصغر مفتوحة المصدر (مثل Llama-3 و Gemma-3) أن الرياضيات أكثر صعوبة بكثير. انخفضت دقتها بشكل حاد بمجرد أن أصبحت الأسئلة أكثر صعوبة أو احتوت على صور.
تأثير التوسع: وجد العمل أنه بالنسبة لعائلة نماذج Qwen، فإن تكبير النموذج (إضافة المزيد من "قوة الدماغ") ساعد كثيراً. إنه يشبه الانتقال من دراجة هوائية إلى سيارة رياضية؛ فالنماذج الأكبر تعاملت مع مهام الاستنتاج المعقدة بشكل أفضل بكثير من النماذج الأصغر.
الخلاصة
يخلص العمل إلى أنه بينما يصبح الذكاء الاصطناي جيداً جداً في الرياضيات، فإنه لا يزال يظهر "تحيزاً لغوياً" ويعاني عندما يصبح الاختبار أصعب (مفتوح النهايات) أو بصرياً (رسومات توضيحية). ومن خلال إصدار مجموعة البيانات البرتغالية هذه، يقدم المؤلفون للباحثين مسطرة جديدة وعادلة لقياس مدى قدرة الذكاء الاصطناي على التفكير فعلياً بلغات أخرى غير الإنجليزية. هم لا يقولون إن الذكاء الاصطناي مثالي بالفعل؛ بل يقولون: "إليكم اختباراً جديداً يوضح لنا بالضبط أين لا يزال الذكاء الاصطناي يتعلم".
ملخص تقني لورقة بحثية: MATH-PT: معيار للاستدلال الرياضي للغة البرتغالية الأوروبية والبرازيلية
1. بيان المشكلة
إن المشهد الحالي لتقييم النماذج اللغوية الكبيرة (LLMs) في الاستدلال الرياضي منحاز بشدة لصالح اللغة الإنجليزية. المعايير الموجودة (مثل MATH وMathVista وMathBench) إما أنها باللغة الإنجليزية حصرياً أو تعتمد على ترجمات لمجموعات بيانات إنجليزية. يخلق هذا انحيازاً لغوياً يجعل من الصعب تحديد ما إذا كانت قدرات الاستدلال الرياضي قابلة للانتقال حقاً عبر اللغات، أم أن النماذج تكتفي باستغلال الأنماط الخاصة باللغة الإنجليزية. علاوة على ذلك، تركز معايير معالجة اللغات الطبيعية (NLP) الحالية للغة البرتغالية على المهام العامة، أو السمية، أو المنطق العام، مما يؤدي إلى فجوة كاملة في تقييم الاستدلال الرياضي لكل من المتغيرات الأوروبية (pt-PT) والبرازيلية (pt-BR) للغة البرتغالية.
2. المنهجية
إنشاء مجموعة البيانات (MATH-PT)
قام المؤلفون بتنسيق مجموعة بيانات جديدة تضم 1,729 مسألة رياضية تم استخراجها بالكامل من مسابقات واختبارات أصلية باللغة البرتغالية لتجنب آثار الترجمة.
المصادر:
البرتغالية الأوروبية (pt-PT): مستمدة من الأولمبياد البرتغالي للرياضيات (OPM). تتضمن مجموعة البيانات ملفات المصدر LaTeX مباشرة من منظمي المسابقة، وتغطي الأعوام الأكاديمية 1997–2025.
البرتغالية البرازيلية (pt-BR): مستمدة من مسابقات وطنية كبرى، بما في ذلك OBMEP (المدارس العامة)، OMIF (المؤسسات الفيدرالية)، ELLM، وITA (معهد الفضاء الجوي). ونظراً لعدم توفر مصادر LaTeX لهذه المسابقات، طور المؤلفون خط معالجة استخراج تلقائي باستخدام gpt-5-mini لتحليل ملفات PDF، وتقسيم الأسئلة، واستعادة تمثيلات JSON المهيكلة مع تدوين LaTeX الرياضي.
الهيكل:
المستويات: تغطي الصفوف من الخامس حتى مرحلة ما قبل الجامعة (المستويات 1–5). � * أنواع الأسئلة: تشمل الأسئلة متعددة الخيارات (MC) والأسئلة المفتوحة (OE). * العناصر المرئية: يحتوي جزء كبير (316 سؤالاً) على صور (رسوم هندسية، مخططات). بالنسبة لـ pt-PT، تم الحفاظ على كود LaTeX الأصلي (باستخدام picture وPStricks وarray). أما بالنسبة لـ pt-BR، فقد تم التخلص من الصور المعقدة إذا تعذر تمثيلها بشكل موثوق في شكل نص/LaTeX، بينما تم الاحتفاظ بالجداول البسيطة.
الإحصائيات: تحتوي مجموعة البيانات على 1,057 سؤالاً متعدد الخيارات و672 سؤالاً مفتوحاً.
بروتوكول التقييم
النماذج المختبرة: 13 نموذجاً رائداً ومفتوح المصدر، بما في ذلك النماذج المغلقة (GPT-5، Gemini 2.5 Flash، Claude Haiku 4.5) والنماذج ذات الأوزان المفتوحة (سلسلة Qwen3، Gemma3، LLaMa3، DeepSeek).
استراتيجية التلقين (Prompting):
إعداد الصفر-خطوة (Zero-Shot): لم يتم تقديم أي سلاسل تفكير (Chain-of-Thought) أو أمثلة قليلة الخطوات (few-shot).
خصوصية اللغة: تم تخصيص التلقينات لتناسب اللهجة المعنية (pt-PT مقابل pt-BR).
قيود المخرجات: تم توجيه النماذج لإخراج الإجابة النهائية داخل الأمر \boxed{}. بالنسبة للأسئلة متعددة الخيارات، كان المطلوب فقط حرف الخيار (A–E)؛ وبالنسبة للأسئلة المفتوحة، كانت النتيجة الرقمية/الجبرية مطلوبة.
التقييم:
متعدد الخيارات (MC): مطابقة دقيقة للحرف المستخرج مع الحقيقة الأرضية (Ground Truth).
المفتوح (OE): تم استخدام حكم يعتمد على نموذج لغوي (Kimi K2 Thinking) لمقارنة الإجابة النهائية للنموذج مع الحل الذهبي، للتحقق من التكافؤ الرياضي بدلاً من المطابقة النصية الدقيقة.
3. المساهمات الرئيسية
أول معيار أصلي للغة البرتغالية: تقديم MATH-PT، وهو أول مجموعة بيانات للاستدلال الرياضي تم تنسيقها أصلياً لكل من البرتغالية الأوروبية والبرازيلية، وتغطي طيفاً واسعاً من مستويات الصعوبة.
تقييم شامل: تقييم 13 نموذجاً من أحدث التقنيات (SOTA)، مما يوفر أول تحليل مقارن لكيفية أداء النماذج الرائدة والمفتوحة الأوزان في مهام الرياضيات باللغة البرتغالية.
رؤى تجريبية: تحديد أنماط الفشل المحددة، لا سيما الفجوة في الأداء بين الأسئلة متعددة الخيارات والأسئلة المفتوحة، والتدهور الكبير في الأداء عند وجود عناصر مرئية (صور).
4. النتائج الرئيسية
الأداء العام
النماذج الرائدة مقابل النماذج المفتوحة: أدت النماذج الرائدة (GPT-5، Gemini 2.5 Flash، Claude Haiku 4.5، Qwen3-235B) أداءً أفضل بكثير من النماذج متوسطة الحجم ومفتوحة الأوزان. حقق GPT-5 أعلى دقة في جميع الإعدادات تقريباً.
توسع النماذج مفتوحة المصدر: أظهرت عائلة Qwen3 خصائص توسع قوية، حيث طابق نموذج 235B-parameter النماذج المملوكة المغلقة. في المقابل، أظهرت نماذج Llama-3.3-70B وGemma-3-27B قدرات محدودة في الاستدلال الرياضي.
نوع السؤال والصعوبة
فجوة MC مقابل OE: أدت جميع النماذج أداءً أفضل بكثير في الأسئلة متعددة الخيارات مقارنة بالأسئلة المفتوحة. اتسعت هذه الفجوة عند مستويات الصعوبة الأعلى (غالباً بمقدار 10-20 نقطة مئوية).
ملاحظة: أظهرت النماذج الرائدة (مثل GPT-5) فجوة أصغر بين MC وOE، مما يشير إلى استدلال أكثر استقراراً، بينما عانت النماذج متوسطة الحجم من انخفاض حاد في أداء الأسفلة المفتوحة (OE).
مستويات الصعوبة: انخفضت الدقة عموماً مع زيادة المستوى الدراسي. وبينما ظل GPT-5 وQwen3-235B قويين عند المستوى 5 (ما قبل الجامعة)، أظهرت النماذج الأخرى تراجعاً حاداً.
تأثير العناصر المرئية (الصور)
انخفاض الأداء: أدى وجود الصور (المخططات الهندسية، الجداول) إلى "قفزة في الصعوبة".
انخفض الأداء في الأسئلة التي تحتوي على صور بمقدار 10-20 نقطة حتى بالنسبة للنماذج الرائدة.
عانت النماذج الأساسية الأضعف من انخفاضات تصل إلى 56 نقطة.
يشير هذا إلى أن الاستدلال متعدد الوسائط (تفسير البيانات المرئية الممثلة عبر كود LaTeX) لا يزال يمثل عقبة حرجة حتى بالنسبة للنماذج النصية القادرة على تحليل الكود.
الاختلافات اللهجوية
أظهرت مجموعة البيانات اختلافات في الأداء بين pt-PT وpt-BR، ولكن المحرك الرئيسي للتباين كان نوع السؤال (MC مقابل OE) والمحتوى المرئي، وليس اللهجة نفسها.
5. الأهمية
معالجة الانحياز اللغوي: يتحدى MATH-PT الافتراض بأن إتقان اللغة الإنجليزية يعني استدلالاً رياضياً عالمياً. فهو يوفر أداة ضرورية لتقييم ما إذا كانت النماذج تفهم الرياضيات حقاً أم أنها تكتفي بالتعرف على أنماط بناء الجملة الإنجليزية.
توافر الموارد: من خلال إصدار مجموعة البيانات ومخرجات النماذج، يتيح المؤلفون بحثاً قابلاً للتكرار وتطوير نماذج أفضل متخصصة في الرياضيات باللغة البرتغالية.
الاتجاهات المستقبلية: تؤكد النتائج أنه بينما النماذج الرائدة قوية، فإن هناك حاجة ماسة للتحسين في الاستدلال المفتوح ودمج المحتوى المرئي والرياضي. يعمل هذا المعيار كمحفز لتطوير نماذج قادرة على التعامل مع المسائل الرياضية المعقدة بلغات أصلية مع مكونات مرئية.