← أحدث الأبحاث
💬 NLP

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

تقدم هذه الورقة U-MATH، وهو معيار مرجعي جديد يضم 1,100 مسألة مفتوحة على المستوى الجامعي تغطي ستة موضوعات أساسية مع محتوى متعدد الوسائط بنسبة 20%، إلى جانب مجموعة بيانات μ\mu-MATH لتقييم الحكم على الحلول، وذلك للكشف عن أوجه القصور الكبيرة في قدرات الاستدلال متعدد الوسائط للنماذج اللغوية الكبيرة الحالية وقدرتها على تقييم الحلول الرياضية بدقة.

المؤلفون الأصليون: Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

نُشر 2026-02-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك معلم يحاول تصحيح كومة من الواجبات المنزلية لمادة الرياضيات في مرحلة جامعية. لفترة طويلة، كانت "الاختبارات" التي استخدمتها لتقييم طلابك (نماذج الذكاء الاصطناي) تشبه اختبارات المرحلة الابتدائية: أسئلة بسيطة من نوع الاختيار من متعدد يمكن لأذكى الطلاب الإجابة عليها بسهولة. ولكن الآن، أصبح الطلاب (الذكاء الاصطناعي) بارعين جداً في تلك الاختبارات البسيطة، لدرجة أن الاختبارات لم تعد تخبرك من هو العبقري حقاً ومن هو مجرد شخص يخمن الإجابة.

الورقة البحثية التي شاركتها تقدم U-MATH و µ-MATH، وهما بمثابة امتحان نهائي جديد وأكثر صعوبة مصمم خصيصاً للرياضيات الجامعية، مع "دليل معلم" خاص للمساعدة في تصحيح الإجابات بإنصاف.

إليك تفصيل ما قاموا به، باستخدام تشبيهات بسيطة:

1. الامتحان الجديد: U-MATH

المشكلة: الاختبارات السابقة كانت سهلة للغاية أو ضيقة النطاق. كانت تركز غالباً على مواضيع المرحلة الثانوية أو كانت مجرد أسئلة اختيار من متعدد حيث يمكن للذكاء الاصطناعي تخمين الإجابة الصحيحة دون القيام بالعمليات الحسابية فعلياً. كما أنها نادراً ما تضمنت صوراً أو رسوماً بيانية، رغم أن الرياضيات الحقيقية تتضمن ذلك كثيراً.

الحل: ابتكر المؤلفون U-MATH، وهو مجموعة من 1,100 مسألة جديدة تماماً وغير منشورة سابقاً مأخوذة مباشرة من مساقات جامعية حقيقية في الولايات المتحدة.

  • مستوى الصعوبة: هذه ليست مج true اختبارات بسيطة. إنها أسئلة مفتوحة، مما يعني أن على الذكاء الاصطناعي كتابة الحل الكامل، وليس فقط اختيار "أ، ب، ج، أو د".
  • العناصر المرئية: حوالي 20% من هذه المسائل تتضمن صوراً، مثل الرسوم البيانية، الأشكال الهندسية، أو جداول البيانات. هذا يشبه مطالبة الذكاء الاصطناعي بحل مسألة رياضية أثناء النظر إلى مخطط هندسي، بدلاً من مجرد قراءة جملة نصية.
  • المواضيع: يغطي ستة مواضيع جامعية أساسية، من الجبر إلى التفاضل والتكامل.

النتائج: عندما اختبروا أذكى نماذج الذكاء الاصطناعي باستخدام هذا الامتحان الجديد:

  • النصوص فقط: أدى الذكاء الاصطناعي بشكل جيد في المسائل التي تعتمد على النصوص فقط (بنسبة صحة بلغت حوالي 93%).
  • العناصر المرئية: عندما تدخلت الصور في الأمر، عانى الذكاء الاصطناعي بشكل ملحوظ، حيث انخفضت نسبة الصحة إلى حوالي 58%. الأمر يشبه أن يستطيع الذكاء الاصطناعي قراءة وصفة طعام بشكل مثالي، لكنه يرتبك عندما يتعين عليه النظر إلى صورة المكونات ليعرف ماذا يطبخ.

2. دليل المعلم: µ-MATH

المشكلة: كيف تصحح هذه الإجابات المفتوحة؟ إذا كتب الطالب x/2 وكانت الإجابة في نموذج الإجابة هي 0.5x هل تعتبر الإجابة صحيحة؟ وإذا ارتكب الذكاء الاصطناعي الذي يقوم بالتصحيح خطأً، فكيف نعرف ذلك؟ عادةً، نحن نثق في أن الذكاء الاصطناعي يصحح لنفسه، لكن الورقة البحثية تظهر أن "الحكام" من الذكاء الاصطناعي غالباً ما يكونون منحازين أو غير متسقين.

الحل: ابتكروا µ-MATH (تُنطق "مو-ماث"). فكر في هذا كـ امتحان لتقييم المعلمين.

  • أخذوا بعض مسائل U-MATH وجعلوا أربعة نماذج مختلفة من أفضل نماذج الذكاء الاصطناعي تولد إجابات (بعضها صحيح وبعضها خاطئ).
  • ثم طلبوا من نماذج ذكاء اصطناعي أخرى أن تعمل كـ "حكام" لتصحيح تلك الإجابات.
  • والأهم من ذلك، جعلوا خبراء بشريين يتحققون من الإجابات الصحيحة، لذا عرفوا بالضبط من كان محقاً ومن كان مخطئاً. سمح هذا باختبار مدى جودة نماذج الذكاء الاصطناعي التي تعمل كـ "حكام".

النتائج:

  • التصحيح صعب: حتى أفضل نماذج الذكاء الاصطناعي "الحكام" لم يحصلوا على أكثر من 90% من التصحيح الصحيح. إنهم ليسوا مثاليين.
  • كونك طالباً جيداً لا يجعلك معلماً جيداً: بعض نماذج الذكاء الاصطناعي كانت رائعة في حل المسائل الرياضية لكنها سيئة جداً في تصحيحها. والبعض الآخر كان العكس تماماً.
  • الانحياز: كان لدى الحكام "مفضلون". على سبيل المثال، كان بعض الحكام قاسيين جداً على إجابات نماذج معينة ومتساهلين مع أخرى، بغض النظر عما إذا كانت الرياضيات صحيحة أم لا.

3. النقاط الرئيسية المستخلصة

  • "الفجوة المرئية": لا يزال الذكاء الاصطناعي سيئاً جداً في دمج الرياضيات مع الصور. الأمر يشبه وجود طالب يمكنه إجراء عمليات حسابية ذهنية في رأسه، لكنه يتجمد عندما يرى رسماً بيانياً.
  • التخصص مهم: النماذج الأصغر من الذكاء الاصطناعي التي تم تدريبها خصيصاً على الرياضيات (مثل معلم خصوصي متخصص) غالباً ما تتفوق على النماذج الضخمة العامة في هذه المسائل الصعبة.
  • مشكلة "الحاكم": لا يمكننا مجرد الوثوق في الذكاء الاصطناعي ليقوم بتصحيح عمل الذكاء الاصطناعي. تظهر الورقة أن تصحيح الرياضيات هي مهارة مختلفة تماماً عن حلها، وأن "الحكام" من الذكاء الاصطناعي الحالي لا يزالون عرضة للوقوع في الأخطاء وإظهار الانحياز.

ملخص

قام المؤلفون ببناء اختبار رياضيات بمستوى جامعي (U-MATH) لمعرفة مدى ذكاء الذكاء الاصطناعي حقاً، وبناء اختبار للتقييم (µ-MATH) لمعرفة مدى عدالة معلمي الذكاء الاصطناعي. وقد وجدوا أنه بينما يصبح الذكاء الاصطناعي جيداً جداً في الرياضيات القائمة على النصوص، فإنه لا يزال يعاني مع الرياضيات المرئية، كما أنه ليس موثوقاً بما يكفي بعد ليُعتمد كمعلم مثالي يصحح عمله الخاص. لقد جعلوا كل هذه البيانات متاحة للجميع لاستخدامها حتى يتمكن الباحثون من بناء ذكاء اصطناعي أفضل وأكثر صدقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →