← أحدث الأبحاث
💻 computer science

CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

تقدم هذه الورقة CAM-Bench، وهو معيار مرجعي جديد للغة Lean 4 يضم 1,000 مسألة تمت صياغتها في الرياضيات الحسابية والتطبيقية، يعالج نقص التمثيل لهذه المجالات في التقييمات الحالية من خلال استخدام خط معالجة لاستعادة التبعية لتكييف تمارين الكتب المدرسية وتحليل أداء النماذج اللغوية الكبيرة في المهام التي تتطلب تتبع السياق المحلي وتطبيق النظريات الأولية.

المؤلفون الأصليون: Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت ذكي للغاية ولكنه حرفي التفكير كيفية القيام بالرياضيات. لديك طريقتان لاختبار الروبوت:

  1. اختبار "مفتاح الإجابة": تعطيه مسألة رياضية، فيكتب الرقم النهائي. إذا كان الرقم صحيحاً، تمنحه نجمة ذهبية. هذه هي الطريقة التي تعمل بها معظم اختبارات الرياضيات للذكاء الاصطناعي حالياً.
  2. اختبار "خطوة بخطوة": تطلب من الروبوت كتابة كل خطوة منطقية، مثل برهان في كتاب مدرسي، ثم تتحقق مما إذا كانت كل خطوة غير قابلة للكسر منطقياً. هذا أصعب بكثير، لكنه يثبت أن الروبوت يفهم الرياضيات حقاً، وليس مجرد تخمين الإجابة.

تقدم هذه الورقة البحثية اختباراً جديداً فائق الصعوبة من نوع "خطوة بخطوة" يسمى CAM-Bench.

المشكلة: الروبوت يعرف فقط رياضيات "الأولمبياد"

حالياً، معظم اختبارات الرياضيات للذكاء الاصطناعي تشبه ألغاز الأولمبياد. إنها ألغاز مخادعة ومكتفية ذاتياً (مثل "أثبت أنه إذا كان س صحيحاً، فإن ص صحيح"). الذكاء الاصطناعي بارع في هذه الألغاز لأنها تشبه ألعاب المنطق المعزولة.

لكن الرياضيات في العالم الحقيقي—مثل الهندسة أو التمويل أو الفيزياء—مختلفة تماماً. فهي ليست لغزاً مرتباً في الغالب. بل هي أشبه بـ اتباع وصفة من كتاب طبخ.

  • الوصفة (المسألة) تفترض أنك تعرف بالفعل معنى "تشويح".
  • تفترض أن لديك مقلاة من نوع معين (تعريف من الفصل الثالث).
  • تفترض أنك تعرف كيفية تقطيع البصل (خوارزمية من الفصل الأول).

إذا قدمت للروبوت الجملة الأخيرة من الوصفة فقط ("اصنع الحساء")، فسيصاب بالارتباك لأنه يفتقر إلى "السياق المحلي" (التعريفات، الأدوات، الخطوات السابقة) الذي افترض المؤلف الأصلي أنك تمتلكه.

صُمم CAM-Bench لاختبار ما إذا كان بإمكان الذكاء الاصطناعي التعامل مع هذه الرياضيات بأسلوب "كتاب الطبخ"، وتحديداً في مجالات مثل التحسين (إيجاد أفضل طريقة للقيام بشيء ما)، والجبر الخطي العددي (التعامل مع الرياضيات باستخدام شبكات ضخمة من الأرقام)، والتحليل العددي (تقريب الحلول).

الحل: خط إنتاج "المحقق السياقي"

لم يقم المؤلفون بمجرد جلب مسائل من الكتب المدرسية وتغذية الذكاء الاصطناعي بها. بل بنوا خط إنتاج (مصنع) متطوراً لإعداد المسائل. فكر في الأمر كـ محقق سياقي:

  1. الدليل الخام: يبدأون بتمرين فوضوي من كتاب مدرسي يقول: "استخدم الخوارزمية 16.4 لحل المسألة 16.76".
  2. عمل المحقق: يعود خط الإنتاج إلى الكتاب لمعرفة ماهية "الخوارزمية 16.4" فعلياً. إنه ينبش بحثاً عن التعريفات، والصيغ، والافتراضات المخفية في الفصول السابقة.
  3. إعادة البناء: يقوم بدمج كل هذه القطع المتناثرة في "مبرهنة غير رسمية" واحدة متكاملة. الأمر يشبه أخذ وصفة تقول "أضف الصلصة السرية" وإعادة كتابتها لتصبح "أضف الصلصة المكونة من الطماطم، والريحان، والثوم".
  4. الترجمة: أخيراً، يترجم هذه القصة النظيفة والمتكاملة إلى لغة Lean، وهي لغة حاسوبية صارمة تعمل كمعلم رياضيات شديد التدقيق. إذا وجد المنطق ثغرة واحدة صغيرة، فإن Lean يرفضه.

النتائج: الذكاء الاصطناعي عالق في "كتاب الطبخ"

اختبر المؤلفون بعض أقوى نماذج الذكاء الاصطناي في العالم على هذا المعيار الجديد. إليكم ما حدث:

  • فجوة "مفتاح الإجابة": كانت نماذج الذكاء الاصطناعي جيدة جداً في حل المسائل باللغة الإنجليزية العادية (الحصول على الإجابة الصحيحة). ولكن عندما تعين عليها كتابة البرهان بلغة Lean (اللغة الصارمة)، انخفض معدل نجاحها بشكل حاد.
    • التشبيه: الأمر يشبه قدرة الذكاء الاصطناعي على إخبارك بكيفية خبز كعكة في محادثة، ولكن إذا طلبت منه كتابة التعليمات لروبوت لا يمكنه التخمين، فسيحرق الروبوت المطبخ.
  • فشل "السياق المحلي": استمر الذكاء الاصطناعي في نسيان "القواعد المحلية". كان يحاول استخدام أداة غير موجودة في الفصل الحالي، أو يغفل عن افتراض صغير (مثل "يجب أن يكون الرقم موجباً") كان الكتاب المدرسي يلمح إليه لكنه لم يذكره صراحة في تلك الجملة المحددة.
  • مشكلة "السلسلة الطويلة": تتطلب المسائل الرياضية الحقيقية غالباً سلسلة طويلة من الخطوات الصغيرة (مثل بناء منزل طوبة بطوبة). غالباً ما تضيع نماذج الذكاء الاصطدي في منتصف السلسلة، فتنسى ما الذي يبنونه أو تفقد السيطرة على الهدف طويل الأمد.

ترقية "الوكيل" (Agent)

جرب الباحثون أيضاً طريقة أكثر تقدماً حيث يعمل الذكاء الاصطناعي كـ محقق بشري لديه صندوق أدوات. بدلاً من مجرد تخمين الإجابة، يُسمح للذكاء الاصطناعي بـ:

  • طلب المساعدة من الكمبيوتر (Lean) عندما يرتكب خطأً.
  • مراجعة عمله الخاص.
  • المحاولة مرة أخرى بناءً على رسالة الخطأ.

هذا النهج "الوكيل" حقق نتائج أفضل بكثير، حيث ضاعف معدل النجاح. ومع ذلك، كان لا يزال بعيداً عن المثالية، وكان يتطلب الكثير من "القدرة الذهنية" (رموز الحوسبة/Tokens) لتشغيله.

الخلاصة

يُظهر CAM-Bench أنه بينما أصبح الذكاء الاصطناعي جيداً في حل الألغاز الرياضية، فإنه لا يزال يعاني في التعامل مع الرياضيات التطبيقية التي تتطلب فهم السياق، وتذكر القواعد المحلية، وبناء الحجج المنطقية خطوة بخطوة.

خلصت الورقة البحثية إلى أنه لجعل الذكاء الاصطناعي موثوقاً حقاً في الرياضيات الواقعية، نحتاج إلى التوقف عن اختباره على الألغاز المعزولة والبدء في اختباره على هذه المسائل "المعقدة" المليئة بالسياق والمستمدة من "كتب الطبخ". النماذج الحالية تشبه الطلاب الذين يمكنهم حفظ الإجابات ولكنهم لم يتعلموا بعد كيفية بناء منزل من الأساس.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →