← أحدث الأبحاث
💻 computer science

MathAtlas: A Benchmark for Autoformalization in the Wild

تقدم هذه الورقة MathAtlas، وهو أول معيار للتحويل التلقائي إلى صيغ رياضية (autoformalization) واسع النطاق يضم ما يقرب من 52,000 مفهوم رياضي بمستوى الدراسات العليا من 103 كتب مدرسية، مما يكشف عن الصعوبة البالغة التي تواجهها النماذج الحالية في التعامل مع الرياضيات البحثية المعقدة والغنية بالارتباطات.

المؤلفون الأصليون: Nilay Patel, Noah Arias, Davit Babayan, Victoria Cochran, Timothy Libman, Hafsah Mahmood, Liam McCarty, Soli Munoz, Laurel Willey, Jeffrey Flanigan

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Nilay Patel, Noah Arias, Davit Babayan, Victoria Cochran, Timothy Libman, Hafsah Mahmood, Liam McCarty, Soli Munoz, Laurel Willey, Jeffrey Flanigan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مترجماً عبقرياً يمكنه تحويل القصص البشرية إلى لغة صارمة قابلة للقراءة من قبل الحاسوب تسمى "Lean". لفترة طويلة، لم يتم اختبار هذا المترجم إلا على قصص بسيطة — مثل مسائل الرياضيات في المرحلة الثانوية أو الألغاز الأساسية. كان بإمكان الحاسوب ترجمة هذه القصص بسهولة لأن القواعد كانت بسيطة، وكان الحاسوب قد رأى قواعد مماثلة من قبل.

ولكن ماذا يحدث عندما تطلب من هذا المترجم ترجمة ورقة بحثية معقدة بمستوى الدراسات العليا؟ هذا هو المشكل الذي يعالجه MathAtlas.

إليك تحليل بسيط لما تفعله الورقة البحثية، باستخدام بعض التشبيهات من الحياة اليومية:

1. المشكلة: "المكتبة" كبيرة جداً

تخيل أنك تحاول بناء منزل (برهان رسمي) بناءً على مخطط هندسي (كتاب رياضيات مدرسي).

  • الاختبارات السابقة: كانت الاختبارات السابقة تطلب من المترجم فقط بناء كوخ صغير. كانت المواد كلها موجودة في صندوق الأدوات، وكانت التعليمات قصيرة.
  • العالم الحقيقي: الرياضيات في مرحلة الدراسات العليا تشبه محاولة بناء ناطحة سحاب. لبناء الطابق الخمسين، تحتاج إلى الطابق الخمسين. لبناء الطابق الخمسين، تحتاج إلى الطابق التاسع والأربعين، وهكذا نزولاً حتى تصل إلى الأساس.
  • المشكلة: في الرياضيات المتقدمة، غالباً ما يكون "الأساس" (التعريفات والنظريات) لم يُبنَ بعد بلغة الحاسوب. إذا كان المترجم لا يعرف تعريف "جبر لي" (Lie Algebra) (وهو مفهوم معقد)، فلن يتمكن من ترجمة المبرهنة التي تستخدمه.

2. الحل: MathAtlas (الخريطة "الجامحة")

أنشأ المؤلفون MathAtlas، وهو مجموعة اختبار جديدة ضخمة.

  • النطاق: قاموا بجمع بيانات من 103 كتب مدرسية للرياضيات بمستوى الدراسات العليا. الأمر يشبه أخذ مكتبة مكونة من 52,000 صفحة من الرياضيات المتقدمة وتحويلها إلى خريطة رقمية.
  • "رسم التبعية البياني" (The Dependency Graph): هذه هي القوة الخارقة للورقة البحثية. تخيل كتاب "اختر مغامرتك الخاصة" حيث تحتوي كل صفحة على أسهم تشير إلى صفحات أخرى يجب عليك قراءتها أولاً. MathAtlas يرسم هذه الأسهم. إنه يوضح أنه لكي تفهم "التقرير 15"، يجب أن تفهم أولاً "حلقات ديدكيند" (Dedekind Rings)، والتي بدورها تحتاج إلى "المثاليّات الأولية" (Prime Ideals).
  • لماذا هذا مهم: إنه يجبر الذكاء الاصطناعي ليس فقط على ترجمة جملة واحدة، بل على اكتشاف: "هل لدي الأدوات لبناء هذا؟ وإذا لم يكن لدي، فهل يمكنني إيجاد أو بناء الأدوات أولاً؟"

3. النتائج: الذكاء الاصطناعي عالق في الوحل

اختبر المؤلفون أذكى نماذج الذكاء الاصطناعي المتاحة على MathAtlas، وكانت النتائج متواضعة.

  • الدرجة: حتى أفضل نماذج الذكاء الاصطناł حصلت على أقل من 10% من عبارات المبرهنات بشكل صحيح. وبالنسبة للتعريفات، كانت النسبة حوالي 16%.
  • فخ "العمق": كلما زاد "شجر التبعية" (أي كلما زادت الخطوات التي يجب العودة إليها لإيجاد التعريفات)، ساء أداء الذكاء الاصطناعي.
    • تشبيه: إذا كان على الذكاء الاصطناعي البحث عن 10 مفاهيم سابقة لترجمة جملة واحدة، فإنه يرتبك ويستسلم. في المسائل الأكثر صعوبة (حيث كان شجر التبعية أكثر عمقاً)، حقق الذكاء الاصطناعي 2.6% فقط من الصحة.
  • تأثير "Mathlib": أدى الذكاء الاصطناعي أداءً أفضل قليلاً عندما كان المفهوم الذي يحتاج لترجمته موجوداً بالفعل في مكتبة شهيرة تسمى "Mathlib" (وهي تشبه صندوق أدوات مسبق البناء قد يكون الذكاء الاصطناعي قد درسه). إذا كان المفهوم جديداً وغير موجود في تلك المكتبة، فقد عانى الذكاء الاصطناعي بشكل أكبر بكثير.

4. اختبار "الثقة" (MA-Align)

أنشأت الورقة أيضاً اختباراً جديداً يسمى MA-Align.

  • المشكلة: أحياناً يترجم الذكاء الاصطناعي جملة إلى كود يبدو مثالياً ويعمل دون أخطاء، لكنه في الواقع يعني شيئاً مختلفاً تماماً عن الرياضيات الأصلية. الأمر يشبه ترجمة "القط جلس على الحصيرة" إلى برنامج حاسوبي يقول "الكلب أكل البيتزا". البرنامج يعمل، لكنه خاطئ.
  • الاختبار: طلبوا من حكام (نماذج) ذكاء اصطناعي التحقق مما إذا كانت الترجمة "أمينة" (مطابقة للمعنى). ووجدوا أن أفضل حكام الذكاء الاصطناي قد تعرضوا للخداع في كثير من الأحيان، خاصة مع تعريفات الدراسات العليا المعقدة.

الخلاصة

تخلص الورقة البحثية إلى أنه بينما أصبح الذكاء الاصطناعي جيداً في الرياضيات البسيطة، فإنه حالياً سيء للغاية في ترجمة الرياضيات المعقدة والواقعية بمستوى الدراسات العليا. العائق الرئيسي ليس مجرد ترجمة الكلمات؛ بل هو فهم الشبكة الهائلة من الروابط بين الأفكار ومعرفة كيفية بناء "الأدوات" اللازمة (التعريفات) قبل بناء "المنزل" (المبرهنات).

MathAtlas مفتوح الآن للجميع لاستخدامه كمسار تحدٍ لمساعدة الذكاء الاصطناعي على تعلم كيفية التعامل مع هذه التبعات العميقة والمعقدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →