MathAtlas: A Benchmark for Autoformalization in the Wild
تقدم هذه الورقة MathAtlas، وهو أول معيار للتحويل التلقائي إلى صيغ رياضية (autoformalization) واسع النطاق يضم ما يقرب من 52,000 مفهوم رياضي بمستوى الدراسات العليا من 103 كتب مدرسية، مما يكشف عن الصعوبة البالغة التي تواجهها النماذج الحالية في التعامل مع الرياضيات البحثية المعقدة والغنية بالارتباطات.
تخيل أن لديك مترجماً عبقرياً يمكنه تحويل القصص البشرية إلى لغة صارمة قابلة للقراءة من قبل الحاسوب تسمى "Lean". لفترة طويلة، لم يتم اختبار هذا المترجم إلا على قصص بسيطة — مثل مسائل الرياضيات في المرحلة الثانوية أو الألغاز الأساسية. كان بإمكان الحاسوب ترجمة هذه القصص بسهولة لأن القواعد كانت بسيطة، وكان الحاسوب قد رأى قواعد مماثلة من قبل.
ولكن ماذا يحدث عندما تطلب من هذا المترجم ترجمة ورقة بحثية معقدة بمستوى الدراسات العليا؟ هذا هو المشكل الذي يعالجه MathAtlas.
إليك تحليل بسيط لما تفعله الورقة البحثية، باستخدام بعض التشبيهات من الحياة اليومية:
1. المشكلة: "المكتبة" كبيرة جداً
تخيل أنك تحاول بناء منزل (برهان رسمي) بناءً على مخطط هندسي (كتاب رياضيات مدرسي).
الاختبارات السابقة: كانت الاختبارات السابقة تطلب من المترجم فقط بناء كوخ صغير. كانت المواد كلها موجودة في صندوق الأدوات، وكانت التعليمات قصيرة.
العالم الحقيقي: الرياضيات في مرحلة الدراسات العليا تشبه محاولة بناء ناطحة سحاب. لبناء الطابق الخمسين، تحتاج إلى الطابق الخمسين. لبناء الطابق الخمسين، تحتاج إلى الطابق التاسع والأربعين، وهكذا نزولاً حتى تصل إلى الأساس.
المشكلة: في الرياضيات المتقدمة، غالباً ما يكون "الأساس" (التعريفات والنظريات) لم يُبنَ بعد بلغة الحاسوب. إذا كان المترجم لا يعرف تعريف "جبر لي" (Lie Algebra) (وهو مفهوم معقد)، فلن يتمكن من ترجمة المبرهنة التي تستخدمه.
2. الحل: MathAtlas (الخريطة "الجامحة")
أنشأ المؤلفون MathAtlas، وهو مجموعة اختبار جديدة ضخمة.
النطاق: قاموا بجمع بيانات من 103 كتب مدرسية للرياضيات بمستوى الدراسات العليا. الأمر يشبه أخذ مكتبة مكونة من 52,000 صفحة من الرياضيات المتقدمة وتحويلها إلى خريطة رقمية.
"رسم التبعية البياني" (The Dependency Graph): هذه هي القوة الخارقة للورقة البحثية. تخيل كتاب "اختر مغامرتك الخاصة" حيث تحتوي كل صفحة على أسهم تشير إلى صفحات أخرى يجب عليك قراءتها أولاً. MathAtlas يرسم هذه الأسهم. إنه يوضح أنه لكي تفهم "التقرير 15"، يجب أن تفهم أولاً "حلقات ديدكيند" (Dedekind Rings)، والتي بدورها تحتاج إلى "المثاليّات الأولية" (Prime Ideals).
لماذا هذا مهم: إنه يجبر الذكاء الاصطناعي ليس فقط على ترجمة جملة واحدة، بل على اكتشاف: "هل لدي الأدوات لبناء هذا؟ وإذا لم يكن لدي، فهل يمكنني إيجاد أو بناء الأدوات أولاً؟"
3. النتائج: الذكاء الاصطناعي عالق في الوحل
اختبر المؤلفون أذكى نماذج الذكاء الاصطناعي المتاحة على MathAtlas، وكانت النتائج متواضعة.
الدرجة: حتى أفضل نماذج الذكاء الاصطناł حصلت على أقل من 10% من عبارات المبرهنات بشكل صحيح. وبالنسبة للتعريفات، كانت النسبة حوالي 16%.
فخ "العمق": كلما زاد "شجر التبعية" (أي كلما زادت الخطوات التي يجب العودة إليها لإيجاد التعريفات)، ساء أداء الذكاء الاصطناعي.
تشبيه: إذا كان على الذكاء الاصطناعي البحث عن 10 مفاهيم سابقة لترجمة جملة واحدة، فإنه يرتبك ويستسلم. في المسائل الأكثر صعوبة (حيث كان شجر التبعية أكثر عمقاً)، حقق الذكاء الاصطناعي 2.6% فقط من الصحة.
تأثير "Mathlib": أدى الذكاء الاصطناعي أداءً أفضل قليلاً عندما كان المفهوم الذي يحتاج لترجمته موجوداً بالفعل في مكتبة شهيرة تسمى "Mathlib" (وهي تشبه صندوق أدوات مسبق البناء قد يكون الذكاء الاصطناعي قد درسه). إذا كان المفهوم جديداً وغير موجود في تلك المكتبة، فقد عانى الذكاء الاصطناعي بشكل أكبر بكثير.
4. اختبار "الثقة" (MA-Align)
أنشأت الورقة أيضاً اختباراً جديداً يسمى MA-Align.
المشكلة: أحياناً يترجم الذكاء الاصطناعي جملة إلى كود يبدو مثالياً ويعمل دون أخطاء، لكنه في الواقع يعني شيئاً مختلفاً تماماً عن الرياضيات الأصلية. الأمر يشبه ترجمة "القط جلس على الحصيرة" إلى برنامج حاسوبي يقول "الكلب أكل البيتزا". البرنامج يعمل، لكنه خاطئ.
الاختبار: طلبوا من حكام (نماذج) ذكاء اصطناعي التحقق مما إذا كانت الترجمة "أمينة" (مطابقة للمعنى). ووجدوا أن أفضل حكام الذكاء الاصطناي قد تعرضوا للخداع في كثير من الأحيان، خاصة مع تعريفات الدراسات العليا المعقدة.
الخلاصة
تخلص الورقة البحثية إلى أنه بينما أصبح الذكاء الاصطناعي جيداً في الرياضيات البسيطة، فإنه حالياً سيء للغاية في ترجمة الرياضيات المعقدة والواقعية بمستوى الدراسات العليا. العائق الرئيسي ليس مجرد ترجمة الكلمات؛ بل هو فهم الشبكة الهائلة من الروابط بين الأفكار ومعرفة كيفية بناء "الأدوات" اللازمة (التعريفات) قبل بناء "المنزل" (المبرهنات).
MathAtlas مفتوح الآن للجميع لاستخدامه كمسار تحدٍ لمساعدة الذكاء الاصطناعي على تعلم كيفية التعامل مع هذه التبعات العميقة والمعقدة.
ملخص تقني: MathAtlas: معيار للتحويل التلقائي للصيغ في الواقع العملي
بيان المشكلة
تركز معايير التحويل التلقائي للصيغ (autoformalization) الحالية بشكل أساسي على مجالات أبسط، مثل رياضيات الأولمبياد أو الرياضيات الجامعية، حيث تكون المتطلبات السابقة محدودة وغالبًا ما تكون مُصاغة بالفعل في مكتبات مثل Mathlib. ومع ذلك، لا تزال الرياضيات في مرحلة الدراسات العليا والبحث العلمي غير مستكشفة بشكل كافٍ. في هذه المجالات المتقدمة، يصبح التحويل التلقائي للصيغ أكثر تعقيدًا لأن:
عمق المتطلبات السابقة: تعتمد الرياضيات المتقدمة على نظرية متطلبة واسعة النطاق، وكثير منها لم يتم صياغته رسميًا بعد. يجب على النظام الفعال ألا يكتفي بصياغة العبارة المستهدفة فحسب، بل يجب عليه أيضًا استرجاع أو تركيب النظريات التابعة الضرورية.
فجوة التعريفات: تتجاهل المعايير الحالية إلى حد كبير صياغة التعريفات الرياضية. الأنظمة التي يمكنها التعامل مع عبارات المبرهنات فقط تظل محدودة بالنظرية الرسمية الموجودة؛ فهي لا تستطيع صياغة المبرهنات التي تتضمن مفاهيم لا توجد لها تعريفات حاليًا.
نقص البيانات الواقعية: هناك ندرة في المعايير واسعة النطاق والواقعية التي تلتقط تعقيد الرياضيات في مستوى الدراسات العليا "في الواقع العملي"، بما في ذلك التبعيات السياقية الغنية والعلاقات بين الكيانات.
المنهجية
بناء مجموعة البيانات: MathAtlas
يقدم المؤلفون MathAtlas، وهو أول معيار واسع النطاق للتحويل التلقائي للصيغ لمستوى الدراسات العليا في الرياضيات.
المادة المصدر: تم استخراج مجموعة البيانات من 103 كتابًا جامعيًا في الرياضيات لمستوى الدراسات العليا تغطي 87 مجالًا متميزًا (مثل التحليل الحقيقي، الهندسة التفاضلية، نظرية الفئات، ومجموعات كوانتوم).
الحجم والتكوين: يحتوي MathAtlas على ما يقرب من 52,052 كيانًا، تتكون من:
~18,000 مبرهنة
~10,000 تمرين
~10,000 تعريف
~10,000 برهان
~5,000 مثال
رسم بياني للتبعية: الميزة الرئيسية هي إثراء مجموعة البيانات بـ رسم بياني للتبعية الرياضية يحتوي على ~178,000 علاقة. يربط هذا الرسم الكيانات بـ:
مراجع الكائنات: مفاهيم رياضية مسمى (مثل "حلقة ديدكيند" Dedekind ring) تتطلب تعريفات خارجية.
مراجع الكيانات: إشارات إلى مبرهنات أو تعريفات محددة أخرى داخل النص.
مراجع المتغيرات المحلية: رموز تُستخدم دون تقديم محلي صريح.
عمق التبعية: أقصى ارتفاع لشجرة تبعية الكيان (متوسط العمق 30، ويصل إلى 80)، والذي يختلف بشكل كبير حسب المجال (على سبيل المثال، جبر لي Lie algebra لديه أشجار أعمق من نظرية المجموعات).
خط أنابيب البناء:
التحويل: يتم تحويل ملفات PDF إلى Markdown رياضي (MMD) باستخدام Nougat.
الاستخراج: يقوم نموذج لغوي كبير (gpt-oss-120b) عبر التوجيه بأسلوب "اللقطات القليلة" (few-shot) باستخراج الكيانات (تعريفات، مبرهنات، إلخ) ومعرفاتها.
استخراج المراجع: يحدد نموذج ثانٍ مراجع الكائنات، والكيانات، والمتغيرات المحلية داخل النص المستخرج.
استخراج العلاقات: يقوم نظام بمطابقة المراجع مع الكيانات المستهدفة (باستخدام LeanSearch لربطها بـ Mathlib واستخدام النماذج اللغوية الكبيرة للمطابقة الداخلية) لبناء الرسم البياني للتبعية.
ضبط الجودة: تشير التقييمات البشرية على عينات عشوائية إلى صحة بنسبة 90.4% لاستخراج الكيانات ودرجة F1 بنسبة 94.8% لاستخراج العلاقات.
مقاييس التقييم
يقيم البحث أداء التحويل التلقائي للصيغ باستخدام مقييس مركب يسمى الصحة (Correctness)، والذي يتطلب أن يستوفي الكود المولد شرطين:
التجميع (Compilation): يجب أن يتم تجميع كود Lean 4 الناتج بنجاح.
الأمانة الدلالية (Semantic Faithfulness): يجب أن تكون العبارة المصاغة مكافئة دلاليًا للمصدر غير الرسمي.
لقياس الأمانة، قدم المؤلفون MA-Align، وهو معيار تصنيف ثنائي يحتوي على 200 كيان (عبارات وتعريفات) من MathAtlas، مصنفة كـ "متوافقة" أو "غير متوافقة".
قاموا بتقييم أنظمة "النموذج اللغوي كحكم" (LLM-as-judge) الحالية (مثل CriticLean)، ووجدوا أنه بينما تعمل بشكل جيد على المعايب السابقة (ConsistencyCheck، CriticLeanBench)، فإن دقتها تنخفض بشكل كبير في MA-Align، مما يسلط الضوء على فجوة في تقييم تعريفات مستوى الدراسات العليا.
الإعداد التجريبي
اختبر المؤلفون نماذج أساسية مختلفة على MathAtlas، بما في ذلك:
دراسات الاستئصال (Ablation Studies): اختبار تأثير السياق المحلي (الـ 500 توكن السابقة)، والتوجيهات الهندسية، وأمثلة تدريب محددة.
مجموعة MA-Hard الفرعية: مجموعة فرعية محددة من ~700 كيان مع أعمق أشجار تبعية (متوسط العمق >50) لاختبار حدود الأنظمة الحالية.
النتائج الرئيسية
الأداء العام
يثبت MathAtlas أنه معيار شديد الصعوبة. تحقق النماذج الأساسية القوية معدلات صحة منخفضة:
العبارات (المبرهنات، الأمثلة، التمارين): يحقق أفضل نموذج أساسي (ReForm 8B) نسبة صحة قدرها 9.8% فقط.
التعريفات: يحقق أفضل نموذج أساسي (gpt-oss-120b مع التوجيه باللقطات القليلة) نسبة صحة قدرها 16.7%.
التباين: يوجد فجوة كبيرة بين معدلات التجميع والصحة (على سبيل المثال، Kimina 7B يجمع 27.3% من العبارات ولكن 2.3% فقط منها دقيقة دلاليًا)، مما يشير إلى أن النجاح النحوي لا يضمن الدقة الدلالية.
عمق التبعية والصعوبة
يتدهور الأداء بشكل كبير مع زيادة عمق التبعية:
في MA-Hard (الـ 700 كيان ذات أشجار التبعية الأعمق)، يحقق أفضل نموذج نسبة صحة قدرها 2.6% فقط.
يؤكد التحليل الإحصائي (اختبار Kolmogorov–Smirnov) وجود فرق معنوي في توزيعات الصحة بين أشجار التبعية الضحلة والعميقة (p<0.001).
السياق والتأسيس (Grounding)
السياق المحلي: أدى إضافة السياق المحلي (الـ 500 توكن السابقة) إلى التوجيه إلى خفض الأداء للنماذج الموجهة (من 20.3% إلى 17.4% في التعريفات)، مما يشير إلى أن النماذج الحالية تكافح لدمج السياق طويل المدى بفعالية.
التأسيس بـ Mathlib: كانت الكيانات التي يمكن ربطها بالتصيغات الموجودة في Mathlib أكثر عرضة للتحويل الصحيح بشكل ملحوظ (27.9% مقابل 16.8% للتعريفات غير المرتبطة)، مما يشير إلى أن النماذج اللغوية الكبيرة تستفيد من التعرض المسبق للنظرية المصاغة رسميًا في بيانات تدريبها.
الأهمية والمساهمات
يدعي البحث الأهمية التالية للمجال:
أول معيار لمستوى الدراسات العليا: يعد MathAtlas أول معيار واسع النطاق و"واقعي" لمستوى الدراسات العليا في الرياضيات، متجاوزًا قيود مجموعات بيانات الأولمبياد والجامعة.
التقييم المدرك للتبعية: هو أول معيار يتضمن رسومًا بيانية غنية للتبعية وعلاقات بين الكيانات، مما يسمح بتقييم الأنظمة التي يجب أن تتعامل مع النظرية المسبقة وتخليق التعريفات.
تسليط الضوء على فجوة التعريفات: تظهر النتائج أن النماذج الحالية المتطورة تعاني بشكل كبير مع التعريفات وسلاسل التبعية العميقة، مما يكشف عن اختناق حرج في توسيع نطاق التحويل التلقائي للصيغ ليشمل الرياضيات المتقدمة.
محدودية مقاييس الأمانة: تظهر مقدمة MA-Align والتجارب اللاحقة أن مقاييس الأمانة الدلالية الحالية (مثل CriticLean) لا تتعمم بشكل جيد على تعريفات مستوى الدراسات العليا، مما يستدي نهجًا جديدًا للتقييم.
مورد للمجتمع: يطلق المؤلفون MathAtlas، وMA-Align، والرمز التجريبي لتسهيل الأبحاث المستقبلية في التحويل التلقائي للصيغ المدرك للتبعية وتحويل المفاهيم الرياضية المتقدمة.
يخلص المؤلفون إلى أنه بينما تظهر الأنظمة الحالية بعض الوعود، فإن الفجوة بين القدرات الحالية ومتطلبات رياضيات الدراسات العليا تظل شاسعة، خاصة فيما يتعلق بتخليق النظرية المسبقة وصياغة التعريفات.