← أحدث الأبحاث
💻 computer science

Benchmarking Testing in Automated Theorem Proving

تقدم هذه الورقة البحثية "T"، وهو إطار عمل مبتكر يقيم الصحة الدلالية للنظريات الرسمية المولدة بواسطة الذكاء الاصطناعي من خلال التحقق مما إذا كانت النظريات اللاحقة المعتمدة تنجح في عملية التجميع، مما يكشف عن فجوة كبيرة في قدرات نماذج اللغات الكبيرة الحالية في توليد النظريات مقارنة بطرق التقييم المعجمية أو اليدوية التقليدية.

المؤلفون الأصليون: Jongyoon Kim, Hojae Han, Seung-won Hwang

نُشر 2026-04-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jongyoon Kim, Hojae Han, Seung-won Hwang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتوظيف فريق من المهندسين المعماريين لتصميم جسر جديد.

الطريقة القديمة في الاختبار (التجميع - Compilation)
في الماضي، عندما كنا نقيم هؤلاء المهندسين (الذين هم في هذه الورقة البحثية نماذج ذكاء اصطنا-ئي)، كنا نتحقق فقط مما إذا كانت مخططاتهم "صحيحة لغويًا". كنا نسأل: هل يتبع المخطط قواعد القواعد؟ هل الخطوط متصلة؟ هل يقول الكمبيوتر "صحيح لغويًا" (Syntax OK)؟

إذا بدا المخطط مثاليًا على الورق، كنا نفترض أن الجسر سيصمد. ولكن تكمن المشكلة هنا في أن المهندس المعماري يمكنه رسم مخطط يقول: "هذا الجسر مصنوع من الذهب الخالص"، وسيقوم الكمبيوتر بالرد: "صحيح لغويًا!" لأن الجملة صحيحة من حيث القواعد. ومع ذلك، إذا كان من المفترض أن يكون المخطط لجسر "تعليق فولاذي"، فقد فشل المهندس في أداء المهمة الحقيقية، رغم أن القواعد كانت مثالية.

في عالم الرياضيات ورموز الكمبيوتر، يسمى هذا "التجميع" (Compilation). يقوم الذكاء الاصطنا-ئي بكتابة مبرهنة (عبارة رياضية)، ويتحقق الكمبيوتر مما إذا كانت قابلة للتجميع (أي تعمل دون أخطاء). تجادل الورقة البحثية بأن هذه طريقة سيئة للغاية للحكم على ما إذا كان الذكاء الاصطنا-ئي قد فهم الرياضيات حقًا.

الطريقة الجديدة في الاختبار (إطار عمل T2)
يقترح مؤلفو هذه الورقة طريقة جديدة تسمى T2 (اختبار المبرهنات - Theorem Testing). فبدلاً من مجرد التحقق من قواعد المخطط، يسألون: هل يعمل هذا المخطط حقًا عندما نحاول بناء بقية المدينة حوله؟

لقد استخدموا مفهومًا يسمى "اختبار التكامل" (Integration Testing). تخيل أن الجسر هو مجرد جزء من مدينة ضخمة.

  1. الهدف: يُطلب من الذكاء الاصطنا-ئي إثبات مبرهنة محددة (على سبيل المثال: "الجمع عملية إبدالية"، أي أن a+b=b+aa + b = b + a).
  2. التابعات (Successors): في الرياضيات الحقيقية، بمجرد إثبات حقيقة صغيرة، يستخدمها رياضيون آخرون لإثبات أشياء أكبر وأكثر تعقيدًا. تبحث الورقة في جميع المبرهنات الأخرى التي تعتمد على إجابة الذكاء الاصطنا-ئي.
  3. الاختبار: يتم إدخال إجابة الذكاء الاصطنا-ئي في هذه البراهن "اللاحقة".
    • إذا قدم الذكاء الاصطنا-ئي إجابة "مزيفة" (مثل حقيقة بديهية دائمًا صحيحة ولكنها لا تقدم أي فائدة)، فإن البراهن اللاحقة ستنهار. ستفشل في التجميع لأنها اعتمدت على معنى محدد لم توفره الإجابة.
    • إذا قدم الذكاء الاصطنا-ئي الإجابة الصحيحة، فستعمل البراهن اللاحقة بسلاسة.

الاكتشاف الكبير
قام المؤلفون ببناء مجموعة اختبار ضخمة تضم 2,206 مسألة من العالم الحقيقي من لغة البرمجة "Lean". واختبروا 18 من أذكى نماذج الذكاء الاصط-نا-ئي المتاحة (بما في ذلك نماذج من Google وOpenAI وAnthropic).

إليك ما وجدوه، باستخدام تشبيه الجسر الخاص بنا:

  • فخ "القواعد": كانت معظم نماذج الذكاء الاصطنا-ئي بارعة في اجتياز الاختبار القديم. لقد كتبوا مخططات بدت مثالية وتجمعت دون أخطاء. في الاختبار القديم، سجلوا نسبة نجاح تقارب 80%.
  • اختبار الواقع: عندما طبق المؤلفون اختبار "تكامل المدينة" الجديد، انخفضت الدرجات بشكل حاد. أفضل نموذج ذكاء اصطنا-ئي حصل على حوالي 39% فقط من الإجابات الصحيحة.
  • الفجوة: هذا يعني أنه مقابل كل 100 جسر يدعي الذكاء الاصطنا-ئي بناءها، فإن حوالي 60 منها ستنهار بمجرد أن يحاول شخص ما بناء طريق فوقها. لقد كان الذكاء الاصطنا-ئي جيدًا في تزييف مظهر الرياضيات، لكنه كان سيئًا في فهم المعنى.

لماذا يهم هذا؟
تظهر الورقة البحثية أن الطرق الحالية لقياس مهارات الرياضيات للذكاء الاصطنا-ئي تخدعنا.

  • التشابه اللفظي (BLEU): التحقق مما إذا كانت كلمات الذكاء الاصطنا-ئي تشبه الكلمات البشرية هو أمر عديم الفائدة. يمكن للذكاء الاصطنا-ئي كتابة كلام غير مفهوم يبدو كأنه رياضيات ومع ذلك يجتاز الاختبار.
  • النماذج المتخصصة: حتى النماذج المصممة خصيصًا لتكون "خبراء رياضيات" لم تقدم أفضل حالًا من نماذج الدردشة العامة. لقد تحسنوا فقط في تزييف القواعد (Syntax).
  • الحل: الطريقة الوحيدة لمعرفة ما إذا كان الذكاء الاصطنا-ئي يفهم الرياضيات حقًا هي رؤية ما إذا كان عمله سيصمد عندما تحاول البراهن الأخرى الوقوف عليه.

باخت-صار
تقدم الورقة البحثية "اختبار جهد" جديدًا للرياضيات في الذكاء الاصطنا-ئي. فهي تتوقف عن السؤال: "هل تبدو هذه الجملة كأنها رياضيات؟" وتبدأ في السؤال: "هل تعمل هذه الرياضيات حقًا عندما نحاول استخدامها لحل مشكلات أكبر؟" والنتيجة هي مواجهة قاسية مع الواقع: نماذج الذكاء الاصطنا-ئي الأفضل اليوم لا تزال تعاني في تقديم رياضيات حقيقية وذات معنى، رغم أنها تبدو وكأنها تفعل ذلك ببراعة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →