← أحدث الأبحاث
💬 NLP

VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean

تقدم هذه الورقة VeriSoftBench، وهو معيار قياسي على مستوى المستودعات يضم 500 التزام بإثبات لغة Lean 4 من مشاريع التحقق من البرمجيات مفتوحة المصدر، كاشفةً أن النماذج اللغوية الكبيرة الحالية تعاني في الانتقال من الإعدادات الرياضية إلى الإعدادات المتمحورة حول الكود، ومسلطةً الضوء على التأثير الحاسم للتبعية بين الملفات على نجاح أتمتة الإثبات.

المؤلفون الأصليون: Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig

نُشر 2026-02-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم متدرب بارع ولكنه يفتقر للخبرة كيفية إصلاح آلة معقدة.

الطريقة القديمة (المعايير الرياضية)
لفترة طويلة، قام الباحثون باختبار هؤلاء "المتدربين" من الذكاء الاصطناعي باستخدام Mathlib. فكر في Mathlib كأنه مكتبة ضخمة ومنظمة بشكل مثالي للحقائق الرياضية العالمية. الأمر يشبه إعطاء المتدرب كتاباً مدرسياً واحداً ضخماً حيث كل تعريف فيه قياسي، وكل فصل فيه مرقم، والإجابات على المسائل توجد دائماً في نفس الأماكن المتوقعة.

  • المشكلة: البرمجيات في العالم الحقيقي ليست مثل الكتاب المدرسي للرياضيات. إنها أشبه بموقع بناء فوضوي ومتوسع، حيث لكل مبنى مخططاته الخاصة، وأدواته المخصصة، وقواعده المحلية الغريبة التي لا توجد في أي مكان آخر.

التحدي الجديد: VeriSoftBench
أدرك مؤلفو هذه الورقة أن الذكاء الاصطناعي أصبح بارعاً في حل المسائل الرياضية لكنه يفشل فشلاً ذريعاً في التحقق من البرمجيات في العالم الحقيقي. لذا، قاموا ببناء VeriSoftBench.

فكر في VeriSoftBench كأنه مستودع ضخم وفوضوي يحتوي على 500 "لغز برهاني" مختلف.

  • كل لغز هو مهمة محددة من مشروع برمجيات مفتوح المصدر (مثل بلوكشين آمن أو مترجم لغات برمجة).
  • لحل اللغز، لا يمكن للذكاء الاصطناعي مجرد البحث عن قاعدة قياسية. عليه أن يتجول في المستودع، ليجد الأداة المخصصة التي اخترعها المشروع بالأمس، ويفهم كيف تتصل بأداة أخرى من ملف يبعد ثلاثة ملفات، ثم يكتشف كيفية استخدامها لإصلاح المشكلة الحالية.
  • إنه الفرق بين حل لغز "سودوكو" (قواعد قياسية) ومحاولة إصلاح محرك سيارة حيث الكتيب الخاص بها مكتوب بشفرة سرية خاصة بهذا الطراز من السيارات فقط.

التجربة: طريقتان لمساعدة المتدرب
اختبر الباحثون الذكاء الاصطناعي تحت ظروف مختلفة لمعرفة كيفية تعامله مع هذه الفوضى:

  1. "الصندوق المنسق" (المرشد المتعاون):
    تخيل مرشداً ينظر إلى اللغز، ويجد فقط الأدوات والمخططات التي يحتاجها الذكاء الاصطناعي بالضبط، ثم يسلمها له في صندوق صغير ومرتب.
  • النتيجة: أدى الذكاء الاصطناعي بشكل جيد (حوالي 40% نجاح). كان بإمكانه حل اللغز عندما تم القيام بالعمل الشاق المتمثل في العثور على الأدوات الصحيحة نيابة عنه.
  1. "المستودع الكامل" (الغوص في الطوفان):
    تخيل إلقاء الذكاء الاصطناعي في المستودع بأكمله مع ملايين الأدوات والمخططات والقطع العشوائية الأخرى، وإخباره: "حظاً موفقاً، ابحث عما تحتاجه!"
  • النتيجة: أصيب الذكاء الاصطناعي بالارتباك. انخفضت معدلات النجاح بشكل كبير. جعل حجم "الضجيج" الهائل من الصعب العثور على "الإشارة".

الاكتشافات الرئيسية (لحظات الـ "آها!")

  • خبراء الرياضيات ليسوا خبراء برمجيات: نماذج الذكاء الاصطناعي التي تعد أبطالاً في حل المسائل الرياضية (مثل تلك المدربة على Mathlib) انهارت تماماً عند مواجهة هذه الألغاز البرمجية. لقد كانوا مثل لاعب شطرنج عظيم يحاول لعب البوكر؛ فالمهارات لم تنتقل.
  • "تأثير الدومينو" للصعوبة: كلما زادت صعوبة اللغز، زادت "التبعيات المتعدية" فيه.
    • تشبيه: تخيل وصفة طعام. الوصفة البسيطة تحتاج دقيقاً وبيضاً. أما الوصفة المعقدة فتحتاج دقيقاً، ولكن الدقيق يعتمد على نوع معين من القمح، والذي يعتمد بدوره على سماد معين، والذي يعتمد بدوره على نمط مطر معين.
    • في VeriSoftBench، لكي يحل الذكما الاصطناعي مشكلة ما، غالباً ما يتعين عليه تتبع سلسلة من 10 أو 20 تعريفاً مخصصاً داخل الكود. وكلما طالت السلسلة، زاد احتمال ضياع الذكاء الاصطناعي.
  • السياق سلاح ذو حدين: إعطاء الذكاء الاصطناعي الكثير من المعلومات (المستودع الكامل) كان أسوأ من إعطائه (الصندوق المنسق) الذي يحتوي على القدر المناسب فقط. ومع ذلك، حتى مع وجود "الصندوق المثالي" من الأدوات، ظل الذكاء الاصطناعي يعاني. وهذا يعني أن المشكلة ليست فقط في إيجاد المعلومات الصحيحة؛ بل في الاستنتاج المنطقي عبر منطق مخصص ومعقد لم يره الذكاء الاصطناعي من قبل.

لماذا هذا مهم؟
حالياً، الذكاء الاصطناعي رائع في "الرياضيات المدرسية" لكنه سيء في "الهندسة في العالم الحقيقي". هذه الورقة تطلق جرس إنذار: إذا أردنا للذكاء الاصطناعي أن يساعدنا في كتابة برمجيات آمنة وخالية من الأخطاء (مثل السيارات ذاتية القيادة أو الأجهزة الطبية)، فلا يمكننا فقط تدريبه على المسائل الرياضية. نحن بحاجة لتعليمه كيفية التنقل في قواعد بيانات برمجية مخصصة وفوضوية حيث يتم ابتكار القواعد أثناء العمل.

باختأصر:
تقول الورقة: "لقد بنينا اختباراً جديداً يحاكي هندسة البرمجيات الحقيقية. وجدنا أن الذكاء الاصطناعي الحالي يشبه طالباً اجتاز الامتحان النهائي بتفوق، لكنه لا يستطيع إصلاح صنبور يسرب الماء لأن الصنبور يستخدم قطعة مخصصة لم يرها من قبل. نحن بحاجة لتعليمه كيفية التنقل في الورشة الفوضوية، وليس فقط في الفصل الدراسي النظيف."

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →