← أحدث الأبحاث
💬 NLP

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

تقدم هذه الورقة Verus-SpecGym، وهي بيئة ومعيار تقييمي (benchmark) لوكيل ذكاء اصطناعي لتقييم قدرة النماذج اللغوية الكبيرة على ترجمة المشكلات البرمجية غير الرسمية إلى مواصفات رسمية دقيقة للتحقق من لغة Rust، كاشفةً أنه في حين تُظهر النماذج الرائدة بوادر واعدة، إلا أن مخرجاتها تظل هشة وعرضة لأخطاء دقيقة غالباً ما تغفل عنها أدوات التقييم القياسية المعتمدة على النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parno, Sean Welleck

نُشر 2026-05-27
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parno, Sean Welleck

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مهندسًا آليًا (روبوت) عبقريًا ولكنه حرفي للغاية لبناء منزل. تعطي الروبوت تعليمات بسيطة بلغة طبيعية: "ابنِ منزلاً دافئًا مكونًا من غرفتي نوم مع باب أحمر ونافذة كبيرة تطل على الشارع".

الروبوت مذهل في اتباع التعليمات؛ يمكنه بناء منزل مثالي يطابق وصفك. ولكن هنا تكمن المشكلة: كيف تعرف أن الروبوت قد فهم حقًا ما كنت تقصده؟

إذا بنى الروبوت منزلًا بباب أحمر ولكن بدون نوافذ، أو بنى منزلًا بباب أزرق لأنه "ظن" أنك تقصد الأزرق، فقد فشل. في عالم علوم الحاسوب، هذا هو الفرق بين كتابة كود يبدو صحيحًا وبين كتابة كود صحيح رياضيًا ومضمون تمامًا.

هذه الورقة البحثية، Verus-SpecGym، تدور حول تعليم وكلاء الذكاء الاصطناعي كيفية كتابة المخطط (المواصفات الرسمية) الذي يضمن أن المنزل يطابق نيتك، وليس مجرد بناء المنزل نفسه.

المشكلة الجوهرية: فجوة "الترجمة"

في الماضي، ركز الباحثون على جعل الذكاء الاصطناعي يكتب الكود (المنزل). الآن، أصبح الذكاء الاصطناعي جيدًا في ذلك. العائق الجديد هو الترجمة.

  • نيتك: "اجعل المنزل بباب أحمر." (لغة طبيعية، غير رسمية)
  • المخطط: قاعدة رياضية صارمة تقول IF door_color == red THEN valid ELSE invalid. (لغة منطقية، رسمية)

إذا كتب الذكاء الاصطناعي مخططًا يقول "يجب أن يكون الباب أحمر أو أزرق"، فهذا مخطط سيء؛ إنه فضفاض للغاية. وإذا قال "يجب أن يكون الباب أحمر والسماء خضراء"، فهو شديد الصرامة للغاية. يحتاج الذكاء الاصطناعي إلى ترجمة رغبتك البشرية الغامضة إلى قاعدة منطقية مثالية وغير قابلة للكسر. يُطلق على هذا اسم الأتمتة التلقائية للمواصفات (Specification Autoformalization).

الحل: Verus-SpecGym و Verus-SpecBench

ابتكر المؤلفون "صالة ألعاب رياضية" (بيئة تدريب واختبار) لمعرفة ما إذا كان بإمكان وكلاء الذكاء الاصطناعي القيام بمهمة الترجمة هذه.

  1. الساحة (Verus-SpecGym): هي ساحة رقمية حيث يُعطى وكيل الذكاء الاصطناعي لغزًا برمجيًا (مثل مسألة رياضية من موقع مسابقات يسمى Codeforces). يتعين على الوكيل كتابة "المخطط" (المواصفات الرسمية) بلغة خاصة تسمى Verus (وهي تشبه نسخة شديدة الصرامة من لغة Rust).
  2. الاختبار (Verus-SpecBench): قاموا ببناء بنك اختبار ضخم يحتوي على 581 لغزًا. لكنهم لم يسألوا فقط: "هل كتب الذكاء الاصطناعي مخططًا؟" بل سألوا: "هل المخطط أمين (faithful)؟"

كيف اختبروا المخططات (خدعة "القابلية للتنفيذ")

عادةً ما يتطلب التحقق مما إذا كان المخطط مثاليًا وجود خبير بشري يقرأه ويقول: "نعم، هذا يطابق الفكرة". وهذا أمر بطيء ومكلف. أو يمكنهم استخدام ذكاء اصطناعي آخر للحكم عليه، لكن نماذج الذكاء الاصطناعي قد تكون كسولة أو تغفل عن الأخطاء الدقيقة.

ابتكر المؤلفون خدعة ذكية: جعلوا المخططات قابلة للتنفيذ (executable).

فكر في الأمر على النحو التالي:

  • عادةً، المخطط هو مجرد رسم على الورق. لا يمكنك "تشغيل" رسم.
  • قام المؤلفون بتعديل نظام Verus بحيث يمكن تحويل المخطط إلى آلة.
  • ثم قاموا بتغذية هذه الآلة بآلاف حالات الاختبار:
    • مدخلات صالحة: "هذا باب أحمر." (يجب أن تقول الآلة: نجاح!)
    • مدخلات غير صالحة: "هذا باب أزرق." (يجب أن تقول الآلة: فشل!)
    • "الخدع" (The Hacks): هذا هو السر. في المسابقات البرمجية، يكتب البشر "خدعًا" (hacks)—وهي مدخلات غريبة ومخادعة مصممة لكسر حلول الآخرين. استخدم المؤلفون هذه الخدع التي كتبها البشر كـ "اختبارات ضغط". إذا قبل مخطط الذكاء الاصطناعي "خدعة" تكسر القواعد، فإن المخطط معيب.

النتائج: ذكي ولكنه هش

قاموا باختبار ستة من أذكى نماذج الذكاء الاصطناعي (سواء كانت نماذج ضخمة مغلقة المصدر أو نماذج مفتوحة المصدر) في هذه الساحة.

  • الأخبار الجيدة: حصل أفضل ذكاء اصطناعي (Gemini 3.1 Pro) على حوالي 78% من المخططات بشكل صحيح. إنه يصبح جيدًا جدًا في ترجمة النية البشرية إلى قواعد صارمة.
  • الأخبار السيئة: حتى عندما استطاع الذكاء الاصطناعي كتابة الكود لحل المسألة بشكل مثالي، فإنه غالبًا ما فشل في كتابة المخطط لنفس تلك المسألة.
    • التشبيه: يمكن للذكاء الاصطناعي بناء منزل مثالي، لكنه كتب مخططًا يقول "يجب أن يكون المنزل مصنوعًا من الجبن". المنزل قائم، لكن المخطط خاطئ.
  • أنماط الفشل: ارتكب الذكاء الاصطناعي ثلاثة أنواع محددة من الأخطاء:
    1. الافتراضات المفقودة: نسي أن يقول "يجب أن يكون الباب أحمر"، لذا قبل بابًا أزرق.
    2. قبول المخرجات السيئة: اعتقد أن النافذة المكسورة أمر مقبول.
    3. رفض المخرجات الجيدة: كان شديد الصرامة ورفض بابًا أحمر صالحًا لأنه كان "لامعًا أكثر من اللازم".

لماذا هذا مهم (وفقًا للورقة البحثية)

تجادل الورقة بأن التحقق من المخطط أصعب من بناء المنزل.

وجدوا أيضًا أن استخدام ذكاء اصطناعي آخر للحكم على المخطط (حكم LLM) هو أمر غير موثوق به. لقد أغفل "حكم LLM" 26% من الأخطاء التي اكتشفها اختبار "الآلة القابلة للتنفيذ" الخاص بهم. اختبار الآلة هو الطريقة الوحيدة للتأكد من أن المخطط أمين حقًا لنية الإنسان.

الملخص

تقدم هذه الورقة طريقة جديدة لاختبار الذكاء الاصطناعي: هل يمكنه ترجمة رغبتك الغامضة إلى قاعدة مثالية وغير قابلة للكسر؟

  • أنشأوا صالة ألعاب (Verus-SpecGym) وبنك اختبار (Verus-SpecBench) باستخدام ألغاز برمجية حقيقية.
  • جعلوا القواعد "قابلة للتشغيل" حتى يتمكنوا من اختبارها ضد "الخدع" البشرية المعقدة.
  • وجدوا أنه بينما يتقدم الذكاء الاصطناعي في هذا المجال، إلا أنه لا يزال هشًا (brittle). غالبًا ما يكتب قواعد فضفاضة للغاية أو صارمة للغاية، حتى عندما يعرف كيفية حل المسألة.
  • الخلاصة: لا يمكننا فقط الوثوق بالذكاء الاصطناعي لكتابة الكود؛ نحن بحاجة للوثوق به لكتابة القواعد التي تثبت صحة الكود. وحالياً، لا يزال يعاني مع هذه القواعد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →