VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
تقدم الورقة البحثية VeriScale، وهو إطار عمل تنافسي يعمل على توسيع وتلخيص مجموعات الاختبار لإنشاء معايير أكثر صرامة مثل VerinaPlus وVerinaLite، والتي تكشف عن نقاط ضعف كبيرة في قدرات النماذج اللغوية الكبيرة (LLMs) في توليد الكود والقدرات المواصفاتية التي تفشل المعايير الحالية في اكتشافها.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف طباخاً آلياً لطهي وجبة معقدة. أنت تعطي الروبوت وصفة (وهي "المواصفات") وتطلب منه طهي الطبق (وهو "الكود"). ولكي تعرف ما إذا كان الروبوت جيداً، تتذوق الطعام.
المشكلة: فخ "الاختبار السهل"
الاختبارات التي نستخدمها حالياً للتحقق من هؤلاء الطهاة الآليين تشبه اختباراً سهلاً للغاية. نحن نعطيهم فقط بعض المكونات البسيطة (مثل "الملح" و"الماء") ونطلب نتيجة بسيطة ("حساء"). إذا صنع الروبوت حساءً، فإننا نمنحه درجة امتياز (A+).
لكن هنا تكم-ن الخدعة. قد يكون الروبوت يغش؛ فقد يكون حفظ الإجابة بأن "ملح + ماء = حساء"، ولكن إذا أعطيته مكوناً غريباً مثل "معجون الأسنان"، فقد يحاول لا يزال صنع الحساء ويدعي أنه صحيح. أو، قد يكتب وصفة تقول "أضف الملح"، لكنه ينسى أن يقول "لا تضف السم". ولأن الاختبار لم يتضمن "معجون الأسنان" أو "السم"، فقد نجح الروبوت، رغم أنه في الواقع خطير أو معطل.
تجادل الورقة البحثية بأن الاختبارات الحالية صغيرة وسهلة للغاية، مما يجعل الذكاء الاصطناعي يبدو أذكى مما هو عليه في الواقع.
الحل: VeriScale (إطار عمل "اختبار الجهد")
ابتكر المؤلفون نظاماً جديداً يسمى VeriScale. فكر في هذا كـ "اختبار جهد" أو تمرين "الفريق الأحمر" (Red Team) لكود الذكاء الاصطناعي. بدلاً من مجرد طلب طبخ الحساء من الذكاء الاصطناعي، يحاول VerilScale خداع الذكاء الاصطناعي لجعله يفشل.
يعمل النظام عبر خطوتين رئيسيتين:
الخطوة 1: "مضمار العقبات" (التوسع)
أولاً، ينشئ VeriScale مضمار عقبات ضخم وفوضوي من المكونات.
- البذرة: يبدأ بمكونات عادية.
- الطفرة: يستخدم "آلة طفرات" لتحريف وتغيير هذه المكونات. يحول كوباً من الماء إلى دلو من الثلج، أو رشة ملح إلى جبل من الملح. إنه يخلق سيناريوهات غريبة وحالات استثنائية (edge-case) لم يسبق للذكاء الاصطناعي رؤيتها.
- الطباخ "المخادع" (التخليق العدائي): هذا هو الجزء الذكي؛ حيث يطلب VeriScale من ذكاء اصطناعي آخر، ذكي جداً، أن يلعب دور "المخادع". يحاول هذا المخادع كتابة وصفة مزيفة تبدو وكأنها تتبع القواعد ولكنها تنتج في الواقع شيئاً تافهاً.
- مثال: إذا كانت القاعدة هي "يجب أن يكون الحساء ساخناً"، فقد يكتب المخادع وصفة تنتج "آيس كريم" ويدعي: "حسناً، تقنياً، الآيس كريم هو طعام، لذا فقد اتبعت القاعدة!".
- يقوم VeriScale بتشغيل وصفات "المخادع" هذه مقابل قواعد الذكاء الاصطناعي. إذا قبلت قواعد الذكاء الاصطناعي "الآيس كريم" على أنه "حساء ساخن"، فإن VeriScale يكشف الخلل. إنه يولد قائمة ضخمة من لحظات "الإيقاع في الفخ" هذه.
الخطوة 2: "قائمة التحقق الأساسية" (الاختزال)
الآن، يمتلك VeriScale الآلاف من حالات الاختبار الماكرة هذه. تشغيل كل هذه الحالات على كل ذكاء اصطناعي سيستغرق وقتاً طويلاً جداً وسيكلف ثروة. لذلك، يقوم بعملية "اختزال".
- يسأل: "أي من هذه الخدع الـ 1,000 هي الأكثر أهمية؟"
- يحتفظ بالخدع المحددة التي تكشف أكبر عدد من الأخطاء ويتخلص من تلك التي ليست سوى تكرار لغيرها.
- النتيجة هي اختبار مدمج وشديد التحدي، وهو صغير بما يكفي ليتم تشغيله بسرعة، ولكنه لا يزال قادراً على كشف كل خلل يمكن أن تجده القائمة الضخمة.
النتائج: "مصل الحقيقة"
اختبر المؤلفون هذا النظام الجديد على أفضل نماذج الذكاء الاصطناعي المتاحة (مثل GPT-5.5 وغيرها).
- الاختبار القديم: حصلت نماذج الذكاء الاصطناعي على درجات مثل 96% أو 98%. بدت وكأنها عباقرة.
- اختبار VeriScale: عند وضعه تحت اختبار الجهد، انخفضت الدرجات بشكل كبير. انخفضت درجة أحد النماذج العليا من 96% إلى 86% في البرمجة، ومن 68% إلى 44% في كتابة القواعد (المواصفات).
الخلاصة الكبرى
تظهر الورقة البحثية أن الاختبارات القديمة كانت تكذب علينا. لقد كانت تبالغ في تقدير مدى جودة الذكاء الاصطناعي في كتابة كود آمن وصحيح. اختبار "VeriScale" الجديد يكشف أنه بينما يجيد الذكاء الاصطناعي كتابة الكود الذي يبدو صحيحاً، إلا أنه لا يزال سيئاً جداً في كتابة القواعد التي تكتشف كل خطأ محتمل.
لقد أصدروا أيضاً نسختين من هذا الاختبار الجديد:
- VERINAPLUS: اختبار الجهد الكامل والضخم (أكبر بـ 83 مرة من الاختبار الأصلي).
- VERINALITE: النسخة "المخففة". وهي أكبر بـ 14 مرة من الأصل، ولكنها تستخدم خدعة "الاختزال" لتكون سريعة ورخيصة، ومع ذلك تكتشف نفس الأخطاء.
باخت-صار، VeriScale هو أداة تمنعنا من الانخداع بالذكاء الاصطناعي الذي يعرف فقط كيف يجتاز الاختبارات السهلة. إنه يجبر الذكاء الاصطناعي على إثبات قدرته على التعامل مع العالم الحقيقي الغريب، الفوضوي، والمخادع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.