← أحدث الأبحاث
🤖 machine learning

Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis

تقدم الورقة البحثية Quokka، وهو إطار عمل متمحور حول التقييم يسخر النماذج اللغوية الكبيرة للتحقق المباشر من ثوابت الحلقات وتوليفها لأغراض التحقق من البرامج، مُظهرةً أداءً رائدًا من خلال اختبار معياري شامل يضم 866 حالة وتكوينات مختلفة من النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Anjiang Wei, Tianran Sun, Tarun Suresh, Haoze Wu, Ke Wang, Alex Aiken

نُشر 2026-04-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Anjiang Wei, Tianran Sun, Tarun Suresh, Haoze Wu, Ke Wang, Alex Aiken

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول إثبات أن آلة معقدة (برنامج كمبيوتر) لن تتعطل أبداً أو تفعل شيئاً خطيراً. في عالم البرمجيات، يسمى هذا التحقق من البرامج (Program Verification).

لإثبات أن الآلة تعمل للأبد، تحتاج إلى "قاعدة سحرية" تسمى ثابت الحلقة (Loop Invariant). فكر في "الحلقة" في البرنامج مثل هامستر يركض على عجلة. الثابت هو قاعدة تظل صحيحة مهما عدد المرات التي ركض فيها الهامستر. على سبيل المثال: "الهامستر دائماً على العجلة" أو "سرعة الهامستر دائماً موجبة". إذا تمكنت من إيجاد قاعدة قوية بما يكفي، يمكنك إثبات أن الآلة لن تتعطل أبداً.

المشكلة؟ العثور على هذه القواعد أمر صعب للغاية. إنه يشبه محاولة تخمين الرقم السري لخزنة دون أي أدلة.

هنا يأتي دور Quokka، وهي أداة جديدة موصوفة في هذه الورقة البحثية. إليك كيف تعمل، مشروحة ببساة:

1. الطريقة القديمة: الميكانيكي "المبالغ في هندسته"

في السابق، حاول الباحثون استخدام الذكاء الاصطناعي (النماذج اللغوية الكبيرة، أو LLMs) لتخمين هذه القواعد. لكنهم عاملوا الذكاء الاصطناعي كأنه متدرب أخرق يستمر في ارتكاب الأخطاء.

  • النهج: كانوا يطلبون من الذكاء الاصطناعي اقتراح قاعدة، ثم يبنون آلة ضخمة ومعقدة لـ "إصلاح" إجابة الذكاء الاصطناعي. كانوا يقومون بتصفية، وإعادة تجميع، وإصلاح مخرجات الذكاء الاصطناعي، آملين في تحويل تخمين فوضوي إلى برهان متين.
  • العيب: كان الأمر يشبه استئجار طاهٍ عبقري لطهي وجبة، ولكن بعد ذلك تجبر فريقاً من 10 مساعدي طهاة على تذوق وتقطيع وتتبيل كل مكون قبل تقديمه. كان الأمر بطيئاً، ومعقداً، وغالباً ما يخطئ في جوهر الموضوع.

2. طريقة Quokka: "القاضي المباشر"

سأل مؤلفو هذه الورقة، بقيادة Anjiang Wei، سؤالاً بسيطاً: "ماذا لو توقفنا عن محاولة إصلاح إجابات الذكاء الاصطناعي واكتفينا بطلب تخمين من الذكاء الاصطناعي، ثم تحققنا فوراً مما إذا كان يعمل؟"

لقوا إطار عمل Quokka، الذي يعمل كقاضٍ صارم وعادل:

  1. الطلب: يطلبون من الذكاء الاصطناعي (LLM) اقتراح قاعدة (ثابت) لجزء معين من الكود.
  2. الاختبار: بدلاً من محاولة إصلاح القاعدة، يقومون فوراً بتغذيتها إلى "مُحقِّق" (وهو روبوت رياضي شديد الصرامة).
  3. الحكم:
    • هل القاعدة صحيحة؟ (هل يبقى الهامستر على العجلة؟)
    • هل القاعدة مفيدة؟ (هل القاعدة قوية بما يكفي لإثبات أن الآلة لن تتعطل؟)

إذا ساعدت القاعدة في إثبات أن الآلة آمنة، فقد فاز Quokka. وإذا لم تكن كذلك، ينتقل إلى غيرها. إنه لا يضيع الوقت في محاولة "إصلاح" تخمين سيء؛ بل يتحقق فقط مما إذا كان التخمين مفيداً.

3. لماذا يعد هذا أمراً هاماً

  • البساطة هي القوة: من خلال إزالة آليات "الإصلاح" المعقدة، يعد Quokka أسرع وأكثر كفاءة. إنه يشبه إدراك أنه بدلاً من بناء مصنع لإصلاح الألعاب المكسورة، فأنت تحتاج فقط إلى مراقب جودة جيد.
  • المعيار المرجعي: أنشأ الفريق مجموعة اختبار ضخمة تضم 866 لغزاً برمجياً صعباً (مجموعة بيانات "SV-COMP"). إنها تشبه "الأولمبياد" لأدوات التحقق من البرامج.
  • النتائج: تفوق Quokka، المدعوم بنماذج ذكاء اصطناعي ذكية، على جميع الطرق المعقدة السابقة. لقد حل المزيد من المشكلات وفعل ذلك بشكل أسرع.

4. تدريب الذكاء الاصطناعي

تظهر الورقة أيضاً أنه يمكنك جعل الذكاء الاصطناعي أفضل.

  • الضبط الدقيق (Fine-Tuning): قاموا بتعليم الذكاء الاصطناعي من خلال إظهار آلاف الأمثلة للقواعد الصحيحة له. إنه يشبه إعطاء المتدرب كتاباً مدرسياً يحتوي على حلول مثالية.
  • أفضل من بين N (Best-of-N): طلبوا من الذكاء الاصطناعي توليد 8 تخمينات مختلفة واختاروا أفضلها عملاً. إنه يشبه طلب من طاهٍ طهي 8 نسخ من طبق ما وتقديم أفضل نسخة منها فقط.

الخلاصة

يثبت Quokka أننا لسنا بحاجة إلى تعقيد كيفية استخدامنا للذكاء الاصطناعي في المهام الحساسة للسلامة. بدلاً من محاولة "إصلاح" مخرجات الذكاء الاصطناعي بخوارزميات معقدة، يجب أن نترك الذكاء الاصطنا الرئيسي يقترح الأفكار ونستخدم مُحقِّقاً قوياً للتحقق مما إذا كانت تلك الأفكار تعمل بالفعل.

إنه تحول من "كيف نصلح أخطاء الذكاء الاصطناعي؟" إلى "كيف نجد بسرعة أفضل أفكار الذكاء الاصطناعي؟"

باختًا: Quokka هو طريقة جديدة، أبسط، وأسرع لاستخدام الذكاء الاصطناعي لإثبات أن البرامج الكمبيوترية آمنة، متفوقاً على جميع الطرق السابقة من خلال الثقة في الأفكار الخام للذكاء الاصطناعي وترك روبوت صارم يتحقق منها فوراً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →