Uncertainty Quantification for LLM-based Code Generation
تقدم هذه الورقة RisCoSet، وهو إطار عمل مبتكر يستفيد من اختبار الفرضيات المتعددة لإنشاء مجموعات تنبؤ تتحكم في المخاطر لتوليد الكود القائم على النماذج اللغوية الكبيرة، مما يتغلب بفعالية على قيود الأساليب الحالية من خلال استيعاب المخرجات الصالحة المتعددة وتقليل إزالة الكود غير الضروري بشكل كبير مع الحفاظ على ثقة عالية في الصحة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تطلب من ذكاء اصطناعي موهوب للغاية ولكنه مفرط في الثقة أحياناً أن يكتب لك برنامجاً حاسوبياً. في بعض الأحيان، يكتب الذكاء الاصطناعي كوداً مثالياً، وفي أحيان أخرى "يهلوس"، فيدمج أسطرًا تبدو صحيحة ولكنها في الواقع تُعطل البرنامج.
المشكلة هي: كيف تعرف أي أجزاء من الكود الذي كتبه الذكاء الاصطناعي آمنة للاحتفاظ بها، وأيها خطيرة؟
تقدم هذه الورقة البحثية طريقة جديدة تسمى RISCOSET لحل هذه المشكلة. فكر فيها كـ "شبكة أمان" للكود الذي يولده الذكاء الاصطناعي.
المشكلة في الطرق القديمة
سابقاً، حاول الباحثون استخدام طريقة تسمى PAC (والتي ترمز إلى "الاحتمالية التقريبية الصحيحة" - Probably Approximately Correct).
- التشبيه: تخيل أنك تحاول العثور على مفتاح محدد في درج ضخم وفوضوي مليء بالمفاتيح. كانت الطريقة القديمة (PAC) تتبع قاعدة صارمة: "لا يمكنك النظر إلا في المفاتيح التي تكون أصغر من آخر مفتاح اخترته".
- العيب: كانت هذه القاعدة جامدة للغاية؛ فقد أجبرت الباحثين على التخلص من الكثير من المفاتيح الجيدة المحتملة (أو في هذه الحالة، أسطر الكود) لمجرد اتباع القاعدة. كما افترضت أن هناك إجابة واحدة صحيحة فقط، بينما في البرمجة، غالباً ما توجد طرق مختلفة عديدة لكتابة برنامج يؤدي نفس الشيء تماماً.
الحل الجديد: RISCOSET
يقترح المؤلفون RISCOSET، الذي يستخدم نهجاً أكثر ذكاءً يسمى LTT (التعلم ثم الاختبار - Learn Then Test).
1. "البرنامج الجزئي" (الهيكل العظمي)
بدلاً من محاولة تخمين البرنامج الكامل المثالي، يقوم RISCOSET ببناء "هيكل عظمي" أو "برنامج جزئي".
- التشبيه: تخيل أن الذكاء الاصطناعي يكتب قصة، لكنك لست متأكداً من نهايتها. لا يقوم RISCOSET بحذف القصة بأكملها، بل يسلط الضوء على الجمل غير المؤكدة ويزيل تلك الأجزاء المحددة فقط، مما يترك لك إطاراً صلباً (قصة جزئية) تعلم أنه آمن.
- الهدف: هذا الهيكل العظمي مضمون (بثقة إحصائية عالية) ليكون جزءاً من حل صحيح. يمكنك بعد ذلك ملء الأجزاء المفقودة لاحقاً.
2. ميزة "تعدد الملصقات" (Multi-Label)
افترضت الطريقة القديمة أن هناك إجابة "صحيحة" واحدة فقط. أما RISCOSET فيدرك أنه في البرمجة، توجد العديد من الحلول الصالحة.
- التشبيه: إذا طلبت وصفة لصنع كعكة، فليست هناك طريقة واحدة "صحيحة" فقط. يمكنك استخدام الزبدة أو الزيت؛ يمكنك الخبز في قالب دائري أو مربع. يتقبل RISCOSET وجود نسخ "صحيحة" عديدة، لذا فهو لا يتخلص من الكود الجيد لمجرد أنه يبدو مختلفاً قليلاً عن التخمين الأول.
3. "التنفيذ الانتقائي" (توفير الوقت والمال)
للتأكد من أن "هياكلها العظمية" آمنة، يحتاج النظام إلى اختبار الكود. لكن اختبار كل قطعة من الكود أمر بطيء ومكلف (مثل إجراء اختبار كامل لمحرك السيارة لكل مسمار على حدة).
- التشبيه: يستخدم RISCOSET استراتيجية "التنفيذ الانتقائي". إنه يشبه مفتش الجودة الذي يفحص منتجاً ما؛ إذا بدا المنتج نظيفاً وعالي الجودة (عدم يقين منخفض)، يتخطى المفتش الاختبار الكامل. أما إذا بدا فوضوياً (عدم يقين مرتفع)، فيجري الاختبار الكامل.
- النتيجة: يوفر هذا قدراً هائلاً من الوقت وقوة الحوسبة مع الحفاظ على معدل خطأ منخفض جداً.
ماذا وجدوا؟
اختبر الباحثون هذا على ثلاثة نماذج مختلفة من الذكاء الاصطناعي وثلاث مجموعات بيانات مختلفة للبرمجة.
- هدر أقل: مقارنة بأفضل الطرق الموجودة، قام RISCOSET بإزالة أقل بنسبة 24.5% من أسطر الكود. وهذا يعني أنك تحصل على قدر أكبر من العمل المفيد الذي أنجزه الذكاء الاصطناعي.
- السلامة أولاً: على الرغم من احتفاظهم بمزيد من الكود، إلا أنهم حافظوا على نفس المستوى العالي من ضمانات السلامة. الهيكل العظمي الذي بنوه كان من المرجح أن يحتوي على حل صحيح بنفس قدر الطرق القديمة، ولكن مع حذف أقل ضرورة.
باخت-صار
RISCOSET هو أداة جديدة تساعدنا على الوثوق بالكود الذي يولده الذكاء الاصطناعي بشكل أفضل. بدلاً من التخلص من أجزاء كبيرة من الكود خوفاً من الأخطاء، فإنه ينحت بعناية "هيكلاً عظمياً" آمناً يضمن أن يكون جزءاً من حل يعمل. إنه أكثر ذكاءً، وأقل هدراً، ويحترم حقيقة أن هناك طرقاً عديدة لكتابة كود جيد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.