← أحدث الأبحاث
🤖 AI

LACUNA: Safe Agents as Recursive Program Holes

تُعدُّ LACUNA نموذج برمجة آمنًا لوكلاء النماذج اللغوية الكبيرة (LLMs)، حيث تعامل الأفعال كفجوات برمجية ذات أنواع محددة يملؤها النموذج ويتم التحقق منها عبر فحص الأنواع الساكن قبل التنفيذ، مما يوحد تدفق التحكم الخاص بالوكيل مع الكود المُولَّد مع منع حالات الفشل عند التشغيل وتقييد الوصول إلى الأدوات.

المؤلفون الأصليون: Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

نُشر 2026-05-28
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك المدير التنفيذي لشركة، وقد وظفت مساعداً عبقرياً ولكنه غير موثوق به قليلاً (الذكاء الاصطناعي) للقيام بعملك.

الطريقة القديمة (الوكلاء الحاليون):
عادةً، تعطي المساعد تعليمات محددة وصغيرة جداً: "اتصل بشركة الهاتف". يقوم المساعد بفعل ذلك بالضبط، ثم يتوقف وينتظر أمرك التالي. أنت من يمسك لوحة الملاحظات، ويقرر ترتيب المهام، ويحتفظ بمفاتيح المكتب. لا يمكن للمساعد أن يقرر الاتصال بالبنك بدلاً من ذلك، أو إعادة كتابة قواعد المكتب، لأن لديه زراً واحداً فقط يمكنه ضغطه في كل مرة.

المشكلة:
أحياناً، يرتبك المساعد بسبب ملاحظة مخادعة كتبتها أنت ("حقن الأوامر" أو prompt injection)، أو قد يرتكب خطأً في منتصف المهمة، مما يترك المكتب في حالة فوضوية وغير متسقة. ولأن المساعد مسموح له فقط بضغط الأزرار، فقد لا يستطيع تدمير المبنى، لكنه لا يزال قادراً على إحداث الكثير من الفوضى داخل الغرفة التي يتواجد فيها.

الطريقة الجديدة (LACUNA):
تقدم ورقة البحث LACUNA، التي تغير هذه العلاقة. بدلاً من إعطاء المساعد زراً واحداً ليضغطه، أنت تعطيه مساحة فارغة في عقد ("ثغرة نمطية" أو typed hole) وتقول له: "املأ هذه المساحة بأي كود تحتاه لحل هذه المشكلة، ولكن يجب أن يتناسب تماماً مع عقدنا القانوني".

إليك كيف يعمل ذلك، باستخدام تشبيهات بسيطة:

1. "العقد السحري" (الثغرات النمطية - Typed Holes)

تخيل أن لديك عقداً يقول: "يجب أن تكون النتيجة النهائية لهذا القسم عبارة عن قائمة من الأرقام".

  • أنت تسأل الذكاء الاصطناي: "اذهب واستخرج الأعداد الأولية من هذه القائمة".
  • يكتب الذكاء الاصطناعي فقرة كاملة من التعليمات (الكود) لحل المشكلة.
  • فحص السلامة: قبل أن يُسمح للذكاء الاصطناعي بفعل أي شيء فعلياً، يقوم مفتش صارم (المترجم البرمجي أو الـ compiler) بفحص فقرة الذكاء الاصطناعي.
    • هل تنتج الفقرة بالفعل "قائمة من الأرقام"؟ إذا حاول الذكاء الاصطناعي إرجاع "قائمة من التفاح"، سيرفضها المفتش فوراً.
    • هل حاول الذكاء الاصطناعي استخدام أدوات غير مسموح له بلمسها؟ (مثلاً، محاولة فتح ملف لا يملك مفتاحاً له؟). المفتش سيكتشف هذا أيضاً.
    • النتيجة: إذا ارتكب الذكاء الاصطناعي خطأً، يتم رفض العقد قبل وقوع أي إجراء. يبقى المكتب نظيفاً. يتلقى الذكاء الاصطناعي إشعار الرفض، ثم يحاول مجدداً ويكتب فقرة أفضل.

2. قاعدة "الكل أو لا شيء"

في الطريقة القديمة، إذا حاول الذكاء الاصطناعي "حذف ملف" ثم "حساب مجموع"، وفشل الحساب، فقد يكون الملف قد حُذف بالفعل.
في LACUNA، الأمر يشبه كتلة واحدة غير قابلة للتجزئة من الطين.

  • ينحت الذكاء الاصطناعي الكتلة بأكملها.
  • يقوم المفتش بفحص الكتلة بأكملها دفعة واحدة.
  • إذا كان أي جزء من المنحوتة خاطئاً (الشكل خاطئ، أو المادة خاطئة)، يتم رمي الكتلة بأكملها. لا يحدث شيء. يظل المكتب تماماً كما كان قبل بدء الذكاء الاصطناعي. هذا يمنع الكوارث "نصف المكتملة".

3. "حلقة المفاتيح" (القدرات - Capabilities)

تتحدث الورقة أيضاً عن القدرات. تخيل أن الذكاء الاصطناعي مُنح مجموعة محددة من المفاتيح (حلقة مفاتيح) للوظيفة.

  • إذا كانت الوظيفة هي "قراءة القائمة"، فسيحصل الذكاء الاصطناعي على "مفتاح القائمة".
  • إذا كانت الوظيفة هي "إرسال بريد إلكتروني"، فسيحصل على "مفتاح البريد الإلكتروني".
  • حتى لو تم خداع الذكاء الاصطناعي بواسطة ملاحظة سيئة تقول: "استخدم مفتاح البنك لسرقة الأموال"، فإنه جسدياً لا يستطيع فعل ذلك. هو لا يملك "مفتاح البنك" في جيبه. المفتش يفحص حلقة مفاتيحه قبل أن يُسمح له بتدوير القفل.
  • هذا يعني أنه حتى لو حاول مخترق خداع الذكاء الاصطناعي للقيام بشيء سيء، فإن الذكاء الاصطناعي يفتقر حرفياً إلى "المفاتيح" لفتح تلك الأبواب.

4. "الدمى الروسية المتداخلة" (التكرار - Recursion)

يمكن للذكاء الاصطناعي كتابة كود يتضمن مزيداً من التعليمات لنفسه.

  • أنت تسأل: "اكتب تقريراً عن ثلاثة مواضيع".
  • يكتب الذكاء الاصطناعي خطة تقول: "أولاً، سأطلب من الذكاء الاصطناعي البحث في الموضوع (أ)، ثم الموضوع (ب)، ثم الموضوع (ج)، وأخيراً سأقوم بدمجهم".
  • كل طلب من هذه الطلبات الأصغر هو أيضاً "ثغرة" يتم فحصها من قبل المفتش قبل تشغيلها. إنها مثل مجموعة من الدمى الروسية المتداخلة، حيث يتم فحص كل دمية على حدة قبل السماح لها بالانفتاح.

ما وجده البحث فعلياً

اختبر الباحثون هذا النظام (LACUNA) باستخدام لغة برمجة تسمى Scala 3.

  • السلامة: وجدوا أن "المفتش" كشف حوالي 8.6% من محاولات الذكاء الاصطناعي قبل تشغيلها. كانت هذه المحاولات إما ذات شكل خاطئ أو حاولت استخدام أدوات لم يكن للذكاء الاصطناعي إذن باستخدامها.
  • إعادة المحاولة: عندما يرتكب الذكاء الاصطناعي خطأً، يطلب منه النظام المحاولة مرة أخرى. في المتوسط، استغرق الأمر 0.7 محاولة فقط للحصول على إجابة صالحة.
  • الأداء: حل النظام حوالي 27% من المهام البحثية الصعبة و 76% من مهام خدمة العملاء. كان هذا مساوياً تقريباً للوكلاء التقليديين الآخرين، مما أثبت أن إضافة هذا الفحص الصارم للسلامة لم يجعل الذكاء الاصطناعي "أغبى"، بل جعله أكثر أماناً فحسب.
  • الأمن: اختبروا النظام ضد المخترقين الذين يحاولون خداع الذكاء الاصطناعي (حقن الأوامر). وبسبب محدودية الذكاء الاصطناعي بـ "حلقة المفاتيح" (القدرات)، لم يتمكن المخترقون من جعل الذكاء الاصطناعي يقوم بأشياء خارج نطاق المسموح به، حتى لو نجحوا في خداع الذكاء الاصطناعي لمحاولة القيام بذلك.

العقبات (القيود)

تعترف الورقة ببعض النقاط:

  • ليس مثالياً: المفتش يتحقق مما إذا كان الذكاء الاصطناعي قد اتبع القواعد (هل استخدم الأدوات الصحيحة؟ هل أعاد نوع الإجابة الصحيح؟)، لكنه لا يتحقق مما إذا كان الذكاء الاصطناعي قد فعل الشيء الصحيح منطقياً. إذا كتب الذكاء الاصطناعي كوداً مثالياً يحسب عملية حسابية خاطئة، فإن المفتش سيسمح بمروره.
  • يتطلب ذكاءً اصطناعياً قوياً: إذا لم يكن الذكاء الاصطناعي جيداً في كتابة الكود، فسيتم رفضه كثيراً، وستكون العملية بطيئة.
  • أبطأ: لأن النظام يجب أن يتوقف، ويفحص، ويعيد فحص الكود في كل مرة، فإنه يستغرق وقتاً وقوة حوسبة أكبر مما لو تركنا الذكاء الاصطناعي يضغط على زر فقط.

باختصار، يحول LACUNA الذكاء الاصطناعي من مجرد ضاغط أزرار إلى متعاقد يجب عليه تقديم خطة كاملة للموافقة عليها قبل البدء في أي عمل. إذا خالفت الخطة القواعد، فإن العمل لا يبدأ أبداً، مما يحافظ على سلامة النظام من الأخطاء والحيل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →