← أحدث الأبحاث
🤖 AI

CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

إنَّ CAGE هو إطار عمل لاعتماد الوكلاء البرمجيين القائمين على النماذج اللغوية الكبيرة (LLMs) الذين يستخدمون الأدوات، والذي يضمن بقاء الإجراءات المصرح بها صالحة في ظل الجمع بين أخطاء الربط المنفصلة والانجراف العددي المستمر، وذلك عبر التصديق المباشر على الجوارات المشتركة، مما يقضي على النتائج الإيجابية الزائفة التي تنشأ عن معالجة القنوات الفئوية والعددية بشكل منفصل.

المؤلفون الأصليون: Blaise Delattre, Cong Wang, Yang Cao

نُشر 2026-08-03
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Blaise Delattre, Cong Wang, Yang Cao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

ملخص تقني: CAGE (التفويض المعتمد تحت عدم اليقين للقيم المرتجعة النوعية)

1. بيان المشكلة

تتناول الورقة ثغرة أمنية حرجة في الوكلاء القائمين على النماذج اللغوية الكبيرة (LLM) المستخدمة للأدوات. فبينما تستخدم أطر عمل الوكلاء المنتشرة بوابات تصريح في وقت التشغيل (runtime permission gates) لترخيص استدعاءات الأدوات، فإن هذه البوابات تقيم عادةً نتيجة الأداة الملاحظة والإجراء المقترح في نقطة زمنية واحدة. وهي تفشل في مراعاة عدم اليقين المتبقي في الربط (residual binding uncertainty): وهو احتمال أن السجل الذي تم التحقق منه والملاحظ من قبل الوكيل (z~\tilde{z}) يختلف عن النتيجة "المربوطة بشكل صحيح" (zz^\star) بسبب أخطاء تجميع طفيفة (مثل: وسوم المصدر القديمة، أو عدم تطابق المخططات، أو حالات التسابق/race conditions) والانحراف الرقمي المحدود.

تتمثل المشكلة الجوهرية في أن إجراءً ما قد يبدو آمناً بموجب السجل الملاحظ، وحتى بموجب فحوصات منفصلة للاضطرابات المنفصلة (الفئوية) والمتصلة (الرقمية)، ومع ذلك يصبح غير آمن عندما تحدث هذه الاضطرابات بشكل مشترك. ويطلق المؤلفون على هذا الأمر اسم هجوم الفجوة المشتركة (joint-gap attack). إن الدفاعات الحالية، التي تركز غالباً على تنقية النصوص غير الموثوقة أو تقييم الإجراءات عند نقاط محددة، تترك حدود القرار غير محمية ضد حالات عدم اليقين الدلالي المحددة هذه.

2. المنهجية: CAGE

يقترح المؤلفون CAGE (بوابة التفويض المعتمدة للتنفيذ)، وهو مراقب في وقت التشغيل ينقل موضوع التفويض من النقطة الملاحظة (z~,a)(\tilde{z}, a) إلى جوار مشترك Bd,ϵ(z~)B_{d,\epsilon}(\tilde{z}). لا يتم التصريح بالإجراء aa إلا إذا ظل آمناً لكل نتيجة محتملة ومربوطة بشكل صحيح داخل هذا الجوار.

الجوار المشترك

يتم تعريف الجوار من خلال ميزانيتين:

  • الميزانية المنفصلة (dd): تسمد بحد أقصى dd من أخطاء الربط المقبولة (على سبيل المثال: تبديل واحد في مصدر البيانات أو ارتباك في حزمة السياسات).
  • الميزانية المتصلة (ϵ\epsilon): تسمد بانحراف 2\ell_2 محدود في الحقول الرقمية (مثل: درجات المخاطر، أو المبالغ) بعد التحقق القياسي.

نظرية عدم التركيب (Non-Composition Theorem)

المساهمة النظرية المركزية هي إثبات أن الشهادات المنفصلة للقنوات لا تتراكم (do not compose).

  • النظرية 1: قد يكون محدد السلامة (safety predicate) آمناً تحت جميع الاضطرابات المتصلة للحالة المنفصلة الأصلية، وآمناً تحت جميع التبديلات المنفصلة للقيمة المتصلة الأصلية، ومع ذلك يكون غير آمن تحت تأثير مشترك لتبديل منفصل وإزاحة متصلة.
  • الاستنتاج: الشهادات الهامشية (فحص النصوص والأرقام بشكل منفصل) هي غير سليمة منطقياً. يجب على الدفاع أن يعتمد شهادة حاصل الضرب الديكارتي للاضطرابات المنفصلة والمتصلة.

خوارزمية CAGE

تعمل CAGE من خلال الحصر الدقيق (exact enumeration) للجوار المنفصل يليه الاعتماد الصوتي (sound certification) للفرع المتصل:

  1. الحصر: حساب مجموعة الجيران المنفصلين المحدودة Nd(s)={s:Ddisc(s,s)d}N_d(s) = \{s' : D_{disc}(s, s') \le d\}.
  2. اعتماد الفروع: لكل جار منفصل ss'، يتم اعتماد أن الإجراء آمن لجميع الاضطرابات المتصلة xx' ضمن الكرة ϵ\epsilon.
  3. القرار: السماح بالإجراء فقط إذا اجتازت كل فرع اختبار الاعتماد المتصل الخاص به.

سلم الافتراضات (الخلفيات/Backends)

يدعم CAGE خلفيات مختلفة اعتماداً على طبيعة السياسة (سواء كانت قابلة للتنفيذ أو متعلمة):

  • CAGE-Exact (المستوى 1): يُستخدم عندما تكون السياسة محدداً قابلاً للتنفيذ (مثل: القيود الخطية في Rego أو جداول القرار). يقوم بإجراء تحقق رياضي دقيق للقيود عبر الكرة ϵ\epsilon. هذا هو السياسة المعتمدة (policy-certified).
  • CAGE-Lip (المستوى 2): يُستخدم للبوابات المتعلمة (السياسات الضمنية). يستخدم بنية شبكة عصبية ذات خاصية ليبشيتز واحدة (1-Lipschitz). يقوم باعتماد قرار البوابة بناءً على هامش ليبشيتز (hθ>Lcertϵh_\theta > L_{cert}\epsilon). هذا هو البوابة المعتمدة (gate-certified) وهو سليم تحت فرضية دقة سياسة البوابة المقاسة.
  • CAGE-RS (المستوى 3): يُستخدم للبوابات الصندوق الأسود (black-box gates). يطبق التنعيم العشوائي (Randomized Smoothing) لتوفير ضمانات احتمالية عبر الكرة المتصلة. هذا أيضاً هو البوابة المعتمدة (gate-certified).

3. المساهمات الرئيسية

  1. صياغة التفويض القوي: تصيغ الورقة عملية التفويض ما بعد عودة الأداة كقرار تحت عدم يقين نوعي محدود، وتثبت أن السلامة المعتمدة على النتيجة تتطلب فحص النتيجة المحققة (الافتراض 1).
  2. إثبات عدم التركيب: يثبت المؤلفون أن الشهادات الهامشية للقنوات المنفصلة والمتصلة لا تعني السلامة على حاصل ضربهما المشترك، مما يحدد وجود "شهود الفجوة المشتركة" (النظرية 1).
  3. مراقب معتمد مع سلم افتراضات: يوفر CAGE إطاراً موحداً يحصر الفضاء المنفصل بدقة ويعتمد الفضاء المتصل باستخدام خلفيات متنوعة (Exact, Lipschitz, Smoothing)، مما يضمن حداً أدنى من السلامة حتى للبوابات المتعلمة.
  4. حالة سلامة مقاسة: يقدم العمل حالة سلامة صارمة تمت معايرتها بناءً على أخطاء محقونة، مما يثبت أن CAGE يزيل عمليات "السماح الخاطئ" (false allows) ضمن الميزانية مع الحفاظ على الاستقلالية المفيدة.

4. النتائج التجريبية

يشمل التقييم بيئات اصطناعية، وسياسات كأكواد (Open Policy Agent, GoRules)، وأطر تنظيمية (PSD2/AML)، وبيانات معاملات حقيقية (IEEE-CIS).

  • وجود شهود الفجوة المشتركة: تؤكد الدراسة أن شهود الفجوة المشتركة موجودون في كل الإعدادات، وبترددات طبيعية تتراوح بين 3.5% إلى 12%.
  • السلامة (Soundness): عبر جميع الإعدادات، حقق CAGE معدل سماح خاطئ معتمد (CFA) قدره 0. في المقابل، تسمح البوابات النقطية (pointwise) وخطوط الأساس المكونة هامشياً بهذه الشهود غير الآمنة بمعدلات عالية (غالباً 100% من مجموعة الشهود).
  • الاستقلالية (Autonomy): رغم ضمانات السلامة الصارمة، يحتفظ CAGE باستقلالية كبيرة:
    • يمرر CAGE-Exact تلقائياً 22–34% من القرارات الآمنة والقوية في إعدادات "السياسة ككود" و 57% في حركة المرور الطبيعية.
    • تحتفظ الخلفيات المتعلمة (Lip/RS) باستقلالية تتراوح بين 6.5–37% اعتماداً على صرامة نقطة التشغيل.
  • التحقق الشامل (End-to-End): في اختبارات الأنظمة الحية (Kubernetes, MCP write paths, AML engines)، نجح CAGE في منع الآثار الجانبية غير الآمنة (مثل: عمليات النشر غير المصرح بها، أو الكتابة التي تتجاوز الحصة المخصصة) التي سمحت بها الأنظمة غير المحممة أو المحمية ببوابات نقطية.
  • الهجمات التكيفية: يظل CAGE سليماً ضد المهاجمين التكيفيين الذين يعرفون السياسة والميزانية، بينما تعاني البوابات النقطية المتعلمة من معدلات سماح خاطئ عالية (تصل إلى 98% في بعض الهجمات الاصطناعية).

5. الأهمية والادعاءات

تدعي الورقة أن CAGE يوفر آلية تفويض معايرة للقرارات التي تعتمد فيها السلامة على عروض نوعية غير يقينية. تكمن أهميته في:

  • سد الفجوة المنطقية: إنه أول نظام يصيغ رسمياً الجوار المشترك للقيم المرتجعة النوعية، معالجاً ثغرة أمنية تغفل عنها الدفاعات النقطية والهامشية.
  • قابلية النشر العملي: من خلال تقديم "سلم افتراضات"، فإنه يجسّر الفجوة بين السياسات المثالية القابلة للتنفيذ والبوابات المتعلمة العملية، مما يوفر ضمانات رسمية حتى للأخيرة تحت شروط دقة صريحة.
  • الواقعية التشغيلية: يفصل العمل صراحةً بين الضمان الرسمي والاشتراطات المسبقة التشغيلية (مثل: حداثة البيانات، ونزاهة المنشئ). كما يحدد "المخاطر المتبقية" عندما تفشل هذه الاشتراطات (مثل: إذا تجاوز تقادم البيانات الميزانية المعلنة)، بدما لا يدعي الحصانة المطلقة.

المؤلفون متواضعون بشأن ادعاءات الصلاحية الخارجية: فهم يثبتون وجود، وقابلية تحقيق، وآلية هجمات الفجوة المشتركة في خطوط الإنتاج المستعملة، لكنهم لا يدعون أنهم قاموا بقياس مدى انتشار هذه الأخطاء المحددة في جميع الأنظمة الوكيلية في العالم الحقيقي. ويخلصون إلى أن CAGE هو تحكم ضروري في وقت التشغيل حيثما يمكن قياس وفرض عدم اليقين في القيم المرتجعة النوعية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →