Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents
تقدم هذه الورقة "جواز سفر الوكيل المفتوح" (OAP)، وهو إطار عمل حتمي قائم على السياسات يقوم باعتراض وتفويض استدعاءات أدوات الذكاء الاصطناعي المستقلة قبل التنفيذ لمنع الإجراءات غير المصرح بها، مما أظهر دفاعاً بنسبة 100% ضد هجمات الهندسة الاجتماعية في الاختبارات العدائية مع الحفاظ على زمن انتقال منخفض.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "التفويض المسبق للأفعال للوكلاء المستقلين من الذكاء الاصطناوي" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.
المشكلة الكبرى: وكلاء الذكاء الاصطناعي لديهم مفاتيح، لكن ليس لديهم حراس
تخيل أنك وظفت روبوت مساعد ذكي للغاية (وكيل ذكاء اصطناعي - AI Agent) لإدارة عملك. لقد أعطيت هذا الروبوت مفتاحاً رئيسياً لمكتبك، وحسابك البنكي، وبريدك الإلكتروني.
- الوضع الحالي: أنت تقول للروبوت: "كن حذراً ولا تفعل أي شيء سيء". أنت تأمل أن تدريبه (ما يسمى بـ "المحاذاة" - alignment) يجعله ذكياً بما يكفي ليعرف الصواب.
- الواقع: إذا قام مخترق بالهمس بحيلة ذكية في أذن الروبوت (ما يسمى بـ "حقن الأوامر" - prompt injection)، فقد يرتبك الروبوت. قد يعتقد: "أوه، لقد قال المدير لي أن أرسل 50,000 دولار إلى هذا الغريب!" وسيفعل ذلك ببساطة.
تجادل الورقة البحثية بأن الأمل ليس استراتيجية أمنية. فمجرد كون الروبوت يعتقد أنه يفعل الشيء الصحيح لا يعني أنه يفعل الشيء الصحيح بالفعل. نحن بحاجة إلى نظام يتحقق من كل إجراء قبل أن يقوم به الروبوت فعلياً، بغض النظر عما يفكر فيه الروبوت.
الحل: "جواز سفر الوكيل المفتوح" (OAP)
يقترح المؤلفون نظاماً جديداً يسمى OAP. فكر فيه كأنه حارس أمن رقمي أو نقطة تفتيش أمنية تقف بين الروبوت والعالم الحقيقي.
إليك كيف يعمل، باستخدام تشبيه خزنة البنك:
- الروبوت (الوكيل): يريد فتح خزنة وأخذ المال.
- الطريقة القديمة: يمشي الروبوت نحو الخزنة، وإذا بدا واثقاً، تُفتح الخزنة. (هذا أمر خطير).
- طريقة الـ OAP:
- قبل أن يلمس الروبوت الخزنة، يجب أن يتوقف عند نقطة تفتيش.
- يُظهر الروبوت جواز سفره (بطاقة هوية رقمية توضح بالضبط ما يُسمح له بفعله).
- تنظر نقطة التفتيش في طلب الروبوت: "هل تريد سحب 50,000 دولار؟"
- تنظر نقطة التفتيش في جواز السفر: "جواز سفرك يقول إنك تستطيع سحب 500 دولار فقط في اليوم".
- القرار: تغلق نقطة التفتيش الباب بقوة. "مرفوض".
- النتيجة: الروبوت لم يصل حتى إلى الخزنة. تم حظر الإجراء قبل وقوعه.
لماذا يختلف هذا عن طرق السلامة الأخرى؟
تقارن الورقة البحثية بين ثلاث طرق مختلفة للحفاظ على سلامة الذكاء الاصطناعي، باستخدام تشبيه أمن المنزل:
| الطريقة | التشبيه | ماذا تفعل | ما الذي تفتقده |
|---|---|---|---|
| محاذاة النموذج (التدريب) | تعليم الكلب عدم العض. | تدرب الروبوت ليكون لطيفاً. | إذا تعرض الكلب للخداع من قِبل غريب، فقد يعض رغم ذلك. إنه ليس موثوقاً بنسبة 100%. |
| التنفيذ في بيئة معزولة (القفص) | وضع الكلب في قفص زجاجي. | إذا عض الكلب، فسيظل يعض الزجاج فقط. لا يمكنه إيذاء الأشخاص في الخارج. | لا يزال بإمكان الكلب تحطيم الأشياء داخل القفص. هو لا يمنع الكلب من محاولة العض. |
| التفويض المسبق للأفعال (OAP) | حارس أمن عند الباب. | يتحقق الحارس من هوية الكلب وهوية الزائر قبل الدخول. إذا لم تتحقق الشروط، يظل الباب مغلقاً. | لا يمنع الكلب من التفكير في العض، لكنه يمنع حدة العضة من الحدوث. |
الرؤية الجوهرية: أنت بحاجة إلى الثلاثة معاً. لكن الورقة تجادل بأن "حارس الأمن" (التفويض المسبق للأفعال) هو القطعة المفقودة التي لا تمتلكها الأنظمة الحالية.
كيف يعمل "جواز السفر"؟
جواز سفر الوكيل هو وثيقة رقمية تعمل كعقد صارم. تقول:
- من أنت: (الهوية)
- ما يمكنك فعله: (مثلاً: "قراءة الملفات"، "إرسال رسائل بريد إلكتروني")
- ما لا يمكنك فعله: (مثلاً: "تحويل أكثر من 500 دولار"، "إرسال أموال إلى الدول X، Y، Z")
- القواعد: "إذا حاولت كسر القواعد، فإن النظام سيرفض تلقائياً ويقول لا".
هذا النظام حتمي (Deterministic). وهذه كلمة منمقة تعني: "إذا كانت المدخلات هي نفسها، فإن النتيجة ستكون دائماً هي نفسها."
- على عكس الذكاء الاصطناعي، الذي قد يخمن أو يهلوِس، فإن نظام جواز السفر يشبه المعادلة الرياضية. دائماً تساوي $4$. إذا كانت القاعدة تقول "لا تحويلات فوق 500 دولار"، فسيقوم النظام دائماً بحظر تحويل بقيمة 501 دولار، حتى لو توسل إليه الذكاء الاصطناعي لتمريره.
الإثبات: اختبار "الخزنة"
اختبر المؤلفون هذا النظام في لعبة حية تسمى APort Vault CTF.
- الإعداد: قاموا بإعداد بنك وهمي بجائزة قدرها 5,000 دولار لأي شخص يمكنه خداع الذكاء الاصطناعي لسرقة المال.
- المهاجمون: حاول 1,151 شخصاً استخدام "الهندسة الاجتماعية" (الحيل، الأكاذيب، والضغط) لإقناع الذكاء الاصطناعي بتحويل الأموال.
- النتيجة:
- عندما كان الذكاء الاصطناعي هو الدفاع الوحيد، نجح المهاجمون بنسبة 74.6% من المرات.
- عندما تمت إضافة جواز سفر OAP، نجح المهاجمون بنسبة 0% من المرات.
- تم خداع الذكاء الاصطناعي لطلب المال، لكن نظام جواز السفر قال: "لا، هذا ليس ضمن قواعدك"، وقام بحظر العملية.
لماذا يجب أن تهتم؟
هذا لا يتعلق بالمخترقين فقط. هذا يتعلق بـ المساءلة.
- الأمن: يمنع المخترقين من خداع الذكاء الاصطناعي لسرقة الأموال أو حذف البيانات.
- الامتثال: يضمن اتباع الذكاء الاصطناعي للقوانين (مثل GDPR) وقواعد الشركة (مثل "لا تنفق أكثر من الميزانية").
- الثقة: يمنحنا "إيصالاً موقعاً" لكل قرار. إذا حدث خطأ ما، فلدينا سجل مثالي لمن حاول فعل ماذا ولماذا تم حظره.
الخلاصة
تقول الورقة البحثية: توقف عن الاعتماد على كون الذكاء الاصطناعي "جيداً". بدلاً من ذلك، ابنِ نظاماً لا يمكن للذكاء الاصطناعي أن يكون فيه "سيئاً" لأن القواعد تُنفذ بواسطة نقطة تفتيش منفصلة وغير قابلة للاختراق.
إنه الفرق بين الأمل في أن مراهقك لن يقود بسرعة كبيرة، وبين تركيب منظم سرعة في السيارة يمنعها مادياً من تجاوز سرعة 65 ميلاً في الساعة. جواز السفر المفتوح للوكيل (OAP) هو منظم السرعة هذا للذكاء الاصطناعي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.