← أحدث الأبحاث
🤖 AI

AgentWall: A Runtime Safety Layer for Local AI Agents

تقدم هذه الورقة AgentWall، وهو طبقة أمان وقت التشغيل مفتوحة المصدر لوكلاء الذكاء الاصطناعي المحليين تقوم باعتراض وتقييم الإجراءات المقترحة مقابل سياسات تصريحية مع إشراف بشري، محققةً دقة إنفاذ بنسبة 92.9% وزمن استجابة يقل عن الميلي ثانية عبر بيئات التطوير الرئيسية.

المؤلفون الأصليون: Ashwin Aravind

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ashwin Aravind

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك وظفت مساعداً عبقرياً، مفرط الحماس، لمساعدتك في التعامل مع حاسوبك. هذا المساعد ذكي للغاية ويمكنه قراءة ملفاتك، وكتابة الأكواد، وتثبيت البرامج، وحتى تصفح الإنترنت. ومع ذلك، ولأنه متحمس جداً للمساعدة، قد يحذف عن طريق الخطأ مستندات مهمة، أو يثبت فيروساً بالخطأ، أو يحاول فتح حسابك البنكي الخاص لأنه أساء فهم طلب ما.

هذه هي المشكلة التي يحلها AgentWall.

إليك شرح مبسط لأفكار الورقة البحثية باستخدام تشبيهات من الحياة اليومية:

المشكلة: "المتدرب المندفع"

في الوقت الحالي، عندما يستخدم المطورون وكلاء الذكاء الاصطناعي (AI agents) على حواسيبهم الخاصة، فإنهم يمنحون هؤلاء الوكلاء وصولاً مباشراً إلى أقراصهم الصلبة وأدواتهم. الأمر يشبه إعطاء مفاتيح المكتب بأكمله، وغرفة الخوادم، ومكتب المدير التنفيذي لمتدرب جديد، والاكتفاء بقول: "اذهب وأصلح الفوضى".

إذا ارتبك المتدرب، أو تعرض للخداع عبر بريد إلكتروني مزيف (هجوم حقن الأوامر - prompt injection)، أو اتخذ تخميناً خاطئاً، فقد يتسبب في أضرار حقيقية. تدابير السلامة الحالية تشبه وضع لافتة "ممنوع اللمس" على غرفة الخوادم، لكن المتدرب لا يزال بإمكانه تجاهلها إذا اعتقد أنه يقدم المساعدة.

الحل: "حارس الأمن والبواب"

يعمل AgentWall كحارس أمن ذكي يقف بين مساعدك الرقمي وحاسوبك. هو لا يمنع الذكاء الاصطناعي من التفكير أو التخطيط؛ بل يمنعه فقط من القيام بأي فعل حتى يفحص الحارس تلك الخطة.

فكر في الأمر مثل بواب ملهى ليلي:

  1. الذكاء الاصطناعي هو الضيف الذي يحاول الدخول.
  2. حاسوبك هو الملهى.
  3. AgentWall هو البواب الذي يتحقق من هوية الضيف ويسأله: "ماذا تحاول أن تفعل؟"

كيف يعمل (القواعد الثلاث)

عندما يقول الذكاء الاصطناعي: "أريد حذف هذا الملف" أو "أريد تثبيت هذا البرنامج"، يقوم AgentWall بالإيقاف والتحقق من كتاب القواعد. ثم يتخذ أحد ثلاثة قرارات:

  1. الضوء الأخضر (السماح): "يبدو هذا آمناً. يمكنك المضي قدماً."
    • مثال: يريد الذكاء الاصطناعي قراءة ملف نصي في مجلد مشروعك. يقول الحارس: "حسناً، لا بأس بذلك".
  2. الضوء الأحمر (المنع): "مستحيل. هذا خطير."
    • مثال: يحاول الذكاء الاصطناعي حذف ملف كلمات المرور الخاص بك أو تشغيل أمر يمسح القرص الصلب بالكامل. يقول الحارس: "قطعاً لا"، ويوقف العملية فوراً.
  3. الضوء الأصفر (الاستئذان): "هذا أمر محفوف بالمخاطر. أحتاج لسؤال المالك."
    • مثال: يريد الذكاء الاصطناعي تثبيت حزمة برمجية جديدة. يقول الحارس: "لا يمكنني اتخاذ القرار. سأظهر رسالة على شاشتك أسألك فيها: 'هل تريد القيام بهذا؟'".

لماذا هذا مختلف؟

معظم أدوات السلامة تحاول منع الذكاء الاصطناعي من قول أشياء سيئة. أما AgentWall فيمنع الذكاء الاصطناعي من فعل أشياء سيئة.

  • تشبيه "الجدار الزجاجي": تخيل أن الذكاء الاصطناعي خلف جدار زجاجي. يمكنه رؤية كل شيء والإشارة إلى الأشياء التي يريد تغييرها، لكنه لا يستطيع لمسها. AgentWall هو ذلك الجدار الذي لا يفتح إلا نافذة صغيرة عندما تقول أنت (الإنسان): "نعم، هذا موافق عليه".

ما الذي اختبرته الورقة البحثية فعلياً؟

قام المؤلفون ببناء نموذج أولي يعمل (مثل نسخة تجريبية لهذا الحارس الأمني) واختبروه مع 14 سيناريو مختلفاً. إليكم ما وجدوه:

  • إنه يعمل: نجح في منع الإجراءات الخطيرة (مثل حذف ملفات النظام أو سرقة كلمات المرور) في معظم الاختبارات (بدقة 93%).
  • إنه سريع: يفحص الحارس القواعد بسرعة كبيرة (في أقل من ميلي ثانية) لدرجة أنك لن تلاحظ أي تأخير. إنه مثل بواب يتحقق من الهويات فوراً دون أن يجعلك تنتظر في الطابور.
  • يسجل كل شيء: في كل مرة يحاول فيها الذكاء الاصطنانا القيام بشيء ما، يقوم AgentWall بتدوينه في "مذكرات". إذا حدث خطأ ما لاحقاً، يمكنك النظر في المذكرات لمعرفة بالضبط ما حاول الذكاء الاصطناعي فعله ولماذا تم إيقافه.
  • إنه يتكيف: يمكنك تغيير القواعد أثناء عمل الذكاء الاصطناعي. إذا قررت فجأة: "في الواقع، لا مزيد من حذف الملفات اليوم"، يمكنك تحديث كتاب القواعد، وسيقوم الحارس بإنفاذها فوراً دون الحاجة لإعادة تشغيل الحاسوب.

ما الذي لا يعتبره؟

الورقة البحثية واضحة جداً بشأن ما لا يمثله AgentWall:

  • ليس درعاً سحرياً يجعل حاسوبك غير قابل للاختراق بنسبة 100%.
  • لا يقوم بإصلاح الذكاء الاصطناعي إذا كان الذكاء الاصطناعي "غبياً" أو مرتبكاً؛ هو فقط يمنع الأفكار الغبية من التحول إلى أفعال حقيقية.
  • لا يغني عن حاجتك لتكون حذراً؛ هو فقط يوفر لك شبكة أمان.

الخلاصة

مع ازدياد ذكاء وكلاء الذكاء الاصطناعي وبدئهم في القيام بمزيد من المهام على حواسيبنا، نحتاج إلى طريقة لضمان عدم كسرهم لكل شيء عن طريق الخطأ. AgentWall هو أداة تضع "طبقة سلامة" بين أفكار الذكاء الاصطناعي وأفعال حاسوبك، مما يضمن فحص كل حركة، والموافقة عليها، وتسجيلها. إنه يحول الذكاء الاصطناعي الجامح وغير المنضبط إلى مساعد مفيد وخاضع للإشراف.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →