Toward Securing AI Agents Like Operating Systems
تجادل هذه الورقة بأن تأمين الوكلاء القائمين على نماذج اللغات الكبيرة (LLM) يتطلب تطبيق مبادئ أمن أنظمة التشغيل، مُثبتةً ذلك من خلال تحليل بنية موحدة ودراسة حالة مفادها أنه بينما تظل بعض المخاطر متأصلة، يمكن التخفيف من حدة العديد من الثغرات الأمنية باستخدام تقنيات أنظمة التشغيل الراسخة مثل عزل الموارد وفصل الامتيازات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت مساعداً شخصياً ذكياً للغاية ومتحمساً للغاية يُدعى "الوكيل" (Agent). هذا المساعد يمكنه قراءة رسائل البريد الإلكتروني الخاصة بك، وإدارة تقويمك، وحجز الرحلات الجوية، وحتى كتابة الأكواد البرمجية من أجلك. إنه يشبه امتلاك موظف سحري لا ينام أبداً.
ولكن هناك عقبة: لقد أعطيت هذا الموظف مفاتيح منزلك بالكامل، وحسابك البنكي، ومذكراتك. إذا استطاع لص ماكر خداع المساعد ليعتقد أنه أنت، أو أقنعه بفتح الباب الخلفي، فسيحصل اللص على كل شيء.
هذه هي المشكلة الجوهرية التي تتناولها الورقة البحثية. يجادل المؤلفون بأننا نبني هؤلاء الوكلاء الذكيين كما لو كانوا مخلوقات سحرية جديدة تماماً، بينما يجب علينا في الواقع معاملتهم كأنظمة تشغيل (Operating Systems) - وهو البرنامج الذي يشغل حاسوبك مثل Windows أو macOS.
إليك تفصيل نتائجهم، باستخدام تشبيهات بسيطة:
1. الفكرة الكبرى: الوكيل هو نظام التشغيل
يقول المؤلفون: "توقفوا عن التفكير في الذكاء الاصطناعي كمجرد روبوت دردشة. فكروا فيه كنظام تشغيل (OS) لحياتكم الرقمية".
- الذكاء الاصطناعي (LLM) هو المستخدم: في الحاسوب، يقوم المستخدم بكتابة الأوامر. في الوكيل الذكي، يكون النموذج اللغوي الكبير (العقل) هو من يكتب الأوامر. ولكن تماماً كما يمكن خداع مستخدم بشري عبر رسالة بريد إلكتروني احتيالية، يمكن خداع الذكاء الاصطناعي عبر "اختراق" (Jailbreak) للمطالبة (Prompt).
- الأدوات هي استدعاءات النظام (System Calls): عندما تنقر على "طباعة" في حاسوبك، يتحقق نظام التشغيل مما إذا كان لديك إذن. عندما يريد الذكاء الاصطناعي "إرسال بريد إلكتروني"، فهذه أداة. تجادل الورقة بأن هذه الأدوات يجب أن تُعامل كاستدعاءات نظام صارمة، وليس كأوامر مفتوحة للجميع.
- وقت التشغيل (Runtime) هو النواة (Kernel): الجزء من البرنامج الذي يشغل الكود فعلياً هو "النواة". في الحاسوب الآمن، تكون النواة هي المدير؛ فهي التي تقرر من يحق له لمس ماذا. في وكلاء الذكاء الاصطناعي الحاليين، غالباً ما تكون "النواة" لطيفة للغاية وتسمح لـ "المستخدم" (الذكاء الاصطناعي) بفعل أي شيء يريده، حتى لو كان خطيراً.
2. المشكلة: حفلة "البيت المفتوح"
تنظر الورقة في وكلاء الذكاء الاصطناعي الشهيرين (مثل OpenClaw وأقرانه) وتجد أنها مبنية مثل "بيت مفتوح" حيث يمكن لأي شخص الدخول ولمس أي شيء.
- لا توجد جدران: في الحاسوب الآمن، تكون البرامج المختلفة معزولة عن بعضها. إذا أصاب فيروس تطبيق الآلة الحاسبة، فلا ينبغي أن يتمكن من قراءة ملفاتك البنكية. لكن في وكلاء الذكاء الاصطناعي هذه، تكون "الآلة الحاسبة" (الأداة) و"الملفات البنكية" (الذاكرة) جميعها في نفس الغرفة. إذا ارتبك الذكاء الاصطناعي، فقد يخلط بينهما عن غير قصد (أو بسوء نية).
- مغالطة "ثق بي": تعتمد هؤلاء الوكلاء على أن "يتذكر" الذكاء الاصطناعي أن يكون آمناً. لديهم قواعد مثل "لا تحذف الملفات"، لكنها مكتوبة بلغة إنجليزية بسيطة فقط. إذا همس مخترق بحيلة للذكاء الاصطناعي، فسينسى الذكاء الاصطناعي القاعدة. الأمر يشبه أن تطلب من حارس الوقوف للمراقبة ولكن تخبره: "استخدم تقديرك الخاص فقط".
- خطر "الطرف الثالث": تسمح هذه الوكلاء بتثبيت "مهارات" (مثل التطبيقات). تخيل لو كان بإمكانك تحميل "تطبيق طقس" يحتوي سراً على باب خلفي لحسابك البنكي. وجدت الورقة أن العديد من هذه الوكلاء يسمحون لك بتثبيت هذه المهارات دون التحقق مما إذا كانت آمنة.
3. التجربة: كسر الوكلاء
قام الباحثون بأخذ أربعة وكلاء ذكاء اصطناعي مشهورين وحاولوا كسرهم، متقمصين دور مخترق يمتلك مهارات متوسطة. لم يحتاجوا لأن يكونوا عباقرة؛ كل ما احتاجوه هو معرفة كيف بُني هذا "البيت".
ما وجدوه:
- OpenClaw (الوكيل التقليدي): كان الأكثر شهرة، وكان عرضة لكل هجوم حاول الباحثون القيام به. كان الأمر أشبه بترك الباب الأمامي، والباب الخلفي، والنوافذ مفتوحة على مصادرها.
- IronClaw (الوكيل الأمني): حاول هذا الوكيل أن يكون أكثر أماناً. وضع بعض الأدوات في "صندوق رمل" (Sandbox) - أي صندوق زجاجي لا يمكنه لمس بقية المنزل. كان أداؤه أفضل، لكن الباحثين وجدوا طرقاً لخداعه أو كسر الزجاج.
- Nanobot (الوكيل الأدنى): كان يحتوي على كود برمجي ضئيل جداً، على أمل أن يعني الكود الأقل وجود أخطاء أقل. ولكن حتى مع قاعدة كود صغيرة، كان يفتقر إلى "الجدران" الأساسية اللازمة للحفاظ على فصل البيانات.
- NemoClaw (الوكيل المغلف): وضع هذا الوكيل الوكيل بالكامل داخل حاوية آمنة (مثل حاوية الشحن). كان الأصعب في الكسر، ومع ذلك وجد الباحثون طريقة للتلصص للداخل أو خداعه.
النتيجة الصادمة: حتى النسخ "الآمنة" فشلت في أمور أساسية، مثل منع مستخدم واحد من قراءة ملاحظات خاصة لمستخدم آخر، أو منع الوكيل من إرسال رسائل إلى الغرباء.
4. الحل: الاستعانة بالماضي
الاستنتاج الرئيسي للورقة بسيط: لسنا بحاجة لابتكار سحر جديد لإصلاح هذا. نحن فقط بحاجة لاستخدام قواعد الأمان التي عرفناها منذ 50 عاماً.
لقد حلت أنظمة التشغيل هذه المشكلات بدقة من قبل. يقترح المؤلفون تطبيق هذه القواعد القديمة على الذكاء الاصطناعي:
- العزل (Isolation): ضع كل أداة في صندوقها الزجاجي الخاص (Sandbox) بحيث لا يمكنها لمس الأدوات الأخرى أو ملفاتك الخاصة إلا إذا سُمح لها بذلك صراحة.
- الحد الأدنى من الصلاحيات (Least Privilege): مجرد قدرة الوكيل على قراءة بريدك الإلكتروني لا يعني أنه "يجب" أن يفعل ذلك. امنحه فقط المفاتيح التي يحتاجها للمهمة المحددة التي يقوم بها.
- التسجيل المحصن (Hardened Logging): احتفظ بسجل لكل ما يفعله الوكيل، ولكن تأكد من أن الوكيل لا يمكنه حذف أو تغيير هذه السجلات (مثل كاميرا مراقبة غير قابلة للتلاعب).
- الحدود الصارمة (Strict Boundaries): لا تترك للذكاء الاصطناعي قرار ما هو آمن. يجب على "النواة" (النظام) فرض القواعد، وليس "عقل" الذكاء الاصطناعي.
ملخص
تجادل الورقة بأن وكلاء الذكاء الاصطناعي مبنيون حالياً كأنهم حدود برية برية وغير منظمة. إنهم أقوياء ولكنهم خطرون لأنهم يخلطون بين البيانات الحساسة والتعليمات غير الموثوقة.
يقول المؤلفون: "توقفوا عن محاولة جعل الذكاء الاصطناعي 'أذكى' ليكون آمناً. بدلاً من ذلك، ابنوا النظام حوله كنظام تشغيل آمن". إذا عاملنا الذكاء الاصطناعي كمستخدم يحتاج إلى مراقبة وتقييد من قبل حارس أمن صارم (نظام التشغيل)، فيمكننا جعل هذه الأدوات القوية آمنة للاستخدام في منازلنا وشركاتنا.
الخلاية: نحن نبني موظفين رقميين يمتلكون مفاتيح رئيسية لحياتنا، لكننا لم نبنِ الأقفال، أو الأسوار، أو حراس الأمن بعد. لقد حان الوقت لاستعارة المخططات من خبراء أمن الحاسوب الذين بنوا تلك الأقفال لعقود من الزمن.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.