Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives
تقدم هذه الورقة البحثية "Governed MCP"، وهو بوابة حوكمة لأدوات استدعاء الوكيل (tool calls) مستقرة داخل النواة (kernel-resident) تم تنفيذها في نظام التشغيل "Anima OS" القائم على لغة "Rust"، والتي تفرض سلامة قوية وغير قابلة للتجاوز لاستدعاءات أدوات وكلاء الذكاء الاصطناعي من خلال خط معالجة مكون من ست طبقات يتميز بفحص دلالي مبتكر يعتمد على الاحتمالات (ProbeLogits)، مما يثبت أن هذا التكامل العميق ضروري لمنع التجاوزات العدائية التي تهزم الضوابط الاحترازية الموجودة في مساحة المستخدم (userspace guardrails).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت مساعداً شخصياً ذكياً جداً، سريع للغاية، ولكنه متهور قليلاً (وهو وكيل ذكاء اصطناعي - AI Agent) لإدارة منزلك. يمكن لهذا المساعد فتح الأبواب، تشغيل الأضواء، طلب البقالة، وحتى الاتصال بالشرطة.
المشكلة هي: لا يمكنك الوثوق بأن يراقب المساعد نفسه.
المشكلة: عيب "الرقابة الذاتية"
تعمل معظم أنظمة سلامة الذكاء الاصطناعي حالياً بهذا الشكل: تعطيك المساعد دفتراً للقواعد (مكتبة برمجية بلغة Python) وتقول له: "قبل أن تفعل أي شيء، راجع دفترك".
لكن هنا تكمكم المشكلة: المساعد هو من يمسك الدفتر. وإذا ارتبك المساعد، أو تم خداعه، أو قرر أن يكون شريراً، فيمكنه ببساال:
- تجاهل الدفتر (عدم فتحه).
- تمزيق الصفحات (حذف القواعد).
- كتابة قواعد مزيفة (تغيير الدفتر ليقول "لا بأس بحرق المنزل").
لأن قواعد السلامة تعيش في نفس الغرفة التي يتواجد فيها المساعد، يمكن للمساعد دائماً الغش. الأمر يشبه أن تطلب من لص أن يحرس صندوق المجوهرات بينما هو يمسك بالمفتاح.
الحل: "الحارس في القبو"
تقترح هذه الورقة نظاماً جديداً يسمى Governed MCP. بدلاً من إعطاء المساعد دفتراً، سنبني نقطة تفتيش أمنية محصنة في قبو المنزل (نواة نظام التشغيل - Operating System Kernel).
إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:
1. الإعداد
- المساعد (الوكيل): يعيش في قفص زجاجي. يمكنه رؤية المنزل، لكن لا يمكنه لمس الأبواب أو الأقفال مباشرة.
- الحارس (البوابة): حارس شديد الأمن يقف عند الباب الوحيد المؤدي للخروج من القفص الزجاجي. يعيش الحارس في القبو (النواة)، وهو مكان لا يستطيع المساعد دخوله أو لمسه.
- الطلب: في كل مرة يريد فيها المساعد القيام بشيء ما (مثل "افتح الباب الأمامي" أو "اتصل بإدارة الإطفاء")، يجب عليه أن يصرخ بطلبه إلى الحارس.
2. طبقات الأمن الست
الحارس لا يكتفي بقول "نعم" أو "لا". بل يقوم بتمرير الطلب عبر خط تجميع مكون من 6 خطوات:
- فحص الهوية (التحقق من المخطط - Schema Validation): "هل هذا الطلب مكتوب بشكل صحيح أصلاً؟ هل طلبت باباً بينما كان يجب أن تطلب ضوءاً؟"
- شارة التصريح (مستوى الثقة - Trust Tier): "هل تملك شارة أمنية مناسبة لطلب هذا؟ المساعد من المستوى المنخفض لا يمكنه طلب فتح خزنة البنك."
- حد السرعة (تحديد المعدل - Rate Limit): "مهلاً، تمهل قليلاً! أنت تطلب فتح 50 باباً في الثانية. هذا أمر مريب."
- كاسر الشفرة (المرشح الاستباقي العدائي - Adversarial Pre-filter): "أرى أنك تحاول إخفاء طلبك في شفرة سرية (مثل Base64) أو تستخدم كلمات مخادعة لخداعي. لن يمر هذا."
- قارئ الأفكار (بوابة "ProbeLogits"): هذا هو الجزء الأهم. يمتلك الحارس عقلاً خارقاً (نموذج ذكاء اصطناعي صغير) يقرأ النية الكامنة وراء الكلمات.
- مثال: إذا قال المساعد: "أريد تنظيف الأرضية"، فإن عقل الحارس يتحقق: "هل يحاول فعلياً إغراق القبو؟"
- إذا استشعر العقل وجود خطر، فإنه يغلق الباب بإحكام. هذا هو الطبقة الوحيدة التي تفهم المعنى حقاً، وليس مجرد الكلمات المفتاحية.
- الدستور (مطابقة السياسة - Policy Match): "حتى لو لم يكن الطلب خطيراً، هل يخالف قواعد العائلة؟ (مثلاً: 'لا يُسمح بالحيوانات الأليفة')".
3. قاعدة "الأمان عند الفشل"
إذا تعطل عقل الحخل الخارق أو مرض، فإن النظام يتبع قاعدة: "عند الشك، أغلق كل شيء". تبقى الأبواب مغلقة حتى يتم إصلاح الحارس. وهذا ما يسمى الإغلاق الآمن (Fail-Closed). من الأفضل أن نكون عالقين في الداخل على أن نسمح بوقوع كارثة.
لماذا هذا الأمر مهم؟
تثبت هذه الورقة شيئين كبيرين:
لا يمكنك الاعتماد على القواعد فقط؛ أنت بحاجة إلى عقل.
اختبر الباحثون ما يحدث إذا أزالوا "قارئ الأفكار" (الطبقة 5) واكتفوا بالقواعد البسيطة فقط. فشل النظام فشلاً ذريعاً. فقد سمح بمرور طلبات خطيرة لأن "الأشرار" تعلموا كيفية صياغة طلباتهم بطرق مخادعة. كان "قارئ الأفكار" هو الشيء الوحيد الذي منعهم.لا يمكنك خداع الحارس.
بما أن الحارس يعيش في القبو (النواة) والمساعد يعيش في القفص الزجاجي، فمن المستحيل فيزيائياً على المساعد الوصول للأعلى وتغيير قواعد الحارس. من المستحيل هيكلياً تجاوز ذلك.
الخلاصة
تقول هذه الورقة: "توقفوا عن الوثوق بالذكاء الاصطناعي لمراقبة نفسه."
نحن بحاجة لنقل فحوصات السلامة من "غرفة المعيشة" (حيث يعيش الذكاء الاصطناعي) إلى "أساسات المنزل" (نظام التشغيل). من خلال بناء بوابة آمنة وغير قابلة للاختراق تتحقق من معنى كل إجراء يحاول وكيل الذكاء الاصطناعي اتخاذه، يمكننا أخيراً ترك وكلاء الذكاء الاصطناعي يديرون أدواتنا دون القلق من أن يحرقوا المنزل (بالخطأ أو عمداً).
الأمر يشبه الترقية من مجرد وضع لافتة "الرجاء عدم السرقة" على الباب، إلى بناء خزنة عالية التقنية وغير قابلة للكسر مع حارس يمكنه قراءة أفكارك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.