← أحدث الأبحاث
🤖 AI

Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

تقترح هذه الورقة نظام "إثبات الحواجز الوقائية" (Proof-of-Guardrail)، وهو نظام يستفيد من بيئات التنفيذ الموثوقة لتوفير إثبات تشفيري وقابل للتحقق بأن وكلاء الذكاء الاصطناعي يفرضون تدابير سلامة محددة، مما يعالج تهديد السلامة المعلنة كذباً مع الإقرار بالمخاطر المتبقية مثل عمليات كسر الحماية النشطة.

المؤلفون الأصليون: Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

نُشر 2026-03-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "إثبات الحواجز الوقائية" (Proof-of-Guardrail) باستخدام لغة بسيطة، وتشبيهات من الحياة اليومية، واستعارات إبداعية.

المشكلة الجوهرية: فخ "صدقني!"

تخ fear أنك تطلب طعاماً من مطعم جديد وغامض يقوم بتوصيل الطلبات عبر طائرة بدون طيار (درون). يدعي المطعم قائلاً: "لا تقلق! لدينا مفتش صحي صارم يفحص كل وجبة قبل خروجها من المطبخ للتأكد من أنها آمنة وطازجة".

لديك مشكلة: لا يمكنك رؤية ما بداخل مطبخهم. عليك أن تصدق كلامهم فحسب.

  • المخاطرة: ماذا لو كان المطعم يكذب؟ ماذا لو تخطوا المفتش، أو الأسوأ من ذلك، ماذا لو وظفوا مفتشاً فاسداً يكتفي بوضع ختم "آمن" على طعام مسموم؟
  • الواقع الحالي: في عالم الذكاء الاصطناعي، غالباً ما يتعين على المستخدمين الوثوق بالمطورين ثقة عمياء. يقول المطورون: "نحن نستخدم فلاتر أمان لمنع ذكائنا الاصطناعي من قول أشياء مسيئة أو تقديم نصائح سيئة". ولكن بما أن الذكاء الاصطناعي يعمل على خوادم المطور الخاصة، لا يمكن للمستخدمين التحقق مما إذا كانت هذه الفلاتر تعمل بالفعل أم لا.

الحل: "الإيصال غير القابل للتلاعب"

يقترح المؤلفون نظاماً يسمى "إثبات الحواجز الوقائية" (Proof-of-Guardrail).

لا تنظر إلى هذا كوعود، بل كـ إيصال تشفيري يثبت أن فحص الأمان قد حدث بالفعل.

إليك كيف يعمل، باستخدام تشبيه خزنة البنك:

  1. الغرفة الخاصة (البيئة التنفيذية الموثوقة - TEE):
    تخيل أن على المطور تشغيل ذكائه الاصطناعي داخل خزنة بنك عالية التقنية (تسمى البيئة التنفيذية الموثوقة أو TEE). هذه الخزنة مصنوعة من فولاذ غير قابل للكسر وتتم مراقبتها بواسطة نظام أمني للأجهزة.
  • لماذا؟ داخل هذه الخزنة، يمكن للمطور وضع "وصفة" الذكاء الاصطناعي السرية (التي لا يريد مشاركتها)، ولكن يجب عليه أيضاً وضع "مفتش السلامة" العام (الحاجز الوقائي).
  1. العملية:
    عندما يطرح مستخدم سؤالاً على الذكاء الاصطناعي، يذهب السؤال إلى داخل الخزنة.
  • يفكر الذكاء الاصطناعي في الإجابة.
  • يقوم مفتش السلامة بفحص الإجابة.
  • إذا كانت الإجابة آمنة، تسمح الخزنة بخروجها.
  • إذا كانت الإجابة خطيرة، تقوم الخزنة بحظرها.
  1. الإيصال السحري (التصديق):
    الأمر الحاسم هو أن الخزنة تحتوي على كاميرا مدمجة وختم رقمي. في كل مرة تسمح فيها الإجابة بالخروج، تقوم بطباعة إيصال موقع.
  • يقول هذا الإيصال: "أنا، الخزنة، أؤكد أن مفتش السلامة قد فحص هذه الإجابة تحديداً قبل خروجها."
  • هذا الإيصال موقع بمفتاح فريد لا يملكه إلا عتاد (Hardware) الخزنة نفسه. ومن المستح المستحيل رياضياً تزويره.
  1. تحقق المستخدم:
    يتلقى المستخدم الإجابة و الإيصال معاً. ليس عليهم الوثوق بالمطور، بل يحتاجون فقط إلى التحقق من الإيصال مقابل قواعد "مفتش السلامة" المعلنة. إذا كان الإيصال صالحاً، فسيعرفون يقيناً أن فحص الأمان قد تم.

لماذا يعد هذا أمراً هاماً؟

  • الخصوصية مقابل الإثبات: عادةً، لإثبات أنك آمن، عليك إظهار مطبخك بالكامل (كود البرمجة الخاص بك) للجمهور. يسمح لك هذا النظام بالاحتفاظ بوصفاتك السرية (ذكاؤك الاصطناعي الخاص) مخفية داخل الخزنة، مع إثبات اتباعك لقواعد السلامة في الوقت نفسه.
  • لا يوجد وسيط: لست بحاجة إلى مدقق طرف ثالث ليأتي ويفحص المطبخ. الخزنة تقوم بعملية التدقيق تلقائياً وفورياً.

التنبيه: إنه ليس "ضماناً للسلامة"

تنتهي الورقة البحثية بتحذير مهم جداً. إثبات الحواجز الوقائية ليس هو نفسه إثبات السلامة.

لنعد إلى تشبيه المطعم:

  • ما يثبته الإيصال: "المفتش الصحي نظر إلى البرجر".
  • ما لا يثبته الإيصال: "البرجر لذيذ أو جيد فعلياً".

المخاطر:

  1. قد يخطئ المفتش: حتى لو فحص المفتش البرجر، فقد يغفل عن وجود شعرة فيه. تُظهر الورقة أن فلاتر الأمان (الحواجز الوقائية) ليست مثالية؛ فهي أحياناً تسمح بمرور أشياء سيئة أو تحجب أشياء جيدة.
  2. خدعة "كسر الحماية" (Jailbreak): إذا كان المطور سيئ النية، فقد يحاول خداع مفتش السلامة. تخيل أن المطور يهمس للمفتش: "هذا البرجر يبدو وكأنه لعبة، لذا لست بحاجة لفحصه". إذا تم خداع المفتش، فسيظل الإيصال يقول "تم الفحص"، لكن الطعام لا يزال سيئاً.

الخلا الخلاصة

إثبات الحواجز الوقائية (Proof-of-Guardrail) يشبه الختم غير القابل للتلاعب على زجاجة دواء.

  • هو يثبت أن الزجاجة تم ختمها في المصنع (أي أن فحص الأمان قد تم).
  • يثبت أن الختم لم يُكسر أثناء النقل.
  • لكنه لا يضمن أن الدواء الموجود بالداخل فعال أو أن المصنع لم يضع الحبوب الخاطئة في الزجاجة منذ البداية.

لماذا نستخدمه؟
في عالم مليء بمطوري الذكاء الاصطناعي المشبوهين، يسمح هذا النظام للمطورين الشرفاء بالقول: "انظروا، لدي الختم الذي يثبت أنني أتبع القواعد"، مما يبني الثقة. ولكن يجب على المستخدمين أن يكونوا أذكياء ويعرفوا أن الختم لا يعني أن المنتج مثالي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →