Proof-of-Guardrail in AI Agents and What (Not) to Trust from It
تقترح هذه الورقة نظام "إثبات الحواجز الوقائية" (Proof-of-Guardrail)، وهو نظام يستفيد من بيئات التنفيذ الموثوقة لتوفير إثبات تشفيري وقابل للتحقق بأن وكلاء الذكاء الاصطناعي يفرضون تدابير سلامة محددة، مما يعالج تهديد السلامة المعلنة كذباً مع الإقرار بالمخاطر المتبقية مثل عمليات كسر الحماية النشطة.