← أحدث الأبحاث
💻 computer science

Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

تجادل هذه الورقة الموقعة بأن النشر الآمن لوكلاء النماذج اللغوية الكبيرة يتطلب هيكلياً بنية احتمالية قائمة على العقود ثلاثية الطبقات لفرض أبعاد سلامة متميزة —وهي القصد الدلالي، وصلاحية البيئة، والجدوى الديناميكية— نظراً لأن أي طبقة تجريد منفردة لا يمكنها ضمان الأبعاد الثلاثة معاً في آن واحد.

المؤلفون الأصليون: S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

نُشر 2026-05-19
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الجوهرية: حاجز حماية واحد ليس كافياً

تخيل أنك توظف روبوتًا خادمًا ذكيًا جدًا ولكنه غير متوقع بعض الشيء لإدارة منزلك. تعطي له قائمة مهام: "اذهب إلى المطبخ، أحضر الماء، وأحضره إلى الجدة".

تجادل الورقة بأن محاولة الحفاظ على سلامة هذا الروبوت باستخدام فحص أمان واحد فقط (مثل علامة "قف" واحدة أو كتاب قواعد واحد) هو أمر مستحيل بنيويًا. مهما جعلت ذلك الفحص الواحد ذكيًا، فسيفشل دائمًا في نقطة ما لأن الروبوت يواجه ثلاثة أنواع مختلفة من الأخطار في ثلاثة أوقات مختلفة.

فكر في الأمر كأنه نقطة تفتيش أمنية مكونة من ثلاث مراحل في المطار. لا يمكنك فحص جواز سفر المسافر، وحمولته، وقدرته على قيادة طائرة في اللحظة نفسها تمامًا. يجب عليك القيام بذلك بالترتيب.

طبقات السلامة الثلاث

يقترح المؤلفون أننا بحاجة إلى ثلاث "طبقات" متميزة من السلامة، كل منها يفحص شيئًا مختلفًا في وقت مختلف. هم يسمون هذا بنية احتمالية ثلاثية الطبقات.

1. طبقة المستخدم: "فحص النية" (قبل أن يتحرك الروبوت)

  • ماذا تفحص: هل الخطة منطقية؟ هل هي مهذبة؟ هل تتبع القواعد؟
  • التشبيه: تخيل محررًا بشريًا يقرأ قصتك قبل أن تنشرها. سيتحقق من: "هل طلبت من الروبوت إحضار الماء؟ نعم. هل طلبت منه إيذاء الجدة؟ لا. هل الخطة منطقية؟"
  • لماذا تحتاج لطبقتها الخاصة: الروبوت لم يتحرك بعد. هو لا يعرف ما إذا كان الممر مسدودًا أو إذا كانت تمطر في الخارج. هو يعرف فقط ما قلته أنت. هذه الطبقة تمنع الروبوت من حتى بدء خطة سيئة (مثل "اذهب إلى الحمام مع تشغيل الكاميرا").

2. الطبقة التشغيلية: "فحص العالم" (قبل أن يعمل الروبوت)

  • ماذا تفحص: هل العالم آمن لهذه الخطة في هذه اللحظة؟
  • التشبيه: تخيل مراقب حركة جوية ينظر إلى الرادار المباشر. المحرر وافق على خطة "القيادة إلى المطبخ"، لكن مراقب الحركة يرى شجرة ضخمة سقطت في الممر. فيقول: "توقف! لا يمكنك الذه- هناك الآن".
  • لما لماذا تحتاج لطبقتها الخاصة: المحرر (الطبقة 1) لم يستطع رؤية الشجرة لأنها لم تكن موجودة عندما وُضعت الخطة. يحتاج الروبوت إلى النظر في العالم الحالي (المستشعرات، الكاميرات) ليعرف ما إذا كان من الآمن المضي قدمًا.

3. الطبقة الوظيفية: "فحص الإجراء" (أثناء تحرك الروبوت)

  • ماذا تفحص: هل يتحرك الروبوت بأمان في تلك اللحظة؟
  • التشبيه: تخيل نظام حزام الأمان والوسائد الهوائية داخل السيارة. حتى لو كانت الخطة جيدة والطريق خالياً، قد تدفع هبة ريح مفاجئة السيارة. هذه الطبقة هي الآلية الفيزيائية التي تصحح حركة الروبوت فورًا لتجنب الاصطدام.
  • لماذا تحتاج لطبقتها الخاصة: مراقب الحركة (الطبقة 2) لا يمكنه التنبؤ بانزلاق مفاجئ أو شخص يخطو أمام الروبوت الآن. هذه الطبقة تستجيب فورًا للواقع الفيزيائي.

لماذا لا يمكنك الدمج بينهما

تقدم الورقة ادعاءً رياضيًا قويًا: لا يمكنك دمج هذه الطبقات الثلاث في طبقة واحدة.

  • مشكلة "السفر عبر الزمن": لفحص "العالم" (الطبقة 2)، تحتاج إلى رؤية العالم. ولكن لفحص "النية" (الطبقة 1)، تحتاج للقيام بذلك قبل أن ترى العالم. إذا حاولت القيام بكليهما في وقت واحد، فإما أنك ستفحص النية متأخرًا (بعد أن يكون الروبوت قد بدأ بالفعل في التحرك) أو ستفحص العالم مبكرًا جدًا (قبل أن تعرف كيف يبدو العالم فعليًا).
  • مشكلة "الصندوق الأسود": الروبوت (النموذج اللغوي الكبير - LLM) غير متوقع. قد يهلوس أو يرتكب خطأً. إذا اعتمدت على شبكة أمان واحدة كبيرة، وكان في هذه الشبكة ثقب، فسيفشل النظام بأكمله. من خلال امتلاك ثلاث شبكات منفصلة، إذا وجد ثقب في إحداها، فقد تنجح الشبكات الأخرى في تدارك الخطأ.

نظام "العقود"

يقترح المؤلفون أن هذه الطبقات يجب أن تتواصل مع بعضها البعض باستخدام العقود.

  • الطبقة 1 توقع عقدًا تقول فيه: "أعد بأن الخطة آمنة للتفكير فيها".
  • الطبقة 2 توقع عقدًا تقول فيه: "أعد بأن العالم آمن للدخول إليه".
  • الطبقة 3 توقع عقدًا تقول فيه: "أعد بأن الحركة آمنة للتنفيذ".

إذا خرقت الطبقة 1 عقدها، فلا داع la للطبقة 2 حتى أن تفحص. إذا خرقت الطبقة 2 عقدها، فإن الطبقة 3 توقف الروبوت فورًا. هذا يخلق سلسلة من السلامة حيث تكون السلامة الإجمالية هي نتاج عمل الطبقات الثلاث معًا.

التحديات المتبقية

تعترف الورقة بأن هذا مجرد مخطط وليس منتجًا نهائيًا. هناك ثلاث عقبات كبيرة يجب حلها قبل أن نتمكن من استخدام هذا في الحياة الواقعية:

  1. حساب الاحتمالات: من الصعب حساب الرياضيات الدقيقة لـ "مدى الأمان" لكل طبقة لأن سلوك الروبوت يتغير في كل مرة (الأمر ليس مثل رمي قطعة نقد).
  2. القواعد المتغيرة: إذا تغيرت بيئة الروبوت (على سبيل المثال، تحرك الأثاث)، فقد تحتاج قواعد السلامة إلى التغيير بسلاسة دون كسر النظام بأكمله.
  3. العمل الجماعي: هذا النظام مصمم لروبوت واحد. إذا كان لديك فريق من الروبوتات يتحدثون مع بعضهم البعض، فقد يخدع بعضهم بعضًا، وليس لدينا طبقة سلامة لذلك بعد.

الملخص

تقول الورقة: توقفوا عن محاولة بناء "درع سلامة" واحد ضخم لروبوتات الذكاء الاصطناعي. بدلاً من ذلك، ابنوا ثلاثة دروع متخصصة ومنفصلة تعمل بترتيب محدد:

  1. افحص الخطة (هل الفكرة جيدة؟)
  2. افحص العالم (هل البيئة آمنة؟)
  3. افحص الإجراء (هل الحركة آمنة؟)

فقط من خلال فصل هذه الفحوصات يمكننا ضمان أن روبوت الذكاء الاصطناعي لن يؤذي أي شخص حقًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →