← أحدث الأبحاث
💻 computer science

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

تقترح هذه الورقة "مبدأ الحيوية المعلوماتية" وإطار عمل "RiskGate"، المرتكزين على نظرية الحيوية لأوبن، لتمكين الحوكمة التكيفية في وقت التشغيل للوكلاء المستقلين للذكاء الاصطناعي عبر تقدير حدود المخاطر غير المرصودة وفرض قيود رتيبة لضمان السلامة رغم انحراف السلوك والتكيف العدائي.

المؤلفون الأصليون: German Marin, Jatin Chaudhary

نُشر 2026-04-28
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: German Marin, Jatin Chaudhary

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك استأجرت مساعداً آلياً (روبوت) ذكياً للغاية ومستقلاً لإدارة حسابك البنكي، وجدولة مواعيدك، وطلب البقالة الخاصة بك. لقد منحته الإذن الكامل للتصرف. ولكن تكمن المشكلة هنا في أنه حتى لو لم تقم بتغيير الكود البرمجي أبداً، فقد يبدأ الروبوت ببطء في اتخاذ قرارات سيئة. قد يرتبك أمام أنواع جديدة من الطلبات، أو يبدأ في تفضيل مجموعات معينة من الناس على غيرهم، أو قد يجمع عن طريق الخطأ سلسلة من الإجراءات الصغيرة غير الضارة التي تتحول في النهاية إلى عملية احتيال ضخمة.

تقترح هذه الورقة البحثية، بعنوان "حكم ما لا يمكنك مراقبته" (Governing What You Cannot Observe)، طريقة جديدة للحفاظ على سلامة وكلاء الذكاء الاصطناعي هؤلاء. وبدلاً من مجرد التحقق مما إذا كان إجراء واحد مسموحاً به، تقترح الورقة مراقبة "العلامات الحيوية" للوكيل للتنبؤ بما إذا كان على وشك "المرض" قبل أن ينهار فعلياً.

إليك تفصيل لأفكارهم باستخدام تشبيهات بسيطة:

1. المشكلة الجوهرية: "الانجراف الصامت" (The Silent Drift)

فكر في وكيل الذكاء الاصطناعي مثل سيارة تسير على طريق سريع.

  • الطريقة القديمة: أنت تتحقق من السيارة قبل كل منعطف. "هل هذا المنعطف قانوني؟" إذا كان نعم، تتركها تذهب.
  • المشكلة: قد تتآكل إطارات السيارة ببطء، أو قد يصبح مزيج الوقود غير دقيق قليلاً، أو قد يتعب السائق. حتى لو كان كل منعطف بمفرده قانونياً، فقد تنتهي السيارة بالتحطم في النهاية بسبب هذه التغييرات البطيئة وغير المرئية.
  • رؤية الورقة: لا يمكنك فقط النظر إلى المنعطف الحالي؛ بل يجب عليك تقدير "المخاطر غير المرئية" (Unobserved Risk). وهي الخطر الذي لا يمكنك رؤيته الآن، ولكنه سيكون موجوداً بعد بضع دقائق.

2. القاعدة الجديدة: "هامش الأمان" (The Safety Margin)

يقترح المؤلفون قاعدة بسيطة تسمى "مبدأ الصلاحية المعلوماتية" (Informational Viability Principle). تخيل أن لدى الذكاء الاصطناعي "ميزانية أمان".

  • القدرة (S): مدى جودة أداء الذكاء الاصطناعي الآن (على سبيل المثال، مدى إجابته على الأسئلة بشكل صحيح).
  • حد المخاطر (B): الخطر المقدر للأشياء التي لا يمكنك رؤيتها بعد (على سبيل المثال، بدأ الذكاء الاصطناعي ببطء في الهلوسة أو التحيز).
  • القاعدة: يُسمح للذكاء الاصطناعي بالعمل فقط إذا كانت قدرته أكبر من مخاطره بهامش آمن.
    • تشبيه: أنت لا تقود السيارة إلا إذا كان خزان الوقود (القدرة) ممتلئاً بشكل كبير مقارنة بالمسافة إلى محطة الوقود التالية (المخاطر). إذا أصبحت الفجوة صغيرة جداً، تتوقف عن القيادة، حتى لو بدت السيارة جيدة في هذه اللحظة تحديداً.

3. المخاطر الثلاثة الخفية (حد المخاطر)

تقسم الورقة هذا الخطر غير المرئي إلى ثلاثة أنواع محددة من "الأمراض" التي قد يصاب بها الذكاء الاصطناعي:

  • U(x) - "الارتباك" (عدم اليقين/Uncertainty): الذكاء الاصطناعي ينسى ببطء ما كان يعرفه. ربما تغير العالم، أو حصل الذكاء الاصطناعي على تحديث برمجي جعله يتصرف بشكل مختلف.
    • تشبيه: طباخ كان يصنع حساءً مثالياً، لكنه بدأ ببطء ينسى الوصفة، ويضيف رشة ملح زائدة كل يوم.
  • SB(x) - "عدم الإنصاف" (التحيز الهيكلي/Structural Bias): يعامل الذكاء الاصطناعي مجموعات مختلفة من الناس بشكل مختلف، حتى لو لم يكن ذلك عن قصد.
    • تشبيه: حارس أمن عند ملهى ليلي يبدأ في السماح لـ 90% من الأشخاص من حي معين بالدخول، بينما يسمح لـ 10% فقط من حي آخر، رغم أن أحداً لم يخبره بذلك.
  • RG(x) - "الخدعة" (فجوة الواقع/Reality Gap): يقوم الذكاء الاصطناعي بأفعال تبدو آمنة إذا أُخذت منفردة، ولكنها خطيرة إذا وُضعت معاً.
    • تشبيه: لص يسحب 4,900 دولار من صراف آلي خمس مرات متتالية. كل عملية سحب هي أقل من حد الـ 5,000 دولار الذي يطلق إنذاراً، لكن الإجمالي البالغ 24,500 دولار هو بوضوح عملية سرقة. يحتاج الذكاء الاصطناعي لرؤية القصة كاملة، وليس مجرد عملية السحب الواحدة.

4. الحل: "الطيار الآلي" و"مؤشر الصلاحية" (The Viability Index)

بنى المؤلفون نظاماً يسمى RiskGate لإدارة هذا الأمر. وهو يعمل كجهاز مراقبة صحي للذكاء الاصطناعي.

  • مؤشر الصلاحية (VI): هو رقم واحد (من -1 إلى +1) يخبرك بمدى صحة الذكاء الاصطناعي.
    • +1: الذكاء الاصطناعي آمن للغاية.
    • 0: الذكاء الاصطناعي يقف على الحافة.
    • -1: الذكاء الاصطناعي في ورطة.
  • التنبؤ بالمستقبل (الاستباق/Anticipation): النظام لا ينتظر وقوع العطل في الذكاء الاصطناعي. بل يرسم خطاً عبر التاريخ الأخير لـ "مؤشر الصحة". إذا كان الخط يتجه للأسفل، فإنه يتنبأ متى سيصل الذكتم الاصطناعي إلى الصفر.
    • تشبيه: طبيب ينظر إلى اتجاه درجة حرارة المريض. حتى لو كان المريض يشعر بخير الآن، إذا كانت درجة الحرارة ترتفع درجة واحدة كل ساعة، فإن الطبيب يعلم أن المريض سيصاب بالحمى خلال ساعتين ويتصرف قبل أن تصيبه الحمى فعلياً.
  • قاعدة "التضييق فقط" (التقييد الرتيب/Monotonic Restriction): هذه ميزة سلامة حاسمة. إذا بدأ الذكاء الاصطناعي في المرض، يمكن للنظام فقط تضييق القواعد (جعله أكثر حذراً). لا يمكنه أبداً تخفيف القواعد تلقائياً.
    • تشبيه: إذا بدأت السفينة في استقبال المياه، يمكن للقبطان فقط إغلاق المزيد من الفتحات. لا يمكنه فتح المزيد من الفتحات "لإصلاح" المشكلة. إذا كانت السفينة تغرق بسرعة كبيرة، فإن الخيار الوحيد هو الضغط على "مفتاح الإيقاف" (إيقاف الذكاء الاصطناعي تماماً) وطلب المساعدة البشرية.

5. كيف يعمل في الحياة الواقعية (الأمثلة)

اختبرت الورقة ذلك في سيناريوهين:

  1. عملية الاحتيال بـ "الهيكلة": يحاول شخص سيء سرقة المال عن طريق إجراء تحويلات صغيرة متعددة.
    • النتيجة: لم ترَ كواشف "الارتباك" و"عدم الإنصاف" أي خطأ لأن كل تحويل بدا طبيعياً. لكن كاشف "الخدعة" (الذي ينظر إلى التسلسل الكامل) رأى النمط وأوقف السرقة.
  2. عملية "التحيز الصامت": يبدأ ذكاء اصطناعي في رفض طلبات القروض من مجموعة أقلية معينة بشكل أكبر قليلاً، ببطء بمرور الوقت.
    • النتيجة: لاحظ النظام أن "مؤشر الصحة" ينخفض ببطء. وتنبأ بأن الذكاء الاصطناعي سيصبح غير عادل في غضون 100 معاملة أخرى. فقام تلقائياً بتضييق القواعد قبل أن يتحول عدم الإنصاف إلى انتهاك قانوني.

ملخص

تجادل هذه الورقة بأن حوكمة الذكاء الاصطناعي لا تتعلق بالتحقق من قائمة "الأفعال والممنوعات" لكل إجراء على حدة. بل تتعلق بـ تقدير المخاطر غير المرئية التي تتراكم بمرور الوقت. ومن خلال الفصل بين ما يمكننا رؤيته (أفعال الذكاء الاصطناعي الحالية) وما لا يمكننا رؤيته (الانجراف البطيء نحو الخطر)، وباستخدام نظام لا يمكنه إلا أن يصبح أكثر صرامة (وليس أقل صرامة) عندما تبدو الأمور خطيرة، يمكننا الحفاظ على سلامة الوكلاء المستقلين قبل أن يتسببوا في ضرر حقيقي.

ما لا تدعيه الورقة:

  • لا تدعي أنها اختبرت هذا على ملايين وكلاء الذكاء الاصطناعي في العالم الحقيقي بعد (هذا مخطط له في أعمال مستقبلية).
  • لا تدعي أنها تحل كل مشاكل الذكاء الاصطناعي الممكنة (مثل "عدم توافق الأهداف" أو "الخداع")، ولكنها توفر إطاراً للإمساك بأكثر أنواع الانجراف والتحيز شيوعاً.
  • لا تقول إن الذكاء الاصطناعي يمكنه إصلاح نفسه؛ إذا انخفض "مؤشر الصحة" كثيراً، يتوقف النظام وينتظر مساعدة بشرية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →