← أحدث الأبحاث
💻 computer science

Beyond Task Success: An Evidence-Synthesis Framework for Evaluating, Governing, and Orchestrating Agentic AI

تتناول هذه الورقة فجوة "الإغلاق من الحوكمة إلى التنفيذ" في الذكاء الاصطناعي الوكيل عبر تركيب الأدلة من ٢٤ مصدراً لاقتراح إطار عمل رباعي الطبقات، واختبار وضع التشغيل (ODTA)، وحزمة الحد الأدنى من الأدلة-الأفعال التي تعمل مجتمعة على جسر الانفصال بين التقييم والحوكمة رفيعة المستوى وبين الامتثال للتنفيذ الملموس والقابل للإثبات.

المؤلفون الأصليون: Christopher Koch, Joshua Andreas Wellbrock

نُشر 2026-04-23
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Christopher Koch, Joshua Andreas Wellbrock

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مساعداً شخصياً ذكياً جداً وسريعاً للغاية يُدعى "الوكيل" (Agent). هذا الوكيل لا يكتفي فقط بالإجابة على الأسئلة؛ بل لديه القدرة على فتح حسابك البنكي، وتوقيع العقود، وشراء المستلزمات، والتحدث مع الآخرين نيابة عنك.

في الماضي، كنا نهتم فقط بما إذا كان الوكيل قد أتم المهمة. إذا طلبت منه "شراء حاسوب محمول"، وأحضر لك حاسوباً محمولاً، كنا نقول: "عمل رائع!".

لكن هذه الورقة البحثية تجادل بأن إتمام المهمة لم يعد كافياً بعد الآن.

إذا قام هذا الوكيل بشراء حاسوب محمول بقيمة 10,000 دولار بينما كانت ميزانيتك 500 دولار، أو إذا اشتراه من محتال لأنه لم يتحقق من القواعد، فقد "نجح" في المهمة ولكنه فشل في أن يكون جديراً بالثقة. المشكلة هي أننا نحاول تقييم عملية معقدة متعددة الخطوات بدرجة بسيطة وهي "النجاح أو الفشل".

إليك حل الورقة البحثية، مشروحاً من خلال تشبيه بسيط: "الطاهي الذكي" في مطعم راقٍ.

المشكلة: فجوة "الحوكمة إلى التنفيذ" (Governance-to-Action Gap)

تخيل مطعماً به رئيس طهاة صارم (طبقة الحوكمة). يكتب رئيس الطهاة كتاب قواعد: "لا تشترِ المكونات من موردين غير معتمدين"، و*"لا تنفق أكثر من 50 دولاراً على عنصر واحد"*.

بعد ذلك، لديك الوكيل، وهو "مساعد الطاهي" الذي يقوم بالطهي فعلياً.

  • الفجوة: رئيس الطهاة يكتب القواعد، لكن مساعد الطاهي يتجول في المطبخ. أحياناً، يلتقط مساعد الطاهي مكوناً غريباً لأنه كان في عرض خاص، ظناً منه: "رئيس الطهاة لن يعرف".
  • المشكلة: لدينا كتاب قواعد (الحوكمة) وناتج نهائي (التقييم)، ولكن ينقصنا مدير المطبخ الذي يراقب الطهي في الوقت الفعلي ليتأكد من اتباع القواعد أثناء إعداد الطعام.

تسمي الورقة البحثية هذا الرابط المفقود بـ "فجوة الإغلاق بين الحوكمة والتنفيذ". إنها المساحة بين "ما قلناه يجب أن يحدث" و"ما حدث بالفعل في اللحظة الراهنة".

الحل: إطار العمل ذو الطبقات الأربع

لإصلاح ذلك، تقترح المؤلفات نظاماً من أربع طبقات، مثل مبنى من أربعة طوابق، حيث لكل طابق وظيفة محددة:

  1. الطبقة الأولى: التقييم (ناقد الطعام)

    • الوظيفة: ينظر إلى الطبق النهائي. هل كان طعمه جيداً؟ هل حصل الزبون على طعامه؟
    • القصور: الناقد يرى النتيجة النهائية فقط. هو لا يعرف ما إذا كان الطاهي قد استخدم سماً أو سرق المكونات لصنع الطبق. نحن بحاجة للنظر في العملية بأكملها، وليس فقط في الطبق.
  2. الطبقة الثانية: الحوكمة (رئيس الطهاة / كتاب القواعد)

    • الوظيفة: يكتب القواعد. "نشتري العضوي فقط"، "لا ننفق أكثر من 50 دولاراً"، "تحقق من ترخيص المورد".
    • القصور: كتاب القواعد يظل موضوعاً على الرف. لا يمكنه منع مساعد الطاهي من التقاط المكون الخاطئ في لحظة العمل المتسارعة.
  3. الطبقة الثالثة: التنسيق/الأوركسترا (مدير المطبخ)

    • الوظيفة: هذه هي الطبقة الجديدة الأكثر أهمية. هذا هو الشخص الواقف بجانب الموقد مباشرة.
    • الإجراء: عندما يمد مساعد الطاهي يده لالتقاط قطعة لحم بـ 60 دولاراً، يقول مدير المطبخ: "توقف! هذا يتجاوز الميزانية. اذهب واحضر القطعة التي بـ 40 دولاراً بدلاً منها". أو: "لا يمكنك الشراء من هذا المورد؛ أحتاج للاتصال برئيس الطهاة أولاً".
    • لماذا يهم هذا: هنا يتم فرض القواعد فعلياً في الوقت الفعلي.
  4. الطبقة الرابعة: التأكيد (كاميرا المراقبة والتدقيق)

    • الوظيفة: يسجل كل شيء. إذا اشتكى الزبون لاحقاً، يمكننا تشغيل شريط الفيديو.
    • الإجراء: يثبت بالضبط ما حدث. "نعم، مدير المطبخ أوقف قطعة اللحم الغالية. إليكم الفيديو، والوقت، وتوقيع المدير".

اختبار "ODTA": كيف تقرر من يفعل ماذا؟

تقدم الورقة اختباراً بسيطاً يسمى ODTA لتحديد أي طبقة يجب أن تتعامل مع قاعدة معينة. فكر فيه كقائمة مراجعة لمدير المطبخ:

  • O (القابلية للملاحظة - Observability): هل يمكننا رؤية الإجراء قبل حدوثه؟ (هل يمكننا رؤية الطاهي وهو يمد يده لقطعة اللحم الغالية؟)
  • D (القابلية للتقرير/القرار - Decidability): هل القاعدة واضحة؟ (هل من الواضح أن 60 دولاراً تتجاوز حد الـ 50 دولاراً، أم أنها حالة "ربما"؟)
  • T (التوقيت - Timeliness): هل يمكننا الإيقاف بسرعة كافية؟ (إذا انتظرنا حتى ينضج اللحم، فسيكون الأوان قد فات.)
  • A (القابلية للإثبات - Attestability): إذا فاتنا الأمر، هل يمكننا إثبات ما حدث لاحقاً؟ (هل لدينا تسجيل فيديو؟)

إذا كانت الإجابة "نعم" لكل هذه النقاط الأربع: يجب على مدير المطبخ (التنسيق) إيقاف الأمر فوراً.
إذا كانت الإجابة "لا": فربما تكون القاعدة غامضة جداً بالنسبة للآلة. يجب أن تذهب إلى إنسان (الحكم البشري) أو يتم فحصها لاحقاً بواسطة كاميرا المراقبة (التأكيد).

"حزمة الأدلة والعمل الدنيا" (Minimum Action-Evidence Bundle - MAEB)

أخيراً، تقول الورقة: "إذا كنت ستسمح للوكيل بالقيام بشيء خطر (مثل إنفاق المال)، فيجب عليك حفظ 'إيصال' محدد".

هذا ليس مجرد سجل يقول "لقد اشتريت حاسوباً محمولاً". إنه إيصال رقمي يتضمن:

  • من الذي أعطى الأمر؟
  • ما هي القاعدة الدقيقة التي سمحت بهذا الفعل؟
  • ما هي حالة العالم قبل الإجراء؟ (مثلاً: "كان يتبقى لدينا 40 دولاراً في الميزانية").
  • من الذي وافق عليه؟
  • رابط لإثبات الفيديو.

بدون هذا "الإيصال"، إذا حدث خطأ ما، فلن تتمكن من إثبات من فعل ذلك أو لماذا.

مثال من الواقع: وكيل المشتريات

تستخدم الورقة "وكيل مشتريات" (روبوت يشتري الأشياء لشركة ما) لتوضيح كيفية عمل ذلك.

  • سيناريو سيء: يشتري الروبوت طابعة بـ 10,000 دولار. لقد أتم المهمة! لكنه خرق القواعد.
  • سيناريو جيد (باستخدام إطار العمل):
    1. الحوكمة تقول: "الحد الأقصى للإنفاق هو 5,000 دولار".
    2. التنسيق يرى الروبوت يحاول شراء الطابعة بـ 10,000 دولار. فيقوم بإيقاف الروبوت ويقول: "مطلوب موافقة بشرية".
    3. يقوم إنسان بالموافقة.
    4. التأكيد يحفظ "الإيصال" (MAEB) الذي يوضح أن الروبوت حاول، وأن النظام أوقفه، وأن الإنسان وافق، وتم إنفاق المال.

الخلاية الجوهرية

لا يمكننا فقط الوثوق في الذكاء الاصطناعي للقيام بـ "الشيء الصحيح" بناءً على إجابته النهائية. نحن بحاجة إلى نظام حيث:

  1. تُكتب القواعد بوضوح.
  2. يقوم المديرون (التنسيق) بمراقبة الذكاء الاصطناعي في الوقت الفعلي لفرض تلك القواعد.
  3. يقوم المسجلون (التأكيد) بحفظ دليل على كل خطوة.

الثقة لا تأتي من كون الذكاء الاصطناعي ذكياً؛ بل تأتي من وجود نظام يكتشف الأخطاء قبل وقوعها ويثبت أنه تم اكتشافها بعد وقوعها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →