AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
يُعد AgentEval إطار عمل يعمل على صياغة سير العمل الوكيل (agentic workflows) في شكل رسوم بيانية موجهة غير حلقية (DAGs) لتمكين التقييم المنظم على مستوى الخطوات وعزو الأسباب الجذرية آلياً، مما يتفوق بشكل كبير على الطرق الشاملة (end-to-end) في استدعاء اكتشاف الفشل وتقليل وقت تصحيح الأخطاء في بيئات الإنتاج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك رئيس طهاة في مطعم مزدحم. لديك فريق من الطهاة المبتدئين (الوكلاء الذكيون - AI Agents) يعملون في تسلسل: أحدهم يقطع الخضروات، وآخر يحضر الصلصة، وثالث يطهو اللحم، والطاهي الأخير يقوم بتنسيق الطبق.
حالياً، معظم الناس يقيمون هؤلاء الطهاة باستخدام "التقييم الشامل من البداية للنهاية" (End-to-End Evaluation). هذا يشبه ناقداً للطعام يدخل المطعم، يتناول لقمة واحدة من شريحة اللحم النهائية، ثم يقول: "هذا سيء".
المشكلة هي أن الناقد لا يعرف لماذا هو سيء؟ هل تم طهي اللحم أكثر من اللازم؟ أم أن الصلصة كانت مالحة جداً؟ أم أن الطاهي الأول استخدم خضروات فاسدة؟ لأن الناقد ينظر فقط إلى الطبق النهائي، يستمر المطبخ في ارتكاب نفس الأخطاء، ولا يملك رئيس الطهاة أي فكرة عمن يجب إعادة تدريبه.
AgentEval يشبه تركيب نظام كاميرات عالي التقنية ودقيق للغاية في المطبخ، يراقب كل حركة لكل طاهٍ.
القوى الثلاث لـ AgentEval
1. "خريطة الوصفة" (هيكل الـ DAG)
بدلاً من مجرد النظر إلى الطبق النهائي، يعامل AgentEval عملية الطهي كأنها مخطط انسيابي (DAG). فهو يعلم أن الصلصة تعتمد على البصل المقطع، وأن تنسيق الطبق يعتمد على الصلصة.
- الاستعارة: الأمر يشبه "سلسلة الأدلة" لدى المحقق. إذا فسدت الوجبة النهائية، فإن AgentEval لا يكتفي بالقول "الطبق سيء"؛ بل يتتبع آثار الخطوات إلى الوراء ليجد بالضبط أين انكسرت السلسلة.
2. "مساعد الشيف الخبير" (حكم الـ LLM)
لتقييم الطهاه، يستخدم AgentEval "رئيس طهاة" مدرباً تدريباً عالياً (نموذج ذكاء اصطناعي متطور مثل GPT-4o) لمراقبة كل خطوة. هذا "الرئيس" لا ينظر فقط إلى النتيجة النهائية؛ بل يقيم كل إجراء فردي:
- "هل قطعت البصل بشكل صحيح؟" (مقاييس على مستوى الخطوة)
- "هل اخترت التوابل الصحيحة؟" (اختيار الأدوات)
- "هل اتبعت خطوات الوصفة بالترتيب؟" (التخطيط)
3. "مكتشف اللوم" (انتشار الخطأ والتصنيف)
هذا هو الجزء الأهم. في المطبخ، يسبب خطأ واحد تأثيراً متسلسلاً (تأثير الدومينو). إذا استخدم الطاهي الأول الملح بدلاً من السكر، فإن كل الطهاه الذين يلونهم في مصير محتوم.
- الاستعار: معظم الأنظمة ترى كومة من قطع الدومينو المتساقطة وتقول: "لقد سقطت قطع الدومينو". أما AgentEval فيحدد "قطعة الدومينو الأولى" (السبب الجذري).
- يستخدم "تصنيف الفشل" (Failure Taxonomy) — وهو ما يشبه "جدار العار" المفصل للغاية. فبدلاً من قول "لقد أخطأت"، يقول: "لقد ارتكبت خطأ من 'الفئة 2، الفئة الفرعية ب': لقد استخدمت الأداة الخاطئة للمهمة".
لماذا يهم هذا في العالم الحقيقي؟
اختبر الباحثون هذا على أنظمة ذكاء اصطناعي حقيقية تُستخدم في خدمة العملاء وتحليل البيانات، وإليكم ما وجدوه:
- إنه كاشف خارق: الطرق التقليدية لم تكتشف سوى حوالي 41% من الأخطاء. بينما اكتشف AgentEval 89% منها. إنه يشبه الفرق بين حارس أمن يتحقق فقط مما إذا كان الباب الأمامي مغلقاً، وبين حارس يراقب كل كاميرا في المبنى.
- يوفر كميات هائلة من الوقت: في اختبار واقعي، عندما كان يحدث خطأ ما، كان المهندسون يقضون أكثر من 4 ساعات في البحث عن الخلل. ومع AgentEval، وجدوا المشكلة في 22 دقيقة فقط. إنه يحول رحلة البحث الطويلة والمحبطة عن الخطأ إلى إصلاح سريع ومستهدف.
- يمنع "التراجع" (Regressions): تخيل أنك قمت بتحديث فرن المطبخ، وفجأة أصبحت جميع الكعكات مسطحة. يعمل AgentEval كنظام إنذار آلي يلتقط هذه "التراجعات" قبل أن تصل الوجبة إلى العميل.
الملخص
ينقل AgentEval تقييم الذكاء الاصطناعي من سؤال "هل نجح الأمر؟" إلى سؤال "أين وكيف ولماذا فشل بالضبط؟". إنه يحول "الصندوق الأسود" لعمليات الذكاء الاصطعي إلى خريطة شفافة خطوة بخبطوة، مما يسمح للمطورين بإصلاح "قطعة الدومينو الأولى" بدلاً من مجرد التذمر من كومة القطع المتساقطة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.