TraceSIR: A Multi-Agent Framework for Structured Analysis and Reporting of Agentic Execution Traces
يُعد TraceSIR إطار عمل متعدد الوكلاء يعالج تحديات تحليل آثار التنفيذ الوكيلية المعقدة من خلال توظيف وكلاء متخصصين لضغط البيانات، وإجراء تحليل دقيق للأسباب الجذرية، وتوليد تقارير قابلة للتنفيذ، مُظهراً أداءً فائقاً في معايير TraceBench وReportEval المستحدثة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة TraceSIR البحثية، مترجم إلى لغة بسيطة مع استخدام تشبيهات إبداعية.
🕵️♀️ المشكلة: "الصندوق الأسود" للوكلاء الذكيين (AI Agents)
تخيل أنك وظفت مساعداً آلياً فائق الذكاء (وكيل ذكاء اصطناعي) لحل لغز معقد، مثل العثور على برنامج تلفزيوني معين بناءً على وصف غامض.
الروبوت لا يعطيك الإجابة فوراً، بل يخوض رحلة طويلة:
- يفكر: "ربد يكون هذا هو البرنامج؟"
- يبحث في الإنترنت.
- يقرأ صفحة من ويكيبيديا.
- يشعر بالارتباك، فيجرب بحثاً مختلفاً، ويقرأ 50 صفحة أخرى.
- أخيراً، يعطيك الإجابة: "أخبرني بما رأيته".
المشكلة: أحياناً يخطئ الروبوت. وإذا نظرت فقط إلى الإجابة النهائية، فلن تعرف لماذا فشل. هل بحث عن الشيء الخطأ؟ هل أساء فهم دليل ما؟ هل تشتت انتباهه؟
في العالم الحقيقي، يمكن أن تكون هذه "الرحلات" (والتي تسمى مسارات التنفيذ - execution traces) بطول آلاف الصفحات.
- المراجعون البشريون: لا يمكنهم قراءة 50,000 صفحة من السجلات لكل خطأ؛ فهذا يستغرق وقتاً طويلاً جداً.
- أدوات الذكاء الاصطناعي القياسية: تحاول قراءة كل شيء دفعة واحدة، لكنها تصاب بالارتباك (مثل محاولة الشرب من خرطوم حريق ضخم)، وتبدأ في الهلوسة أو تقديم إجابات غير منطقية.
- الطرق الحالية: غالباً ما تنظر فقط إلى النتيجة النهائية (نجاح/فشل) دون فهم السلوك الذي أدى إلى الفشل.
🛠️ الحل: TraceSIR (فريق التحقيق)
ابتكر المؤلفون TraceSIR، والذي يعمل كـ وكالة تحريات متخصصة لأخطاء الذكاء الاصطناعي. بدلاً من شخص واحد يحاول القيام بكل شيء، يستخدمون فريقاً من ثلاثة وكلاء ذكاء اصطناعي متخصصين يعملون معاً.
تخيل الأمر كوحدة تحقيق مكونة من ثلاثة أشخاص:
1. الملخص (StructureAgent) 📝
المهمة: البيانات الخام عبارة عن رواية فوضوية مكونة من 50,000 صفحة. "الملخص" هو المحرر الذي يحولها إلى قصة مصورة منظمة.
- كيف يعمل: يأخذ السجلات الطويلة والمملة ويحولها إلى تنسيق نظيف من 3 أعمدة: الفكرة (بماذا كان يفكر الروبوت)، الإجراء (ماذا فعل)، والملاحظة (ماذا حدث بعد ذلك).
- اللمسة السحرية: يقوم بحذف الحشو (مثل قصاصات الكود الطويلة أو عمليات البحث المتكررة) ولكنه يحتفظ بالأدلة الحاسمة. إنه يحول "خرطوم الحريق" من البيانات إلى "زجاجة مياه" سهلة الشرب.
2. المُشخّص (InsightAgent) 🩺
المهمة: هذا هو الطبيب الذي يفحص "القصة المصورة" التي أنشأها الملخص.
- كيف يعمل: ينظر إلى الحالة المحددة ويسأل: "أين أخطأ الروبوت؟"
- هل قام بقفزة منطقية خاطئة؟
- هل أساء فهم الأداة التي كان يستخدمها؟
- ما هو السبب الجذري؟ (مثلاً: "فشل الروبوت لأنه بحث عن اسم الممثل بدلاً من عنوان المسلسل").
- المخرج: هو لا يكتفي بقول "خطأ"، بل يقدم تقريراً طبياً مفصلاً يتضمن التشخيص ووصفة لكيفية الإصلاح.
3. المُقرر (ReportAgent) 📊
المهمة: تخيل أن لديك 100 روبوت يفشلون في 100 مهمة مختلفة. "المُقرر" ينظر إلى جميعها معاً لإيجاد الأنماط.
- كيف يعمل: يقوم بتجميع التشخيصات من "المُشخّص".
- "مهلاً، 40% من الروبات فشلت لأنها ارتبكت بسبب التواريخ."
- "إليك نمط معين: عندما تتعلق المهمة بالبرمجة، يميل الروبوت للاستسلام مبكراً جداً."
- المخرج: يكتب تقريراً صناعياً شاملاً (بصيغة Markdown) يمكن للمهندسين استخدامه فعلياً لتحسين النظام. يتضمن التقرير الإحصائيات، وأنماط الفشل الشائعة، واقتراحات محددة للتحسين.
🏆 الإثبات: TraceBench & ReportEval
لإثبات نجاح نظامهم، بنى الفريق ساحة اختبار تسمى TraceBench.
- أخذوا 150 حالة فشل حقيقية من ثلاثة أنواع مختلفة من مهام الذكاء الاصطناعي: البحث العميق (إيجاد المعلومات)، استدعاء الدوال (استخدام الأدوات)، والبرمجة (كتابة البرمجيات).
- كما ابتكروا طريقة جديدة لتقييم التقارير تسمى ReportEval. فبدلاً من مجرد التحقق من وجود التقرير، سألوا: "هل هذا التقرير مفيد؟ هل السبب الجذري دقيق؟ هل الاقتراحات قابلة للتنفيذ؟"
النتائج:
عندما قارنوا TraceSIR بالمعيار الصناعي الحالي (ClaudeCode)، فاز TraceSIR باكتساح.
- تشخيص أفضل: وجد الأسباب الحقيقية للفشل، وليس فقط الأخطاء السطحية.
- تقارير أفضل: كانت التقارير أكثر وضوحاً ومنطقية، وساعدت المهندسين فعلياً في حل المشكلات.
- القابلية للتوسع: استطاع التعامل مع كميات هائلة من البيانات التي قد تؤدي لتعطل الأنظمة الأخرى.
💡 الصورة الكبيرة
TraceSIR يشبه الانتقال من "الصندوق الأسود" (حيث تحدث الأشياء ونحن نخمن السبب) إلى "الصندوق الزجاجي" (حيث يمكننا رؤية التروس وهي تدور، وتحديد الترس المعطل، وإصلاحه).
إنه يحل مشكلة كثرة البيانات عبر تلخيصها، ومشكلة التعقيد المفرط عبر تفكيكها، ومشكلة الضجيج العالي عبر إيجاد الإشارة المفيدة. إنه يحول فوضى سجلات الذكاء الاصطنا_ي إلى خارطة طريق واضحة وقابلة للتنفيذ لبناء أنظمة ذكاء اصطناعي أفضل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.