MARCA: Multi-Agent Root Cause Analysis with Multi-Modal Data
تقترح الورقة البحثية MARCA، وهو إطار عمل متعدد الوكلاء يعالج تحديات تحليل السبب الجذري في الأنظمة الموزعة باستخدام بنية (متحكم-منفذ-مصوت) لتحقيق دقة وكفاءة عاليتين مع تقليل استهلاك الرموز (tokens) وضمان خصوصية البيانات.
لم تعد الأنظمة البرمجية الحديثة مجرد آلات ضخمة موحدة؛ بل أصبحت مدنًا شاسعة ومعقدة من البرامج الصغيرة المستقلة التي تُسمى "الخدمات المصغرة" (microservices)، والتي تتواصل مع بعضها البعض باستمرار. وعندما تتعثر قطعة واحدة من هذه المدينة الرقمية، يمكن للشبكة بأكملها أن تتوقف عن العمل، مما يتسبب في كل شيء بدءًا من تأخر المدفوعات وصولاً إلى انهيار المواقع الإلكترونية. إن تحديد أي برنامج صغير بالضبط تسبب في هذا الانهيار هو مهمة تُعرف باسم "تحليل السبب الجذري" (Root Cause Analysis). ولعقود من الزمن، حاول المهندسون أتمتة عملية البحث هذه، لكن الحجم الهائل للبيانات — من سجلات، وأرقام أداء، ورموز خطأ — يجعل من الصعب على الأدوات التقليدية مواكبة ذلك. ومؤخرًا، أظهرت برامج حاسوبية قوية تُعرف بـ "نماذج اللغات الكبيرة" (Large Language Models) وعودًا في قراءة وفهم تدفقات البيانات الفوضوية هذه، تمامًا كما يفعل الخبير البشري. ومع ذلك، تواجه هذه النماذج عقباتها الخاصة: فقد تصاب بالارتباك بسبب كثرة المعلومات دفعة واحدة، وتكلفتها التشغيلية عالية، كما أن إرسال بيانات الشركة الحساسة إلى خوادم خارجية يثير مخاوف جدية بشأن الخصوصية.
لقد طور باحث في جامعة لوكسمبورغ نهجًا جديدًا لحل هذه المشكلات، يُسمى MARCA. وبدلاً من الاعتماد على برنامج حاسوبي واحد ضخم يقرأ كل شيء ويخمن الإجابة، يقوم MARCA بتقسيم المهمة إلى فريق صغير من العمال الرقميين المتخصصين. تخيل فريقًا من المحققين حيث يتولى شخص واحد توجيه التحقيق، وآخر يجمع أدلة محددة، وثالث يزن الأدلة لاتخاذ القرار النهائي. يعمل هذا الفريق معًا في حلقة مستمرة، يطرح الأسئلة، ويجمع البيانات، وينقح نظريته حتى يتأكدوا من أنهم وجدوا المصدر الحقيقي للفشل. ومن خلال تقسيم العمل، يتجنب النظام الغرق في كميات هائلة من البيانات، ويحافظ على المعلومات الحساسة داخل الخوادم المحلية لضمان الخصوصية، ويستخدم طاقة حوسبية أقل من الأساليب السابقة.
اختبر الباحث هذا النظام متعدد الوكلاء على منصة دفع محاكية بناها بنفسه، وكذلك على معايير عامة يستخدمها علماء آخرون. وقد قام بحقن أنواع مختلفة من الأعطال في النظام، مثل تحميل المعالج فوق طاقته، أو ملء الذاكرة، أو قطع اتصالات الشبكة، ليرى ما إذا كان بإمكان MARCA تحديد الجاني بشكل صحيح. كانت النتائج واضحة: وجد النظام الجديد السبب الجذري بشكل صحيح بنسبة 77 بالمائة تقريبًا، وهو تحسن كبير عن أفضل الطرق الموجودة حاليًا، والتي كانت تحوم حول 62 بالمائة. كما أثبت أنه أفضل بكثير في التمييز بين أنواع الفشل المختلفة، مثل التفريق بين بطء الشبكة ونقص الذاكرة، محققًا درجة عالية من الدقة تشير إلى قدرته على التعامل مع الإشارات المتداخلة والفوضوية الموجودة في الأنظمة الواقعية.
وما يجعل هذا النهج متميزًا هو كيفية تعامله مع تدفق المعلومات. فالطرق التقليدية غالبًا ما تحاول تغذية نموذج واحد بكل البيانات المتاحة دفعة واحدة، مما قد يربك النظام أو يجبره على تجاهل تفاصيل مهمة لتناسب حجم البيانات. في المقابل، يعمل MARCA كمحقق مركز؛ إذ يبدأ من النقطة التي لوحظت فيها المشكلة، ثم يتحقق بشكل منهجي من الاتصالات المؤدية إلى المصدر. وفي كل خطوة، يقرر وكيل "المتحكم" (controller) ما الذي يجب النظر فيه بعد ذلك، ويستخدم وكيل "المنفذ" (executor) أدوات متخصصة لجلب السجلات أو أرقام الأداء ذات الصلة، بينما يقوم وكيل "المصوّت" (voter) بدمج هذه النتائج لتحديث قائمة المشتبه بهم. وتتكرر هذه العملية حتى تشير الأدلة بقوة إلى خدمة معينة. وتسمح هذه الطريقة للنظام بتجاهل البيانات غير ذات الصلة، مما يجعل المهمة سهلة الإدارة وفعالة.
كما سلطت الدراسة الضوء على أن مجرد استخدام نموذج لغة أكثر قوة ليس كافيًا لحل المشكلة. فعندما قارن الباحث نهجه القائم على الفريق بنموذج واحد قوي يحاول القيام بالمهمة بأكملر بمفرده، كان النظام القائم على الفريق لا يزال يتفوق عليه بشكل ملحوظ. وهذا يشير إلى أن هيكلية التحقيق — أي الطريقة التي يتعاون بها الوكلاء، ويصفيون الضجيج، ويزنون أنواعًا مختلفة من الأدلة — هي أكثر أهمية من الذكاء الخام للنموذج الفردي. كما تم تصميم النظام ليكون قابلاً للتكيف؛ حيث يمكنه التعلم من أخطائه السابقة لتعديل مدى ثقته في أنواع مختلفة من البيانات، مثل ما إذا كان سيعتمد أكثر على رموز الخطأ أو مقاييس الأداء، بناءً على ما حقق أفضل النتائج في السيناريوهات السابقة.
ورغم أن النتائج واعدة، فقد حرص الباحث على توضيح حدود عمله. يعتمد النظام على وجود خريطة دقيقة لكيفية اتصال الخدمات ببعضها البعض؛ فإذا كانت هذه الخريطة مفقودة أو قديمة، فقد يخرج التحقيق عن مساره. بالإضافة إلى ذلك، في الحالات التي تحدث فيها مشكلات متعددة في الوقت ذاته، يواجه النظام أحيانًا صعوبة في الفصل بين الأعراض المتداخلة. ومع ذلك، تظل النتيجة الجوهرية قائمة: من خلال تنظيم التحليل في عملية تعاونية وتكرارية، من الممكن تشخيص أعطال البرمجيات المعقدة بدقة وكفاءة أكبر من ذي قبل. ويقدم هذا النهج مسارًا عمليًا للحفاظ على سير الأنظمة الرقمية واسعة النطاق بسلاسة، مما يضمن أنه عندما تسوء الأمور، يمكن العثğu عن الإجابة الصحيحة بسرعة دون المساس بأمن البيانات أو استنزاف موارد الحوسبة.
ملخص تقني: MARCA – تحليل تعدد الوكلاء لجذر المشكلة باستخدام بيانات متعددة الأنماط
1. بيان المشكلة
يواجه تحليل جذر المشكلة (RCA) في بنى الخدمات المصغرة الموزعة واسعة النطاق تحديات كبيرة بسبب تباين بيانات المراقبة (السجلات، المقاييس، التتبعات، رموز الاستجابة) وتعقيد تبعيات الخدمات. وبينما توفر النماذج اللغوية الكبيرة (LLMs) إمكانات للتحليل فوق البيانات غير المهيكلة، فإن تطبيقها المباشر على تحليل جذر المشكلة يعوقه ما يلي:
قيود السياق: عدم القدرة على معالجة بيانات تشخيصية ضخمة ومتعددة المصادر دون تلخيص يؤدي لفقدان البيانات، مما يقلل من الدقة.
الكفاءة الحسابية: ارتفاع تكاليف الاستدلال وزمن الاستجابة عند معالجة سجلات النظام والمقاييس الخام.
خصوصية البيانات: المخاوف المتعلقة بنقل بيانات المؤسسات الحساسة إلى النماذج التجارية مغلقة المصدر.
القابلية للتكيف: تعاني الأنظمة الحالية ذات الوكيل الواحد أو القائمة على القواعد من أنماط الفشل الديناميكية، وتنسيقات البيانات المتطورة، والحاجة إلى الاستدلال السببي عبر الأنماط المختلفة.
2. المنهجية
تقترح الورقة إطار عمل MARCA، وهو إطار لتحليل جذر المشكلة متعدد الوكلاء يصيغ عملية تحليل جذر المشكلة كعملية اتخاذ قرار تكرارية. يستخدم النظام بنية المتحكم (Controller)– المنفذ (Executor)– المصوّت (Voter) لتفكيك مهام التشخيص المعقدة، ودمج التنفيذ المعزز بالأدوات مع آلية إجماع موزونة.
2.1 البنية الأساسية
وكيل المتحكم (Controller Agent): يعمل كمركز للتنسيق. يحافظ على الحالة العالمية (مجموعة المرشحين، مسار التتبع) ويفكك مهمة تحليل جذر المشكلة إلى تسلسل من الإجراءات (مثل بدء التحليل، تفكيك المهام، إدارة الحلقات). يقوم ببناء رسم بياني للتبعية الموجهة G=(V,E) لحصر مساحة البحث ضمن طوبولوجيا النظام الفعلية.
وكلاء المنفذ (Executor Agents): وكلاء متخصصون مسؤولون عن استرجاع البيانات المكثفة. يتفاعلون مع أدوات خارجية للاستعلام عن أنماط مراقبة محددة (السجلات، المقاييس، التتبعات، رموز الاستجابة) بناءً على تعليمات المتحكم. ويعيدون توبلات أدلة مهيكلة تحتوي على درجات الأدلة، ودرجات جودة البيانات، والمبررات النصية.
وكيل التصويت (Voting Agent): يجمع الأدلة متعددة الأنماط لحل النزاعات بين فرضيات جذور المشاكل المتنافسة. وبدلاً من التصويت بالأغلبية البسيطة، يستخدم آلية إجماع موزونة تأخذ في الاعتبار موثوقية النمط، وجودة البيانات الحالية، وقوة الدليل.
2.2 سير عمل الاستدلال
يعمل إطار العمل في عملية تكرارية مغلقة الحلقة:
تهيئة الطوبولوجيا: يحدد المتحكم عقدة الدخول لخلل ما ويبني الرسم البياني للتبعية.
جمع الأدلة التكراري: يقوم النظام بإجراء تتبع بالعرض (breadth-first traversal) عبر الرسم البياني للتبعية. في كل خطوة، يوجه المتحكم المنفذين للتحقيق في الخدمات المجاورة. يتم حساب درجة الارتباط السببي (ξ) لتصفية الضجيج، حيث تجمع بين الارتباط الزمني للمقاييس (ρ) والاتساق الدلالي لرموز الاستجابة ($sim$).
التسجيل الموحد والتقارب: يقوم وكيل التصويت بتحديث درجات ثقة المرشحين باستخدام مجموع موزون للأدلة. تنتهي الحلقة عندما تتجاوز ثقة أحد المرشحين حداً ديناميكياً، أو عندما يكون الفارق بين أفضل المرشحين كافياً، أو عند الوصول إلى الحد الأقصى لعدد التكرارات.
2.3 الاستدلال التكيفي والتعلم
التعلم في السياق (ICL): يتبع الوكلاء إرشادات استدلال تكيفية (مثل تحديد الشذوذ الدلالي، ومطابقة الارتباط الاحتمالي) بدلاً من القواعد التجريبية الجامدة. يتم استرجاع أمثلة قليلة (few-shot) ديناميكياً بناءً على نوع الخطأ وتشابه الطوبولوجيا.
تعلم المعلمات: يستخدم إطار العمل نموذج تعلم ثنائي المراحل:
التحسين غير المتصل (Offline Optimization): تُستخدم الأمثلة البايزية (Bayesian optimization) لضبط أوزان الارتباط السببي (λ1,λ2) وأوزان موثوقية الأنماط (wm) على مجموعات بيانات الأعطال التاريخية.
التكيف عبر الإنترنت (Online Adaptation): يتم تحديث أوزان الأنماط عبر المتوسط المتحرك الأسي (EMA) بناءً على التغذية الراجعة التشخيصية في الوقت الفعلي، مما يسمح للنظام بالتكيف مع تغير جودة البيانات أو ظروف النظام.
2.4 التنفيذ المعزز بالأدوات
لمعالجة طول السياق والكفاءة، يفوض MARCA معالجة البيانات منخفضة المستوى إلى أدوات خارجية متخصصة (تصفية السجلات، إعادة بناء التتبع، كشف شذوذ المقاييس). يسمح هذا لوكلاء LLM بالحفاظ على سياقات مهام عالية المستوى مع إسناد العمليات كثيفة الموارد، مما يقلل بشكل كبير من استخدام الرموز (tokens).
3. المساهمات الرئيسية
صياغة اتخاذ القرار التكراري: تعيد الورقة صياغة تحليل جذر المشكلة كعملية تكرارية عبر بيانات مراقبة غير متجانسة، مما يتيح الاستدلال خطوة بخقد خطوة بدلاً من التحليل بمرور واحد.
بنية المتحكم– المنفذ– المصوّت: تصميم متعدد الوكلاء مبتكر يفكك تحليل جذر المشكلة إلى مراحل التخطيط، والتنفيذ، والتحقق، مما يسهل التعامل مع السياق القابل للتوسع واتخاذ القرارات القوية.
آلية الإجماع الموزونة: طريقة لتحسين القوة ضد الإشارات التشخيصية الضوضائية أو المتضاربة عن طريق وزن الأدلة ديناميكياً بناءً على موثوقية النمط وجودة البيانات.
التحقق التجريبي: تجارب مكثفة تثبت تحسينات كبيرة مقارنة بالنماذج المرجعية الأحدث في كل من تحديد موقع جذر المشكلة وتصنيف الخطأ.
4. النتائج التجريبية
قام المؤلف بتقييم MARCA على نظام دفع تم بناؤه ذاتياً (باستخدام Chaos Mesh لحقن الأعطال) وعلى اثنين من معايير الخدمات المصغرة العامة (TrainTicket و MicroSS).
الأداء: في نظام الدفع المبني ذاتياً، حقق MARCA (باستخدام Llama-2) دقة Top-1 بلغت 76.87% ودرجة F1 بلغت 0.7896. وقد تفوق هذا بشكل كبير على أقوى نموذج مرجعي متعدد الأنماط (HolisticRCA الذي حقق 62.15% Acc@1) وعلى نماذج LLM ذات الوكيل الواحد.
الكفاءة: خفض الإطار استخدام الرموز (tokens) بنسبة تقارب 60% مقارنة بنهج الوكيل الواحد من خلال الاستفلة من الاسترجاع المعزز بالأدوات وتلخيص الأدلة المهيكلة، مما يضمن الجدوى للنشر الصناعي في الوقت الفعلي.
دراسات الاستئصال (Ablation Studies): تسبب إزالة التوجيه الطوبولوجي في أكبر انخفاض في الأداء (انخفاض نسبي قدره 32.1% في Acc@1)، مما يبرز ضرورة حصر مساحة البحث باستخدام معلومات تبعية النظام. كما أدت إزالة الأدلة متعددة الأنماط إلى تدهور كبير في درجة F1، مما يؤكد أهمية دمج البيانات غير المتجانسة.
التعميم: حافظ MARC على دقة عالية في المعايير العامة (مثل 74.56% Acc@1 في TrainTicket)، مما أظهر قدرة أفضل على التعميم في بنيات الأنظمة غير المرئية مقارنة بطرق الوكيل الواحد.
5. الأهمية والادعاءات
تدعي الورقة أن MARA يعالج الاختناقات الحرجة في مناهج تحليل جذر المشكلة القائمة على LLM، وتحديداً فيما يتعلق بقابلية التوسع، والمتانة، والنشر العملي.
الجدوى الصناعية: من خلال تقليل الاعتماد على السياق وتمكين التنفيذ المحلي، يضمن MARA سيادة البيانات ويخفض التكاليف الحسابية، مما يجعله مناسباً لبيئات المؤسسات.
القابلية للتكيف: تسمح آلية التعاون الديناميكي للنظام بالتكيف مع الأهداف المتطورة وظروف النظام دون جمود بنيات الوكيل الواحد الثابتة.
الفعالية التشخيصية: يتغلب دمج الوكلاء المتخصصين والاستدلال عبر الأنماط على قيود المعالجة أحادية الكتلة، مما يوفر أساساً أكثر شمولاً لتحديد جذور المشاكل في الأنظمة الموزعة المعقدة.
يقر المؤلف بالقيود، مشيراً إلى أن دقة التشخيص تعتمد على اكتمال بيانات الطوبولوجيا الوصفية (خاصة في بيئات serverless/ephemeral) والقدرة على التمييز بين الأنماط في سيناريوهات الأعطال المتزامنة. ويقترح عملاً مستقبلياً يركز على إعادة بناء الطوبولوجيا الديناميكية ومعايرة الأوزان القائمة على التعلم التعزيزي.