Agent-MIRUPD: Operationalizing LLM Agents for Microservices Incident Response Under Performance Degradation
تقترح الورقة البحثية Agent-MIRUPD، وهو إطار عمل لوكيل يعتمد على النماذج اللغوية الكبيرة (LLM) يوحد بيانات القابلية للملاحظة مع الاستدلال المهيكل متعدد الخطوات لأتمتة دورة حياة الاستجابة للحوادث في الخدمات المصغرة بالكامل، محققاً تحسينات كبيرة في سرعة التشخيص، ودقة التخفيف، وكفاءة الرموز (tokens) مقارنة بالنماذج المرجعية الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تعتمد الخدمات الرقمية الحديثة، من تطبيقات الخدمات المصرفية إلى منصات الرعاية الصحية، بشكل متزايد على بنية معقدة حيث يتم تقسيم التطبيق الواحد إلى عشرات البرامج الصغيرة والمستقلة التي تسمى "الخدمات المصغرة" (microservices). تعمل هذه القطع داخل حاويات، ويديرها نظام مؤتمت يُعرف باسم "كوبيرنيتيس" (Kubernetes)، والذي يعمل مثل مراقب حركة المرور، لضمان أنه في حال تعطل أحد الأجزاء، يتم إعادة تشغيله ليستمر العمل. وبينما يوفر هذا الإعداد مرونة هائلة، فإنه يخلق نوعًا جديدًا من المشكلات: أحيانًا لا تتعطل الخدمة تمامًا، بل تتباطأ فقط أو تتصرف بشكل غير منتظم. هذه المشكلات الدقيقة، التي تُسمى غالبًا "الإخفاقات الرمادية" (gray failures) أو "تدهور الأداء" (performance degradation)، يصعب رصدها لأن النظام لا يزال "حيًا" تقنيًا، ومع ذلك فهو يفشل في أداء مهمته بشكل صحيح. وبالنسبة للمهندسين البشريين، فإن تشخيص سبب تباطؤ خدمة معينة يتطلب البحث في جبال من سجلات البيانات، ومقاييس الأداء، وتتبعات الشبكة، وهي مهمة بطيئة، وعرضة للخطأ، ومجهدة.
وقد طور باحثون في جامعة أوميو (Umeå University) والجامعة الحرة في أمستردام (Vrije Universiteit Amsterdam) نهجًا جديدًا للمساعدة في حل هذه المشكلة، حيث أنشأوا نظامًا يستخدم وكيل ذكاء اصطناعي لإدارة العملية بأكملها من العثور على هذه المشكلات وإصلاحها. وبدلاً من مجرد البحث عن الأعطال الواضحة، تم تصميم هذا النظام للكشف عن وقت تدهور الخدمة، ومعرفة سبب حدوث ذلك بالضبط، ثم اقتراح حل. جوهر عملهم هو إطار عمل يسمى "Agent-MIRUPD"، والذي يعمل كمساعد رقمي يمكنه التفكير في المواقف المعقدة، تمامًا كما يفعل مهندس خبير، ولكن بسرعة الكمبيوتر. وقد اختبر الباحثون هذا النظام في بيئة محكومة تحاكي أعطال الخدمات المصغرة في العالم الحقيقي، بما في ذلك السيناريوهات التي تتقادم فيها الخدمات وتتباطأ بمرور الوقت، ووجدوا أنه يمكنه التعامل مع دورة الاستجابة للحوادث بالكامل بدقة عالية.
يعمل النظام من خلال تقسيم عملية حل المشكلات إلى أربع مراحل متميزة: الكشف، والتحديد الموضعي، والتحليل، والتخفيف. أولاً، يقوم الوكيل بمراقبة النظام باستمرار لمعرفة ما إذا كان هناك خطب ما. وإذا رصد مشكلة، ينتقل إلى المرحلة الثانية، حيث يحاول تحديد الخدمة المسببة للمشكلة بالضبط. وفي المرحلة الثالثة، يتعمق لفهم السبب الجذري، مثل تسرب الذاكرة أو خطأ في الإعدادات. وأخيرًا، في مرحلة التخفيف، يقرر الإجراء الذي يجب اتخاذه لاستعادة النظام. وتعد ميزة حاسمة في هذا التصميم هي كيفية تعامله مع عدم اليقين؛ فبالنسبة للمشكلات الواضحة، مثل الإعدادات الخاطئة، يمكن للوكيل تطبيق الإصلاح تلقائيًا. ومع ذلك، بالنسبة للمشكلات الأكثر دقة حيث لا يكون الحل الصحيح واضحًا، يتوقف النظام ويطلب موافقة مشغل بشري قبل إجراء أي تغييرات. يضمن نهج "الإنسان في الحلقة" (human-in-the-loop) هذا أن الذكاء الاصطناعي لن يتسبب بالخطأ في تفاقم الوضع أثناء محاولته للمساعدة.
ولجعل هذا يعمل، زود الباحثون الذكاء الاصطناعي بمجموعة من الأدوات المتخصصة التي تسمح له بالاستعلام عن معلومات محددة من النظام، مثل التحقق من حالة البرامج الجارية أو قراءة سجلات الأخطاء. وبدلاً من تغذية الذكاء الاصطناعي بالبيانات الخام، توفر هذه الأدوات إجابات ملخصة ومنظمة، مما يساعد الذكاء الاصطناعي على التفكير بفعالية أكبر دون أن يشعر بالإرهاق. كما يستخدم النظام تقنية "نشر سياق المرحلة" (stage-context propagation)، مما يعني أن الاستنتاج الذي تم التوصل إليه في مرحلة ما يتم تمريره مباشرة إلى المرحلة التالية. فعلى سبيل المثال، بمجرد أن يحدد الوكيل خدمة معيبة، تُستخدم هذه المعلومة فورًا كنقطة انطلاق لمرحلة التحليل، مما يمنع الذكاء الاصطناعي من الاضطرار لبدء تحقيقه من الصفر. تتيح هذه الاستمرارية للنظام الانتقال عبر عملية التشخيص بشكل أسرع بكثير من الطرق السابقة.
وعندما اختبر الباحثون نظامهم مقابل الأدوات الحالية ووكلاء الذكاء الاصطناعي الآخرين، كانت النتائج كبيرة. ففي السيناريوهات المتعلقة بالأعطال الوظيفية، حيث تفشل الخدمات تمامًا، حقق النظام دقة تصل إلى 90 بالمائة. أما في سيناريوهات تدهور الأداء الأكثر صعوبة، حيث تتباطأ الخدمات ولكنها لا تتوقف، فقد حقق دقة بنسبة 85 بالمائة. كما أثبت النظام أنه أسرع وأكثر كفاءة بكثير من منافسيه؛ فقد قلل الوقت اللازم للعثور على السبب الجذري للمشكلة من 244 ثانية إلى 52 ثانية. علاوة على ذلك، استخدم موارد حوسبية أقل بنسبة 51.3 بالمائة، مقاسة بالرموز (tokens)، وهي الوحدات الأساسية للبيانات التي يعالجها الذكاء الاصطناعي للتفكير. ومن حيث إصلاح المشكلات، حسن النظام دقة إجراءات التخفيف من 40 بالمائة إلى 70 بالمائة مقارنة بوكيل أساسي قياسي.
كما سلطت الدراسة الضوء على أهمية الإشراف البشري. فعندما سُمح للنظام بالعمل بشكل مستقل تمامًا في المشكلات المتعلقة بالأداء، واجه أحيانًا صعوبة في اختيار الحل الأفضل لأن هذه المشكلات غالبًا ما يكون لها حلول متعددة، لكل منها مقايضات مختلفة. ومن خلال إشراك خبير بشري لمراجة واعتماد الإجراءات المقترحة، تمكن النظام من اختيار استراتيجيات استرداد أكثر موثوقية. ووجد الباحثون أنه عندما قدم الذكاء الاصطناعي شرحًا واضحًا لمنطقه وقم المشغل البشري بالتحقق من الاختيار، زادت الفعالية الإجمالية للاسترداد. يشير هذا إلى أن النهج الأكثر قوة ليس استبدال المهندسين البشريين، بل منحهم مساعدًا ذكيًا يتولى الأعباء الثقيلة لتحليل البيانات والتشخيص الأولي، تاركًا القرار النهائي بشأن الإصلاحات المعقدة للحكم البشري.
ويقر الباحثون بأن عملهم لا يزال في مرحلة المحاكاة وأن بيئات الإنتاج في العالم الحقيقي أكثر تعقيدًا. وهم يخططون لاختبار النظام مع أعباء عمل صناعية فعلية واستكشاف طرق لجعل الذكاء الاصطناعي أكثر كفاءة باستخدام نماذج أصغر وأقل تكلفة. ومع ذلك، فإن النتائج الحالية تثبت أنه من الممكن تشغيل وكلاء الذكاء الاصطناعي لدورة الحياة الكاملة للاستجابة للحوادث في الخدمات المصغرة. ومن خلال الجمع بين الكشف الآلي والإشراف البشري، يقدم النظام مسارًا عمليًا نحو بنية تحتية رقمية أكثر مرونة، قادرة على التعامل مع الإخفاقات الطفيفة والبطيئة التي غالبًا ما تمر دون ملاحظة حتى تسبب اضطرابات كبرى. ويظهر العمل أنه مع التصميم الصحيح، يمكن للذكاء الاصطناعي أن يصبح شريكًا موثوقًا في الحفاظ على سير الأنظمة الحيوية للحياة المعاصرة بسلاسة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.