← أحدث الأبحاث
💻 computer science

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

تقدم الورقة البحثية FailFast-RestartSmart، وهو متحكم ثنائي المراحل يستخدم مراقباً خفيف الوزن للتنبؤ بمسارات وكيل هندسة البرمجيات (SWE agent) الفاشلة وإنهائها مبكراً لتوفير الرموز (tokens)، مع توظيف آلية إعادة تشغيل ذكية تستفيد من التعديلات الجزئية من التشغيل الذي تم قطعه لتحسين معدلات حل المهام بشكل كبير مقارنة بإعادة التشغيل البارد.

المؤلفون الأصليون: Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

نُشر 2026-08-05
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا ذكيًا جدًا، ولكنه متحمس للغاية أحيانًا، كيف يصلح آلة معطلة في مصنع ضخم. هذا الروبوت، الذي يسمى "الوكيل الذكي" (AI agent)، لا يكتفي بمجرد النقر بأصابعه لإصلاح الأشياء؛ بل يتعين عليه التجول، وقراءة الكتيبات، والإمساك بالأدوات، ومحاولة شد برغي، والتحقق مما إذا كان ذلك قد نجح، ثم الانتقال إلى الخطوة التالية. تسمى هذه العملية "المسار" (trajectory). وأحيانًا، يعلق الروبوت في حلقة مفرغة، يحاول تجربة نفس الفكرة الخاطئة مرارًا وتكرارًا، أو يتوه في مسار لا يؤدي إلى أي مكان. ولأن على الروبوت تذكر كل خطوة اتخذها ليحافظ على مكانه في المصنع، فإن هذه الرحلات الطويلة والفاشلة تصبح مكلفة للغاية من حيث قدرة الحاسوب والوقت. الأمر يشبه طالبًا يستمر في إعادة قراءة نفس الفصل الخاطئ من كتاب مدرسي لمدة ثلاث ساعات بدلًا من إدراك أنه يدرس موضوعًا خاطئًا وتغيير الكتاب.

السؤال الكبير الذي يسأله الباحثون هو: هل يمكننا تعليم الروبوت أن يدرك: "مهلًا، أنا أسلك المسار الخاطئ"، قبل أن يهدر ساعات من الوقت؟ وإذا أوقفناه، هل يمكننا حفظ الأجزاء المفيدة مما حاول القيام به حتى لا يضطر للبدء من الصفر تمامًا؟ تتناول هذه الورقة البحثية هذه المشكلة تحديدًا. فهي تقدم نظامًا يعمل كـ "مشرف ذكي"، يراقب تقدم الروبوت في الوقت الفعلي. إذا رأى المشرف أن الروبوت على وشك الفشل، فإنه يضغط على المكابح مبكرًا لتوفير الطاقة. ولكن بدلاً من مجرد إخبار الروبوت بـ "انسَ كل شيء وابدأ من جديد"، فإنه يسلمه "لوحة ملاحظات سحرية" تحتوي على التغييرات البرمجية المفيدة التي أجراها، مما يسمح للروبوت بالمحاولة مرة أخرى بعقل متجدد مع الاحتفاظ بالعمل الجيد الذي أنجزه بالفعل.

المشكلة: "كرة ثلج الرموز" والحلقة الضائعة

وكلاء هندسة البرمجيات يشبهون المحققين الذين يحلون لغزًا. ينظرون إلى مشكلة برمجية، يفكرون في حل، يكتبون بعض الكود، يشغلون اختبارًا، ويرون ما إذا كان يعمل. إذا لم ينجح الأمر، يحاولون مرة أخرى. المشكلة هي أن هؤلاء المحققين غالبًا ما يعلقون في "الاستكشاف المتكرر". قد يستمرون في محاولة نفس الإصلاح الخاطئ، أو يتوهون حول قاعدة البيانات في دوائر. وبينما يفعلون ذلك، يتعين عليهم حمل تاريخ أفكارهم وأفعالهم بالكامل في ذاكرتهم. هذا يخلق "تأثير كرة ثلج الرموز" (token snowball effect)، حيث يصبح كل خطوة أكثر تكلفة كلما طال زمن تشغيل الروبوت.

عندما يفشل الروبوت، فإنه عادة ما يستمر لفترة أطول من الروبوت الناجح. الأمر يشبه سيارة تقود في دوائر حتى ينفد وقودها. لاحظ الباحثون أن هذه الإخفاقات غالبًا ما تظهر علامات تحذيرية مبكرًا — حلقات متكررة أو خطوات زائدة عن الحاجة — قبل وقت طويل من استسلام الروبوت النهائي. التحدي هو أن إيقاف الروبوت مبكرًا جدًا أمر محفوف بالمخاطر. إذا أوقفته عندما كان على وشك تحقيق طفرة نوعية، فقد أهدرت محاولة جيدة. ولكن إذا تركته يعمل حتى يفشل تمامًا، فقد أهدرت موارد أكثر بكثير.

الحل: الفشل السريع - وإعادة التشغيل الذكية

يقترح المؤلفون نظامًا من جزأين يسمى Fail-Fast–Restart-Smart (الفشل السريع - إعادة التشغيل الذكية). فكر في الأمر كفريق من اثنين: مراقب صغير وسريع جدًا يسمى FailFast، ودليل استرداد ذكي يسمى RestartSmart.

FailFast: المراقب الصغير
FailFast هو نموذج ذكاء اصطناء مراقب صغير وخفيف الوزن (يحتوي على 0.6 مليار معلمة فقط، وهو صغير جدًا مقارنة بالروبوت الرئيسي). مهمته هي مراقبة "أفكار" و"أفعال" الروبوت أثناء حدوثها. لا يحتاج إلى رؤية موجات دماغ الروبوت الداخلية؛ فهو يقرأ فقط النص الذي يولده الروبوت.

لتعلم كيفية رصد الفشل، تم تدريب FailFast على آلاف الأمثلة حيث تعلم التمييز بين الروبوت الذي يحرز تقدمًا وذلك الذي يدور في حلقة مفرغة. إنه يبحث عن علامات محددة، مثل عدم إحراز تقدم في إصلاح اختبارات الكود. إذا رأى FailFast أن الروبوت من المرجح أن يفشل، فإنه يطلق إنذارًا. والأهم من ذلك، أن هذا الإنذار تمت معايرته بحيث نادرًا ما يوقف روبوتًا كان سينجح بالفعل (مع الحفاظ على انخفاض "الإنذارات الكاذبة").

RestartSmart: لوحة الملاحظات السحرية
عندما يطلق FailFast الإنذار، يتوقف الروبوت. ولكن هنا يحدث السحر. في الماضي، إذا فشل الروبوت، كنت تطلب منه فقط أن "يبدأ من جديد" من الصفر. وهذا ما يسمى "إعادة التشغيل البارد" (cold restart)، وهو غير فعال لأن الروبوت يتعين عليه إعادة اكتشاف كل ما عرفه بالفعل.

يغير RestartSmart قواعد اللعبة. عندما يتم إيقاف الروبوت، يقوم النظام بأخذ جميع تعديلات الكود التي أجراها الروبوت قبل توقفه وحفظها كـ "فرق" (diff) (أي قائمة بالتغييرات). ثم يبدأ تشغيلًا جديدًا ومنعشًا للروبوت. هذا الروبوت الجديد ليس لديه ذاكرة للأفكار القديمة والمربكة التي أدت إلى الفشل. ومع ذلك، فإنه يحصل على الوصول إلى "لوحة الملاحظات السحرية" التي تحتوي على تغييرات الكود.

يمكن للروبوت الجديد أن ينظر إلى اللوحة ويقول: "أوه، هذا التغيير في الكود يبدو جيدًا، سأحتفظ به"، أو "هذا الجزء خطأ، سأرميه". لديه الحرية في قبول أو تعديل أو التخلص من العمل السابق. هذا يسم much للروبوت لتجاوز الجزء الممل من إعادة اكتشاف الحل مع تجنب فخ التفكير السيئ الذي تسبب في الفشل.

ماذا وجدوا: توفير "الوقود" وتحقيق نتائج أفضل

اختبر الباحثون هذا النظام على معيار شهير يسمى SWE-bench Verified، والذي يتضمن إصلاح أخطاء برمجية حقيقية. استخدموا نموذج ذكاء اصطناعي قوي (Qwen3.6-27B) كروبوت رئيسي، واستخدموا مراقب FailFast الصغير لمراقبته.

توفير "الوقود"
أظهرت النتائج أن FailFast بارع للغاية في رصد المشاكل مبكرًا. عند ضبط إعداد صارم حيث أرادوا فقط إيقاف روبوت ناجح بنسبة 5% فقط من المرات، تمكن FailFast من توفير 20.4% من إجمالي قدرة الحاسوب (الرموز/tokens) المستخدمة. وهذا فوز كبير. للمقارنة، وفرت الطرق الأخرى التي تعتمد فقط على عد عدد الخطوات التي يتخذها الروبوت حوالي 11.4% فقط، بينما وفرت طريقة أكثر تعقيدًا تسمى AgentStop حوالي 12.5%. لقد تمكن المراقب الصغير من توفير موارد أكثر من الطرق التي تتطلب بيانات أكثر تعقيدًا لتعمل.

قوة "لوحة الملاحظات السحرية"
عندما جمعوا بين FailFast وRestartSmart، كانت النتائج أفضل. من خلال إيقاف عمليات التشغيل الفاشلة والسماح للروبوت بالمحاولة مرة أخرى باستخدام "لوحة الملاحظات السحرية"، رفعوا معدل نجاح روبوت Qwen3.6-27B من 66.6% إلى 71.8%.

هذه قفزة كبيرة. لو كانوا قد استخدموا فقط "إعادة التشغيل البارد" (البدء من جديد دون مساعدة)، لكان معدل النجاح قد ارتفع إلى 66.8% فقط. وهذا يثبت أن مجرد الإيقاف ليس كافيًا؛ بل يجب عليك الحفاظ على الأجزاء المفيدة من العمل. سمحت "لوحة الملاحظات السحرية" للروبوت بالتعافي من الأخطاء التي كان سيفشل فيها لولا ذلك، دون الوقوع في فخ التفكير السيئ الذي تسبب في الخطأ.

إنه يعمل على روبوتات أخرى أيضًا
أحد أروع الاكتشافات هو أن هذا النظام مرن للغاية. تم تدريب مراقب FailFast باستخدام بيانات من نوع واحد فقط من الروبوتات (Qwen3.6-27B)، ولكنه عمل بنفس الكفاءة على ثلاثة أنواع أخرى مختلفة من الروبوتات، بما في ذلك نظام مغلق ومملوك لشركة (Gemini 3 Flash). هذا يشير إلى أن "علامات الفشل" عالمية عبر مختلف نماذج الذكاء الاصطناعي، وليست خاصة بنموذج واحد فقط.

لماذا يهم هذا

تشير هذه الورقة البحثية إلى أننا لسنا بحاجة للاعتماد على نماذج ذكاء اصطناعي ضخمة ومكلفة لإصلاح أخطاء النماذج الضخمة الأخرى. يمكن لمراقب صغير ورخيص أن يوفر الكثير من المال والطاقة عن طريق إيقاف عمليات التشغيل السيئة مبكرًا. علاوة على ذلك، توضح الورقة أنه عندما يفشل الذكاء الاصطناعي، فإنه غالبًا ما يترك وراءه أثرًا من المعلومات المفيدة. وبدلاً من حرق هذا الأثر، يمكننا حفظه والسماح للذكاء الاصطناعي بالمحاولة مرة أخرى بمنظور جديد، مع الاحتفاظ بالأجزاء الجيدة والتخلص من الأجزاء السيئة.

يلاحظ الباحثون بعناية أن هذا تم اختباره في بيئة محددة (SWE-bench) وقد يحتاج إلى مزيد من العمل لتطبيقه على جميع أنواع المهام البرمجية. ومع ذلك، فإن النتائج تشير بقوة إلى أن "الفشل السريع - إعادة التشغيل الذكية" هو طريقة واعدة لجعل وكلاء الذكاء الاصطناعي أكثر كفاءة وفعالية، مما يحول الجهد الضائع إلى فرصة ثانية للنجاح.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →