← नवीनतम पेपर
💻 computer science

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

यह शोध पत्र FailFast-RestartSmart को प्रस्तुत करता है, जो एक दो-चरणीय नियंत्रक (two-stage controller) है जो टोकन बचाने के लिए विफल होते हुए SWE एजेंट प्रक्षेपवक्र (trajectories) का पूर्वानुमान लगाने और उन्हें जल्दी समाप्त करने के लिए एक हल्के मॉनिटर का उपयोग करता है, जबकि एक स्मार्ट रिस्टार्ट तंत्र का उपयोग करता है जो बाधित रन से आंशिक संपादन (partial edits) का लाभ उठाकर कोल्ड रिस्टार्ट की तुलना में कार्य समाधान दरों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

प्रकाशित 2026-08-05
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन कभी-कभी ज़रूरत से ज़्यादा उत्साही, रोबोट को एक विशाल कारखाने में एक टूटी हुई मशीन को ठीक करना सिखा रहे हैं। यह रोबोट, एक "AI एजेंट," चीज़ों को ठीक करने के लिए केवल चुटकी बजाकर काम नहीं करता; इसे इधर-उधर घूमना पड़ता है, मैनुअल पढ़ना पड़ता है, औज़ार उठाने पड़ते हैं, एक बोल्ट को कसने की कोशिश करनी पड़ती है, यह देखना पड़ता है कि क्या इसने काम किया, और फिर अगले कदम पर जाना पड़ता है। इस प्रक्रिया को "ट्रैजेक्टरी" (trajectory) कहा जाता है। कभी-कभी रोबोट एक लूप में फंस जाता है, एक ही टूटे हुए विचार को बार-बार आज़माता रहता है, या वह ऐसे रास्ते पर निकल जाता है जिसका कोई अंत नहीं है। क्योंकि रोबोट को कारखाने में अपनी जगह बनाए रखने के लिए अपने हर एक कदम को याद रखना पड़ता है, इसलिए ये लंबी, असफल यात्राएं कंप्यूटर पावर और समय के मामले में अविश्वसनीय रूप से महंगी हो जाती हैं। यह एक ऐसे छात्र की तरह है जो यह समझने के बजाय कि उसने गलत विषय चुन लिया है और किताब बदल लेनी चाहिए, तीन घंटे तक एक ही गलत अध्याय को बार-बार पढ़ता रहता है।

बड़ा सवाल जो शोधकर्ताओं ने पूछा है वह यह है: क्या हम रोबोट को यह महसूस करना सिखा सकते हैं कि, "हे, मैं गलत रास्ते पर जा रहा हूँ," इससे पहले कि वह घंटों का समय बर्बाद कर दे? और यदि हम उसे रोक देते हैं, तो क्या हम उसके द्वारा किए गए उपयोगी हिस्सों को बचा सकते हैं ताकि उसे बिल्कुल शून्य से शुरुआत न करनी पड़े? यह पेपर ठीक इसी समस्या को संबोधित करता है। यह एक ऐसा सिस्टम पेश करता है जो एक स्मार्ट सुपरवाइजर की तरह काम करता है, जो वास्तविक समय में रोबोट की प्रगति पर नज़र रखता है। यदि सुपरवाइजर देखता है कि रोबोट विफल होने वाला है, तो वह ऊर्जा बचाने के लिए उसे समय से पहले ही ब्रेक लगा देता है। लेकिन केवल उसे "सब कुछ भूल जाओ और फिर से शुरू करो" कहने के बजाय, यह रोबोट को एक "जादुई क्लिपबोर्ड" सौंपता है जिसमें उसके द्वारा किए गए उपयोगी कोड परिवर्तन शामिल होते हैं, जिससे रोबोट एक ताज़ा दिमाग के साथ फिर से प्रयास कर सके लेकिन अपने पहले किए गए अच्छे काम को भी बरकरार रख सके।

समस्या: "टोकन स्नोबॉल" और बर्बाद होता लूप

सॉफ्टवेयर इंजीनियरिंग एजेंट किसी रहस्य को सुलझाने वाले जासूसों की तरह होते हैं। वे कोड की समस्या को देखते हैं, समाधान के बारेंे में सोचते हैं, कोड टाइप करते हैं, एक टेस्ट चलाते हैं, और देखते हैं कि क्या यह काम करता है। यदि यह काम नहीं करता है, तो वे फिर से प्रयास करते हैं। समस्या यह है कि ये जासूस अक्सर "पुनरावृत्ति अन्वेषण" (redundant exploration) में फंस जाते हैं। वे शायद एक ही गलत सुधार को बार-बार आज़माते रहेंगे, या वे कोडबेस के चारों ओर चक्कर काटते रहेंगे। ऐसा करते हुए, उन्हें अपने विचारों और कार्यों का पूरा इतिहास अपनी मेमोरी में ले जाना पड़ता है। यह एक "टोकन स्नोबॉल प्रभाव" पैदा करता है, जहाँ रोबोट जितना लंबा चलता है, उसका हर एक कदम उतना ही महंगा होता जाता है।

जब एक रोबोट विफल होता है, तो वह आमतौर पर सफल होने वाले रोबोट की तुलना में अधिक समय तक चलता है। यह एक ऐसी कार की तरह है जो गैस खत्म होने तक गोल-गोल घूमती रहती है। शोधकर्ताओं ने देखा कि इन विफलताओं में अक्सर शुरुआती चेतावनी संकेत मिलते हैं—जैसे दोहराव वाले लूप या अनावश्यक कदम—इससे बहुत पहले कि रोबोट अंततः हार मान ले। चुनौती यह है कि रोबोट को बहुत जल्दी रोकना जोखिम भरा है। यदि आप उसे तब रोक देते हैं जब वह वास्तव में किसी बड़ी सफलता के करीब था, तो आपने एक अच्छा रन बर्बाद कर दिया है। लेकिन यदि आप उसे पूरी तरह से विफल होने तक चलने देते हैं, तो आपने और भी अधिक संसाधनों को बर्बाद कर दिया है।

समाधान: फेल-फास्ट (Fail-Fast) और रीस्टार्ट-स्मार्ट (Restart-Smart)

लेखक एक दो-भाग वाली प्रणाली प्रस्तावित करते हैं जिसे Fail-Fast–Restart-Smart कहा जाता है। इसे एक दो-सदस्यीय टीम के रूप में सोचें: एक छोटा, सुपर-फास्ट वॉचडॉग जिसका नाम है FailFast, और एक चतुर रिकवरी गाइड जिसका नाम है RestartSmart

FailFast: छोटा वॉचडॉग
FailFast एक बहुत ही छोटा, हल्का AI मॉनिटर है (केवल 0.6 बिलियन पैरामीटर्स वाला, जो मुख्य रोबोट की तुलना में बहुत छोटा है)। इसका काम रोबोट के "विचारों" और "कार्यों" को होते हुए देखना है। इसे रोबोट के आंतरिक मस्तिष्क तरंगों को देखने की आवश्यकता नहीं है; यह केवल उस टेक्स्ट को पढ़ता है जिसे रोबोट जनरेट कर रहा है।

यह सीखने के लिए कि विफलता को कैसे पहचाना जाए, FailFast को हजारों उदाहरणों पर प्रशिक्षित किया गया था जहाँ इसने यह पहचानना सीखा कि एक रोबोट जो प्रगति कर रहा है और एक जो केवल पहिए घुमा रहा है (एक ही जगह अटक गया है), उसमें क्या अंतर है। यह प्रगति में कमी जैसे विशिष्ट संकेतों को देखता है, जैसे कि कोड टेस्ट को ठीक करने में प्रगति का अभाव। यदि FailFast देखता है कि रोबोट के विफल होने की संभावना है, तो वह अलार्म बजा देता है। महत्वपूर्ण बात यह है कि यह अलार्म इस तरह से कैलिब्रेट किया गया है कि यह शायद ही कभी किसी ऐसे रोबोट को रोकता है जो वास्तव में सफल होने वाला था (ताकि "फॉल्स अलार्म" कम रहें)।

RestartSmart: जादुई क्लिपबोर्ड
जब FailFast अलार्म बजाता है, तो रोबोट रुक जाता है। लेकिन यहीं पर जादू होता है। अतीत में, यदि कोई रोबमान विफल हो जाता था, तो आप बस उसे शून्य से "फिर से शुरू करने" के लिए कहते थे। इसे "कोल्ड रीस्टार्ट" (cold restart) कहा जाता है, और यह अक्षम है क्योंकि रोबोट को वह सब कुछ फिर से खोजना पड़ता है जो उसने पहले ही समझ लिया था।

RestartSmart खेल बदल देता है। जब रोबोट को रोका जाता है, तो सिस्टम उन सभी कोड बदलावों को लेता है जो रोबोट ने रुकने से पहले किए थे और उन्हें एक "डिफ" (diff - बदलावों की सूची) के रूप में सहेज लेता है। इसके बाद यह रोबोट का एक बिल्कुल नया, ताज़ा रन शुरू करता है। इस नए रोबोट के पास पुराने, भ्रमित विचारों की कोई स्मृति नहीं होती जो विफलता का कारण बने थे। हालाँकि, इसे "जादुई क्लिपबोर्ड" वाला एक्सेस दिया जाता है जिसमें कोड परिवर्तन शामिल हैं।

नया रोबोट क्लिपबोर्ड को देख सकता है और कह सकता है, "ओह, यह कोड परिवर्तन अच्छा लग रहा है, मैं इसे रखूँगा," या "यह हिस्सा गलत है, मैं इसे फेंक दूँगा।" उसके पास पिछले काम को स्वीकार करने, संशोधित करने या त्यागने की स्वतंत्रता होती है। यह रोबोट को उस बोरिंग हिस्से को छोड़ने की अनुमति देता है जहाँ उसे समाधान को फिर से खोजना पड़ता है, जबकि वह उस खराब तर्क (reasoning) के जाल से बच जाता है जिसके कारण विफलता हुई थी।

उन्होंने क्या पाया: समय की बचत और बेहतर परिणाम

शोधकर्ताओं ने एक प्रसिद्ध बेंचमार्क SWE-bench Verified पर इस सिस्टम का परीक्षण किया, जिसमें वास्तविक दुनिया के सॉफ़्टवेयर बग्स को ठीक करना शामिल है। उन्होंने मुख्य रोबोट के रूप में एक शक्तिशाली AI मॉडल (Qwen3.6-27B) और छोटे FailFast मॉनिटर का उपयोग किया।

"गैस" की बचत
परिणामों से पता चला कि FailFast समस्याओं को जल्दी पहचानने में अविश्वसनीय रूप से कुशल है। एक सख्त सेटिंग पर जहाँ वे केवल 5% बार ही किसी सफल रोबोट को गलती से रोकना चाहते थे, FailFast ने उपयोग किए गए कुल कंप्यूटर पावर (टोकन्स) में से 20.4% की बचत की। यह एक बड़ी जीत है। तुलना के लिए, अन्य तरीके जो केवल रोबोट द्वारा लिए गए चरणों की गिनती करते थे, केवल 11.4% बचत कर पाए, और एक अधिक जटिल तरीका जिसे AgentStop कहा जाता है, वह 12.5% बचा पाया। छोटा मॉनिटर उन तरीकों की तुलना में अधिक संसाधन बचाने में सक्षम था जिन्हें काम करने के लिए बहुत अधिक जटिल डेटा की आवश्यकता होती है।

"जादुई क्लिपबोर्ड" की शक्ति
जब उन्होंने FailFast को RestartSmart के साथ जोड़ा, तो परिणाम और भी बेहतर रहे। विफल होने वाले रन को रोककर और रोबोट को "जादुई क्लिपबोर्ड" के साथ फिर से प्रयास करने देकर, उन्होंने Qwen3.6-27B रोबोट की सफलता दर को 66.6% से बढ़ाकर 71.8% कर दिया।

यह एक महत्वपूर्ण उछाल है। यदि उन्होंने केवल "कोल्ड रीस्टार्ट" (बिना किसी मदद के फिर से शुरू करना) का उपयोग किया होता, तो सफलता दर केवल 66.8% तक ही बढ़ पाती। यह साबित करता है कि केवल रोकना ही काफी नहीं है; आपको किए गए काम के उपयोगी हिस्सों को सुरक्षित रखना होगा। "जादुई क्लिपबोर्ड" ने रोबोट को उन गलतियों से उबरने में मदद की जिनके कारण वह विफल हो जाता, बिना उस खराब तर्क में फंसे जो उसकी गलती का कारण बना था।

यह अन्य रोबोटों पर भी काम करता है
एक सबसे दिलचस्प खोज यह है कि यह सिस्टम बहुत लचीला है। FailFast मॉनिटर को केवल एक प्रकार के रोबोट (Qwen3.6-27B) के डेटा का उपयोग करके प्रशिक्षित किया गया था, लेकिन यह तीन अन्य अलग-अलग प्रकार के रोबोटों पर भी उतना ही अच्छा काम करता है, जिसमें एक क्लोज्ड, प्रोप्राइटरी सिस्टम (Gemini 3 Flash) भी शामिल है। यह सुझाव देता है कि "विफलता के संकेत" विभिन्न AI मॉडलों में सार्वभौमिक हैं, न कि केवल किसी एक विशिष्ट मॉडल तक सीमित।

यह क्यों मायने रखता है

यह पेपर बताता है कि हमें अन्य विशाल मॉडलों की गलतियों को ठीक करने के लिए विशाल, महंगे AI मॉडलों पर निर्भर रहने की आवश्यकता नहीं है। एक छोटा, सस्ता मॉनिटर खराब रन को जल्दी रोककर बहुत सारा पैसा और ऊर्जा बचा सकता है। इसके अलावा, यह दिखाता है कि जब एक AI विफल होता है, तो वह अक्सर उपयोगी संकेतों का एक निशान पीछे छोड़ देता है। उस निशान को जलाने के बजाय, हम उसे सहेज सकते हैं और AI को एक नए दृष्टिकोण के साथ फिर से प्रयास करने दे सकते हैं, अच्छे हिस्सों को रखते हुए और बुरे हिस्सों को हटाते हुए।

शोधकर्ता सावधानीपूर्वक नोट करते हैं कि इसका परीक्षण एक विशिष्ट वातावरण (SWE-bench) में किया गया था और सभी प्रकार के सॉफ़्टवेयर कार्यों पर लागू करने के लिए इसमें और काम करने की आवश्यकता हो सकती है। हालाँकि, परिणाम दृढ़ता से सुझाव देते हैं कि "Fail-Fast, Restart-Smart" AI एजेंटों को अधिक कुशल और प्रभावी बनाने का एक आशाजनक तरीका है, जो बर्बाद हुए प्रयास को सफलता के दूसरे अवसर में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →