← नवीनतम पेपर
🤖 AI

Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts

यह शोधपत्र WM-SAR प्रस्तुत करता है, जो एक वर्ल्ड-मॉडल करेक्टर (world-model corrector) है जो पारंपरिक लक्षण-स्कैनिंग (symptom-scanning) दृष्टिकोणों से बेहतर प्रदर्शन करता है, क्योंकि यह बड़े एजेंट प्लानिंग ग्राफ में त्रुटियों को बढ़ाने वाले विशिष्ट कारण उप-ग्राफ (causal subgraph) की पहचान करता है और उन्हें ठीक करता है, जिससे पूर्ण-ग्राफ रीप्लानिंग की कम्प्यूटेशनल लागत के बिना कुशल इन-प्लेस स्थिरीकरण (in-place stabilization) सक्षम होता है।

मूल लेखक: Xinyuan Song, Zekun Cai

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyuan Song, Zekun Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल अंतरिक्ष यान (एक AI एजेंट) के कप्तान हैं जो एक जटिल आकाशगंगा के माध्यम से रास्ता खोज रहा है। आपका जहाज केवल एक सीधी रेखा में नहीं चलता; यह अपनी यात्रा का एक विशाल, शाखाओं वाला मानचित्र बनाता है, जिसमें रास्ते में हजारों पड़ाव, टूल का उपयोग और जाँच शामिल होती है। इस मानचित्र को प्लानिंग ग्राफ (planning graph) कहा जाता है।

कभी-कभी, जहाज कोई गलती कर देता है। शायद उसने गलत ईंधन चुन लिया, स्टार चार्ट को गलत पढ़ लिया, या कोई नियम भूल गया। अतीत में, जब जहाज गलती करता था, तो मानक समाधान यह था कि पूरे मानचित्र को फेंक दिया जाए और पूरी यात्रा को शुरू से फिर से बनाया जाए।

लेखक इस पेपर में कहते हैं: "ऐसा करना बंद करें!"

उनका तर्क है कि पूरे मानचित्र को फिर से बनाना ईंधन (कंप्यूटेशनल पावर) और समय की बर्बादी है। यह एक पूरी किताब को फेंक देने जैसा है क्योंकि आपने पेज 50 पर एक शब्द गलत लिख दिया है। इसके बजाय, आपको उस विशिष्ट टूटे हुए हिस्से को खोजना चाहिए और केवल उसे ठीक करना चाहिए।

यहाँ समस्या यह है: ठीक वह टूटा हुआ हिस्सा कहाँ है?

"दृश्य लक्षणों" का जाल (The Trap of "Visible Symptoms")

अधिकांश वर्तमान मरम्मत विधियाँ एक ऐसे डॉक्टर की तरह कार्य करती हैं जो केवल बुखार का इलाज करता है।

  • परिदृश्य: जहाज का इंजन ओवरहीट हो रहा है (दृश्य लक्षण) क्योंकि तीन घंटे पहले ईंधन लाइन में एक छोटा सा वाल्व उल्टा लगाया गया था (मूल कारण)।
  • पुराना तरीका: "इंजीनियरिंग" मरम्मत विधि मानचित्र को स्कैन करती है, देखती है कि इंजन गर्म हो गया है, और कहती है, "आह, इंजन खराब है! चलिए इंजन को ठीक करते हैं।" यह इंजन को पैच करती है।
  • परिणाम: इंजन कुछ समय के लिए ठंडा हो जाता है, लेकिन क्योंकि उल्टा लगा हुआ वाल्व अभी भी वहीं है, यात्रा के अगले चरण में इंजन फिर से ओवरहीट हो जाता है। जहाज अभी भी खराब है; आपने केवल लक्षण का इलाज किया, बीमारी का नहीं।

नया समाधान: WM-SAR (द "एम्प्लीफायर" डिटेक्टर)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे WM-SAR कहा जाता है। जो चीज़ सबसे अधिक टूटी हुई दिखती है उसे खोजने के बजाय, WM-SAR उस चीज़ को खोजता है जो पूरे सिस्टम को अस्थिर बनाती है।

इसे एक साउंड सिस्टम की तरह समझें जिसमें माइक्रोफ़ोन स्पीकर के बहुत करीब है

  • लक्षण: स्पीकर बहुत ज़ोर से चीख रहे हैं (उच्च त्रुटि/error)।
  • पुराना समाधान: आप स्पीकर की आवाज़ कम कर देते हैं। चीख एक पल के लिए रुक जाती है, लेकिन जैसे ही आप आवाज़ वापस बढ़ाते हैं, यह फिर से चीखने लगता है क्योंकि माइक्रोफ़ोन अभी भी बहुत करीब है।
  • WM-SAR समाधान: यह विधि पूछती है, "शोर को क्या एम्प्लीफाई (बढ़ा) कर रहा है?" यह माइक और स्पीकर के बीच के फीडबैक लूप की पहचान करती है। यह केवल वॉल्यूम कम नहीं करती; यह माइक्रोफ़ोन को हटा देती है। एक बार जब फीडबैक लूप टूट जाता है, तो सिस्टम स्थिर हो जाता है, भले ही स्पीकर सबसे तेज़ शोर कर रहे हों।

WM-SAR कैसे काम करता है ("पीछे की ओर" खोज)

  1. एम्प्लीफायर को खोजें: शुरुआत से अंत तक मैप को स्कैन करने के बजाय, WM-SAR विफलता (failure) से पीछे की ओर काम करता है। यह पूछता है: "कौन सा छोटा समूह, जो आपस में जुड़ा हुआ है, इस त्रुटि को दोहराने के लिए जिम्मेदार है?"
  2. "कॉज़ल सबग्राफ" (Causal Subgraph) खोजें: यह घटनाओं की एक छोटी, जुड़ी हुई श्रृंखला (जैसे उल्टा वाल्व और फ्यूल पंप) को अलग करता है, जिसे ठीक करने से त्रुटि का बढ़ना रुक जाता है।
  3. AI को एक छोटा सा नोट भेजें: AI को पूरे 10,000 चरणों वाले मानचित्र को दिखाने के बजाय (जो उसे भ्रमित करता है और मेमोरी बर्बाद करता है), WM-SAR केवल उस छोटे, टूटे हुए क्रम को AI के पास भेजता है।
  4. AI इसे ठीक करता है: AI समस्या के इस साफ और केंद्रित हिस्से को देखता है, मूल कारण का पता लगाता है, और इसे ठीक करता है।

यह क्यों महत्वपूर्ण है

इस पेपर ने सिम्युलेटेड एजेंट कार्यों (जैसे सॉफ्टवेयर डिबगिंग और वेब नेविगेशन) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • पुराने तरीकों ने अक्सर गलत चीज़ को ठीक किया या भाग्यशाली होने के लिए पूरे मानचित्र को देखना पड़ा।
  • WM-SAR ने बहुत कम जानकारी (कम "टोकन" या शब्द) का उपयोग करके समस्या को ठीक किया।
  • स्थिरता (Stability): WM-SAR द्वारा समस्या ठीक करने के बाद, एजेंट केवल अगले कदम पर जीवित नहीं रहा; वह सैकड़ों भविष्य के कदमों तक स्थिर रहा। त्रुटि वापस नहीं आई।

मुख्य निष्कर्ष (The Bottom Line)

इस पेपर का मुख्य संदेश है: केवल लक्षण को ठीक न करें; एम्प्लीफायर को ठीक करें।

यदि आप एक जटिल AI एजेंट को ठीक करना चाहते हैं, तो केवल उस हिस्से को पैच न करें जो वर्तमान में चिल्ला रहा है। उस छोटे, छिपे हुए कनेक्शन को खोजें जो पूरे सिस्टम को चिल्लाने पर मजबूर कर रहा है, उसे ठीक करें, और बाकी सिस्टम अपने आप शांत हो जाएगा। यह समय बचाता है, पैसा बचाता है, और AI को बहुत अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →