Failure-Aware Adaptive Inference Improves Reliability in Long-Horizon Language Model Agents
यह शोध पत्र फेलियर-अवेयर एडेप्टिव इन्फरेंस (FAAI) प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो अडैप्टिव मेमोरी रिट्रीवल, रिस्क एस्टीमेशन और प्रोएक्टिव सेल्फ-करेक्शन के माध्यम से पुन: प्रयोज्य विफलता ज्ञान (reusable failure knowledge) का लाभ उठाता है ताकि बिना किसी अतिरिक्त मॉडल प्रशिक्षण के लॉन्ग-होरिज़न लैंग्वेज मॉडल एजेंटों की विश्वसनीयता और सफलता दर में महत्वपूर्ण सुधार किया जा सके।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
अपने ही पैरों में उलझकर गिरने से बचने की कला
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े अनाड़ी रोबोट को एक विशाल, बदलते हुए भूलभुलैया (maze) में रास्ता खोजने के लिए सिखा रहे हैं। यह रोबोट एक लार्ज लैंग्वेज मॉडल (LLM) द्वारा संचालित है, जो एक प्रकार की कृत्रिम बुद्धिमत्ता (AI) है जो शब्दों को समझने और बातचीत करने में अविश्वसनीय रूप से कुशल है। कंप्यूटर विज्ञान की दुनिया में, हम इन्हें "एजेंट्स" कहते हैं। जब कार्य सरल होता है, जैसे कि किसी एक प्रश्न का उत्तर देना, तो रोबोट आमतौर पर ठीक रहता है। लेकिन जब कार्य एक लंबी यात्रा हो—एक "लॉन्ग-होरिज़न" मिशन जिसमें दर्जनों चरणों की आवश्यकता होती है, जैसे कि एक जटिल यात्रा की योजना बनाना या एक पूरा सॉफ्टवेयर प्रोग्राम लिखना—तो रोबोट लड़खड़ाने लगता है।
मुख्य समस्या यह है कि ठोकर लगने के बाद क्या होता है। एक साधारण खेल में, यदि आप एक गलत चाल चलते हैं, तो आप बस फिर से प्रयास करते हैं। लेकिन एक लंबी, क्रमिक साहसिक यात्रा में, एक गलत चाल पूरे मानचित्र को बदल सकती है। यदि रोबोट गलत दरवाजा खोल देता है, तो वह खुद को इमारत के बाकी हिस्से से बाहर लॉक कर सकता है। इसे "फेलियर प्रोपेगेशन" (failure propagation) कहा जाता है: शुरुआत में हुई एक छोटी सी गलती अंत तक आते-आते एक बड़ी आपदा में बदल जाती है। वैज्ञानिकों ने रोबोट को आगे बढ़ने से पहले अधिक सोचने (जिसे "चेन-ऑफ-थॉट" तकनीक कहा जाता है) या उसे पिछले अनुभवों की लाइब्रेरी देखने देने (जिसे "रिट्रीवल-ऑगमेंटेड जनरेशन" कहा जाता है) के माध्यम से इसे ठीक करने की कोशिश की है। हालाँकि, ये विधियाँ अक्सर सभी पिछले अनुभवों को समान मानती हैं, यह भूल जाती हैं कि कुछ यादें वास्तव में चेतावनी होती हैं। वे अक्सर रोबोट के क्रैश होने के बाद ही यह कहने के लिए रुकती हैं कि, "ओह, चलो फिर से कोशिश करते हैं," जो कि बहुत देर हो चुकी होती है यदि क्रैश ने किसी ऐसी चीज़ को तोड़ दिया हो जिसे ठीक नहीं किया जा सकता।
"फेलियर-अवेयर" सुरक्षा जाल
यहीं पर यूला यांग द्वारा विकसित फेलियर-अवेयर एडेप्टिव इन्फरेंस (FAAF) नामक एक नया फ्रेमवर्क काम आता है। केवल यह याद रखने के बजाय कि क्या काम आया, FAAI AI को अपने पिछले दोषों (mistakes) को "यहाँ मत जाओ" के संकेतों वाले एक खजाने के नक्शे के रूप में देखने के लिए सिखाता है। यह प्रणाली एक अनुभवी गाइड की तरह काम करती है जो न केवल सुंदर दृश्यों को याद रखता है, बल्कि विशेष रूप से उन चट्टानों को भी याद रखता है जहाँ हाइकर्स गिरे थे।
यह व्यवहार में इस प्रकार काम करता है:
- मेमोरी बैंक: हर बार जब AI कोई कार्रवाई करता है, तो वह एक नोट सहेजता है। लेकिन अन्य प्रणालियों के विपरीत जो सब कुछ समान रूप से सहेजती हैं, FAAI विशेष रूप से उन नोट्स को टैग और प्राथमिकता देता है जहाँ चीजें गलत हुईं। यह दुनिया की स्थिति, ली गई कार्रवाई और बुरे परिणाम को संग्रहीत करता है।
- जोखिम की जाँच (Risk Check): एक नया कदम उठाने से पहले, AI केवल अनुमान नहीं लगाता है। यह अपने मेमोरी बैंक को तेजी से स्कैन करता है कि अतीत में ऐसी कौन सी स्थितियाँ थीं जहाँ वह विफल रहा था। फिर यह एक "रिस्क स्कोर" की गणना करता है—एक संख्या जो इस संभावना को दर्शाती है कि यह विशिष्ट कार्रवाई क्रैश का कारण बनेगी।
- पूर्व-खाली सुधार (Pre-Emptive Correction): यदि रिस्क स्कोर बहुत अधिक (0.6 के थ्रेशोल्ड से ऊपर) है, तो AI रुक जाता है। यह क्रैश होने का इंतज़ार नहीं करता। इसके बजाय, यह रुकता है, अपनी योजना पर फिर से विचार करता है, और वातावरण को छूने से पहले ही अपनी कार्रवाई बदल देता है। यह "प्री-एग्जीक्यूशन करेक्शन" है, एक सक्रिय कदम जो त्रुटि को होने से पहले ही रोक देता है।
शोधकर्ताओं ने परीक्षण के लिए दो अलग-अलग डिजिटल दुनिया का उपयोग किया: HotPotQA, जो एक बहु-चरणीय तर्क खेल है जहाँ AI को उत्तर खोजने के लिए दस्तावेजों को खोजना पड़ता है, और WebShop, जो ऑनलाइन शॉपिंग का एक सिमुलेशन है जहाँ AI को विशिष्ट वस्तुएं खरीदने के लिए एक स्टोर में नेविगेट करना होता है। उन्होंने FAAI की तुलना मानक AI विधियों से की, जिनमें वे भी शामिल हैं जो कार्य करने से पहले केवल सोचते हैं, वे भी जो पिछले सफलताओं को देखते हैं, और वे भी जो केवल होने के बाद गलतियों पर विचार करते हैं।
परिणाम नाटकीय थे, विशेष रूप से जैसे-जैसे कार्य लंबे होते गए। जब मिशन छोटे (5 चरण) थे, तो FAAI पहले से ही विजेता था, जिसकी सफलता दर लगभग 54.17% थी, जबकि अगली सर्वश्रेष्ठ विधि केवल लगभग 30.56% ही प्रबंधित कर पाई। लेकिन असली जादू तब हुआ जब मिशन लंबे हो गए। जैसे-जैसे चरणों की संख्या बढ़कर 40 हो गई, अन्य विधियाँ पूरी तरह से विफल हो गईं। उनकी सफलता दर गिरकर 7% से नीचे चली गई, क्योंकि शुरुआत में हुई एक छोटी सी गलती ने पूरी यात्रा को बर्बाद कर दिया। इसके विपरीत, FAAI ने 40 चरणों पर 95.83% की आश्चर्यजनक सफलता दर बनाए रखी।
अध्ययन बताता है कि "सीक्रेट सॉस" केवल बड़ी मेमोरी रखना या अधिक सोचना नहीं है; यह विशेष रूप से भविष्य के जोखिमों की भविष्यवाणी करने के लिए पिछले विफलताओं का उपयोग करना है। जब शोधकर्ताओं ने FAAI से "रिस्क प्रेडिक्शन" वाला हिस्सा हटा दिया, तो सफलता दर 95.83% से गिरकर 17.96% रह गई, जिससे यह सिद्ध हुआ कि यह जानना कि आप कब विफल हो सकते हैं, यह याद रखने से कहीं अधिक महत्वपूर्ण है कि आप क्यों विफल हुए थे। इसके अलावा, डेटा ने दिखाया कि मानक AI के लिए, एक चरण में विफलता अगले चरण में विफलता की 62% संभावना बना देती है। FAAI ने इस श्रृंखला को तोड़ दिया, उस संभावना को घटाकर केवल 18% कर दिया।
दिलचस्प बात यह है कि पेपर यह भी रेखांकित करता है कि "रिफ्लेक्शन" (होने के बाद गलती पर विचार करना) होने से पहले उसे रोकने की तुलना में बहुत कम प्रभावी है। इन सिमुलेशन में, कार्य करने से पहले योजना को ठीक करने की FAAI की क्षमता ने जोखिम भरी स्थितियों के लिए 72.3% रिकवरी दर दिखाई, जबकि वे तरीके जो घटना के बाद केवल विचार करते थे, केवल 31.5% ही प्रबंधित कर सके। हालांकि इस दृष्टिकोण में थोड़ा अधिक समय और कंप्यूटिंग पावर (एक बुनियादी AI की तुलना में लगभग 2.8 गुना धीमा) लगता है, लेकिन इसका ट्रेड-ऑफ एक ऐसा सिस्टम है जो बिना टूटे लंबे, जटिल कार्यों को विश्वसनीय रूप से नेविगेट कर सकता है। लेखक का सुझाव है कि यह दृष्टिकोण अधिक भरोसेमंद AI एजेंट बनाने के लिए एक ब्लूप्रिंट हो सकता है जो न केवल सफलता से सीखते हैं, बल्कि अपने ही गड्ढों से बचना भी सीखते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।