← नवीनतम पेपर
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

यह शोध पत्र "एक्सप्लोरेशन कोलैप्स" (exploration collapse) को एक प्रमुख विफलता मोड के रूप में पहचानता है जहाँ LLM एजेंट सुदृढीकरण शिक्षण (reinforcement learning) के दौरान अपरिचित वातावरणों में नए समाधान खोजने की क्षमता खो देते हैं, और SPA का प्रस्ताव करता है, जो एक ऐसी विधि है जो रिवॉर्ड के लिए अनुकूलन करने से पहले स्वयं के अनुभव के माध्यम से स्टेट (state) और ट्रांज़िशन प्रेडिक्शन (transition prediction) में एजेंट को ग्राउंड करने हेतु सेल्फ-एक्सपीरियंस सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से प्रदर्शन में सुधार करती है।

मूल लेखक: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

प्रकाशित 2026-09-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक कंप्यूटर प्रोग्राम की कल्पना करें जिसे एक इंसान की तरह सोचने और कार्य करने के लिए डिज़ाइन किया गया है, जो पहेलियाँ सुलझाने, आभासी दुनिया में नेविगेट करने या यहाँ तक कि जानकारी खोजने के लिए वेब ब्राउज़र का उपयोग करने में सक्षम हो। ये प्रोग्राम, जिन्हें लार्ज लैंग्वेज मॉडल (large language models) कहा जाता है, इंटरनेट से प्राप्त विशाल मात्रा में टेक्स्ट पर प्रशिक्षित होते हैं, जिससे वे यह सीखते हैं कि वाक्य में अगला शब्द क्या होगा। जब शोधकर्ता इन मॉडलों को एजेंट के रूप में कार्य करने के लिए कहते हैं—यानी किसी लक्ष्य को प्राप्त करने के लिए कदम उठाने के लिए—तो वे अक्सर 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक विधि का उपयोग करते हैं। यह एक ऐसी प्रक्रिया है जहाँ मॉडल विभिन्न क्रियाएं आज़माता है, इस बात पर फीडबैक प्राप्त करता है कि वह सफल रहा या विफल, और धीरे-धीरे उन क्रियाओं को दोहराना सीखता है जो सफलता की ओर ले जाती हैं। यह मशीन को वह काम करने का तरीका सिखाने का एक शक्तिशाली तरीका है जिसके लिए उसे स्पष्ट रूप से प्रोग्राम नहीं किया गया था। हालाँकि, एक गंभीर समस्या तब उत्पन्न होती है जब इन एजेंटों को नई, अपरिचित स्थितियों में रखा जाता है। जबकि वे उस विशिष्ट पहेली को हल करना सीख सकते हैं जिसे उन्होंने पहले देखा है, वे पूरी तरह से नए वातावरण को समझने में संघर्ष करते हैं, और सोचने के एक संकीर्ण तरीके में फंस जाते हैं जो उन्हें सर्वोत्तम समाधान खोजने से रोकता है।

शोधकर्ताओं की एक टीम यह समझने के लिए आगे बढ़ी कि ये बुद्धिमान एजेंट अज्ञात परिस्थितियों का सामना करने पर क्यों विफल होते हैं। उन्होंने एक विशिष्ट घटना की खोज की जिसे वे "एक्सप्लोरेशन कोलैप्स" (exploration collapse) कहते हैं। सरल शब्दों में, जब एक एजेंट को एक नए कार्य पर प्रशिक्षित किया जाता है, तो वह अक्सर सफलता के लिए केवल एक विशिष्ट मार्ग खोजने के लिए सीख जाता है और फिर अन्य सभी संभावनाओं को अनदेखा कर देता है। वह उस एकल मार्ग पर इतना केंद्रित हो जाता है कि वह विभिन्न दृष्टिकोणों को आज़माने की क्षमता खो देता है। शोधकर्ताओं ने इसे दो अलग-अलग स्कोर को देखकर मापा: एक जो यह ट्रैक करता है कि क्या उसका सबसे अच्छा अनुमान काम करता है, और दूसरा जो यह ट्रैक करता है कि क्या उसके कई अलग-अलग अनुमानों में से कोई काम करता है। परिचित कार्यों में, जैसे-जैसे एजेंट सीखता है, दोनों स्कोर में सुधार होता है। लेकिन नए, कठिन वातावरणों में, जैसे कि एक ग्रिड-आधारित पहेली जहाँ बक्सों को विशिष्ट लक्ष्यों तक धकेलना होता है, एकल सबसे अच्छे अनुमान का स्कोर थोड़ा बढ़ जाता है, जबकि कई अलग-अलग रास्तों को आज़माने का स्कोर वास्तव में नीचे गिर जाता है। एजेंट एक बुरी आदत में अधिक आश्वस्त होने के लिए सीख रहा है, बजाय इसके कि वह अधिक लचीला बनना सीखे। ऐसा इसलिए होता है क्योंकि एजेंट वास्तव में उस नए संसार के नियमों को नहीं समझता जिसमें वह है; वह एक ठोस आधार के बिना केवल अनुमान लगा रहा है।

इसे ठीक करने के लिए, शोधकर्ताओं ने SPA नामक एक नई प्रशिक्षण विधि विकसित की, जिसका अर्थ है "सेल्फ-एक्सपीरियंस एजेंट" (Self-Experience Agent)। एजेंट को तुरंत यह सिखाने के बजाय कि पुरस्कार कैसे प्राप्त किया जाए, उन्होंने पहले उसे अपने आस-पास की दुनिया को समझने के लिए प्रशिक्षित किया। उन्होंने एजेंट को बिना अंक प्राप्त करने के दबाव के, अपने आप वातावरण का पता लगाने का अवसर दिया। इस चरण के दौरान, एजेंट से जो उसने देखा उसका वर्णन करने और यह भविष्यवाणी करने के लिए कहा गया कि एक निश्चित क्रिया लेने पर आगे क्या होगा। उदाहरण के लिए, यदि एजेंट ने एक विशिष्ट स्थान पर एक बॉक्स देखा और उसे धकेलने का निर्णय लिया, तो उसे पहले यह बताना था कि बॉक्स कहाँ है और फिर यह भविष्यवाणी करनी थी कि वह कहाँ समाप्त होगा। शोधकर्ताओं ने एजेंट के अनुमानों को सही करने के लिए वातावरण से प्राप्त वास्तविक, सही परिणामों का उपयोग किया, जिससे प्रभावी रूप से उसे उस विशिष्ट खेल के भौतिकी के नियमों को सिखाया गया। इस प्रक्रिया ने एजेंट के मन के भीतर एक प्रकार का आंतरिक मानचित्र या "वर्ल्ड मॉडल" (world model) बनाया, जो उसकी समझ को वास्तविकता में स्थापित करता है।

एक बार जब एजेंट ने दुनिया कैसे काम करती है इसकी आंतरिक समझ बना ली, तो शोधकर्ताओं ने उसे जीतना सिखाने के लिए मानक प्रशिक्षण प्रक्रिया शुरू की। परिणाम आश्चर्यजनक थे। सोकोबान (Sokoban) नामक एक पहेली खेल पर परीक्षणों में, जहाँ एजेंट को बक्सों को लक्ष्यों तक धकेलना था, मानक प्रशिक्षण विधि केवल एजेंट को लगभग 25 प्रतिशत बार सफल होने देती थी। नई विधि के साथ, सफलता दर बढ़कर लगभग 60 प्रतिशत हो गई। एक अन्य पहेली में, जिसमें एक जमी हुई झील शामिल थी, सफलता दर लगभग 22 प्रतिशत से सुधरकर 70 प्रतिशत से अधिक हो गई। शायद सबसे आश्चर्यजनक बात यह थी कि इस विधि से प्रशिक्षित एक बहुत छोटा कंप्यूटर मॉडल, पुराने, मानक तरीकों का उपयोग करके प्रशिक्षित एक बहुत बड़े, अधिक शक्तिशाली मॉडल को भी पीछे छोड़ने में सक्षम था। छोटे मॉडल ने, जिसने पहले खेल के नियमों को सीखा था, गेम के पुरस्कारों के लिए केवल अनुमान लगाने वाले विशाल मॉडल की तुलना में जटिल पहेलियों को अधिक प्रभावी ढंग से नेविगेट किया।

शोधकर्ताओं ने यह भी परीक्षण किया कि क्या यह दृष्टिकोण अन्य प्रकार के कार्यों पर काम करता है, जैसे कि सुडोकू (Sudoku) नामक एक तर्क पहेली और घरेलू कामों के लिए एक सिम्युलेटेड वातावरण। हर मामले में, उस पद्धति ने बेहतर परिणाम दिए जिसमें एजेंट को जीतने की कोशिश करने से पहले दुनिया की स्थिति को समझना सिखाया गया था। उन्होंने पाया कि सफलता की कुंजी केवल अधिक डेटा या एक बड़ा कंप्यूटर नहीं थी, बल्कि सीखने का क्रम था। एजेंट को पहले वातावरण की संरचना सीखने के लिए मजबूर करके, उन्होंने उसे एक एकल, भंगुर रणनीति में ढलने के जाल से बचा लिया। एजेंट ने अपने विकल्पों को खुला रखना सीखा, कई रास्तों का पता लगाया क्योंकि वह अपने कार्यों के परिणामों को समझता था। यह दृष्टिकोण सुझाव देता है कि कृत्रिम बुद्धिमत्ता (AI) के लिए वास्तव में नई और जटिल स्थितियों के अनुकूल होने के लिए, उसे सफलता के लिए अनुकूलित करने से पहले वास्तविकता की एक विश्वसनीय समझ बनानी होगी। अध्ययन दिखाता है कि जब एक एजेंट अपने वातावरण के वास्तविक तंत्रों से जुड़ा होता है, तो वह अधिक प्रभावी ढंग से अन्वेषण करना सीख सकता है और उन समस्याओं को हल कर सकता है जो पहले पहुंच से बाहर थीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →