Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective
यह शोध पत्र "एक्सप्लोरेशन कोलैप्स" (exploration collapse) को एक प्रमुख विफलता मोड के रूप में पहचानता है जहाँ LLM एजेंट सुदृढीकरण शिक्षण (reinforcement learning) के दौरान अपरिचित वातावरणों में नए समाधान खोजने की क्षमता खो देते हैं, और SPA का प्रस्ताव करता है, जो एक ऐसी विधि है जो रिवॉर्ड के लिए अनुकूलन करने से पहले स्वयं के अनुभव के माध्यम से स्टेट (state) और ट्रांज़िशन प्रेडिक्शन (transition prediction) में एजेंट को ग्राउंड करने हेतु सेल्फ-एक्सपीरियंस सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से प्रदर्शन में सुधार करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक कंप्यूटर प्रोग्राम की कल्पना करें जिसे एक इंसान की तरह सोचने और कार्य करने के लिए डिज़ाइन किया गया है, जो पहेलियाँ सुलझाने, आभासी दुनिया में नेविगेट करने या यहाँ तक कि जानकारी खोजने के लिए वेब ब्राउज़र का उपयोग करने में सक्षम हो। ये प्रोग्राम, जिन्हें लार्ज लैंग्वेज मॉडल (large language models) कहा जाता है, इंटरनेट से प्राप्त विशाल मात्रा में टेक्स्ट पर प्रशिक्षित होते हैं, जिससे वे यह सीखते हैं कि वाक्य में अगला शब्द क्या होगा। जब शोधकर्ता इन मॉडलों को एजेंट के रूप में कार्य करने के लिए कहते हैं—यानी किसी लक्ष्य को प्राप्त करने के लिए कदम उठाने के लिए—तो वे अक्सर 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक विधि का उपयोग करते हैं। यह एक ऐसी प्रक्रिया है जहाँ मॉडल विभिन्न क्रियाएं आज़माता है, इस बात पर फीडबैक प्राप्त करता है कि वह सफल रहा या विफल, और धीरे-धीरे उन क्रियाओं को दोहराना सीखता है जो सफलता की ओर ले जाती हैं। यह मशीन को वह काम करने का तरीका सिखाने का एक शक्तिशाली तरीका है जिसके लिए उसे स्पष्ट रूप से प्रोग्राम नहीं किया गया था। हालाँकि, एक गंभीर समस्या तब उत्पन्न होती है जब इन एजेंटों को नई, अपरिचित स्थितियों में रखा जाता है। जबकि वे उस विशिष्ट पहेली को हल करना सीख सकते हैं जिसे उन्होंने पहले देखा है, वे पूरी तरह से नए वातावरण को समझने में संघर्ष करते हैं, और सोचने के एक संकीर्ण तरीके में फंस जाते हैं जो उन्हें सर्वोत्तम समाधान खोजने से रोकता है।
शोधकर्ताओं की एक टीम यह समझने के लिए आगे बढ़ी कि ये बुद्धिमान एजेंट अज्ञात परिस्थितियों का सामना करने पर क्यों विफल होते हैं। उन्होंने एक विशिष्ट घटना की खोज की जिसे वे "एक्सप्लोरेशन कोलैप्स" (exploration collapse) कहते हैं। सरल शब्दों में, जब एक एजेंट को एक नए कार्य पर प्रशिक्षित किया जाता है, तो वह अक्सर सफलता के लिए केवल एक विशिष्ट मार्ग खोजने के लिए सीख जाता है और फिर अन्य सभी संभावनाओं को अनदेखा कर देता है। वह उस एकल मार्ग पर इतना केंद्रित हो जाता है कि वह विभिन्न दृष्टिकोणों को आज़माने की क्षमता खो देता है। शोधकर्ताओं ने इसे दो अलग-अलग स्कोर को देखकर मापा: एक जो यह ट्रैक करता है कि क्या उसका सबसे अच्छा अनुमान काम करता है, और दूसरा जो यह ट्रैक करता है कि क्या उसके कई अलग-अलग अनुमानों में से कोई काम करता है। परिचित कार्यों में, जैसे-जैसे एजेंट सीखता है, दोनों स्कोर में सुधार होता है। लेकिन नए, कठिन वातावरणों में, जैसे कि एक ग्रिड-आधारित पहेली जहाँ बक्सों को विशिष्ट लक्ष्यों तक धकेलना होता है, एकल सबसे अच्छे अनुमान का स्कोर थोड़ा बढ़ जाता है, जबकि कई अलग-अलग रास्तों को आज़माने का स्कोर वास्तव में नीचे गिर जाता है। एजेंट एक बुरी आदत में अधिक आश्वस्त होने के लिए सीख रहा है, बजाय इसके कि वह अधिक लचीला बनना सीखे। ऐसा इसलिए होता है क्योंकि एजेंट वास्तव में उस नए संसार के नियमों को नहीं समझता जिसमें वह है; वह एक ठोस आधार के बिना केवल अनुमान लगा रहा है।
इसे ठीक करने के लिए, शोधकर्ताओं ने SPA नामक एक नई प्रशिक्षण विधि विकसित की, जिसका अर्थ है "सेल्फ-एक्सपीरियंस एजेंट" (Self-Experience Agent)। एजेंट को तुरंत यह सिखाने के बजाय कि पुरस्कार कैसे प्राप्त किया जाए, उन्होंने पहले उसे अपने आस-पास की दुनिया को समझने के लिए प्रशिक्षित किया। उन्होंने एजेंट को बिना अंक प्राप्त करने के दबाव के, अपने आप वातावरण का पता लगाने का अवसर दिया। इस चरण के दौरान, एजेंट से जो उसने देखा उसका वर्णन करने और यह भविष्यवाणी करने के लिए कहा गया कि एक निश्चित क्रिया लेने पर आगे क्या होगा। उदाहरण के लिए, यदि एजेंट ने एक विशिष्ट स्थान पर एक बॉक्स देखा और उसे धकेलने का निर्णय लिया, तो उसे पहले यह बताना था कि बॉक्स कहाँ है और फिर यह भविष्यवाणी करनी थी कि वह कहाँ समाप्त होगा। शोधकर्ताओं ने एजेंट के अनुमानों को सही करने के लिए वातावरण से प्राप्त वास्तविक, सही परिणामों का उपयोग किया, जिससे प्रभावी रूप से उसे उस विशिष्ट खेल के भौतिकी के नियमों को सिखाया गया। इस प्रक्रिया ने एजेंट के मन के भीतर एक प्रकार का आंतरिक मानचित्र या "वर्ल्ड मॉडल" (world model) बनाया, जो उसकी समझ को वास्तविकता में स्थापित करता है।
एक बार जब एजेंट ने दुनिया कैसे काम करती है इसकी आंतरिक समझ बना ली, तो शोधकर्ताओं ने उसे जीतना सिखाने के लिए मानक प्रशिक्षण प्रक्रिया शुरू की। परिणाम आश्चर्यजनक थे। सोकोबान (Sokoban) नामक एक पहेली खेल पर परीक्षणों में, जहाँ एजेंट को बक्सों को लक्ष्यों तक धकेलना था, मानक प्रशिक्षण विधि केवल एजेंट को लगभग 25 प्रतिशत बार सफल होने देती थी। नई विधि के साथ, सफलता दर बढ़कर लगभग 60 प्रतिशत हो गई। एक अन्य पहेली में, जिसमें एक जमी हुई झील शामिल थी, सफलता दर लगभग 22 प्रतिशत से सुधरकर 70 प्रतिशत से अधिक हो गई। शायद सबसे आश्चर्यजनक बात यह थी कि इस विधि से प्रशिक्षित एक बहुत छोटा कंप्यूटर मॉडल, पुराने, मानक तरीकों का उपयोग करके प्रशिक्षित एक बहुत बड़े, अधिक शक्तिशाली मॉडल को भी पीछे छोड़ने में सक्षम था। छोटे मॉडल ने, जिसने पहले खेल के नियमों को सीखा था, गेम के पुरस्कारों के लिए केवल अनुमान लगाने वाले विशाल मॉडल की तुलना में जटिल पहेलियों को अधिक प्रभावी ढंग से नेविगेट किया।
शोधकर्ताओं ने यह भी परीक्षण किया कि क्या यह दृष्टिकोण अन्य प्रकार के कार्यों पर काम करता है, जैसे कि सुडोकू (Sudoku) नामक एक तर्क पहेली और घरेलू कामों के लिए एक सिम्युलेटेड वातावरण। हर मामले में, उस पद्धति ने बेहतर परिणाम दिए जिसमें एजेंट को जीतने की कोशिश करने से पहले दुनिया की स्थिति को समझना सिखाया गया था। उन्होंने पाया कि सफलता की कुंजी केवल अधिक डेटा या एक बड़ा कंप्यूटर नहीं थी, बल्कि सीखने का क्रम था। एजेंट को पहले वातावरण की संरचना सीखने के लिए मजबूर करके, उन्होंने उसे एक एकल, भंगुर रणनीति में ढलने के जाल से बचा लिया। एजेंट ने अपने विकल्पों को खुला रखना सीखा, कई रास्तों का पता लगाया क्योंकि वह अपने कार्यों के परिणामों को समझता था। यह दृष्टिकोण सुझाव देता है कि कृत्रिम बुद्धिमत्ता (AI) के लिए वास्तव में नई और जटिल स्थितियों के अनुकूल होने के लिए, उसे सफलता के लिए अनुकूलित करने से पहले वास्तविकता की एक विश्वसनीय समझ बनानी होगी। अध्ययन दिखाता है कि जब एक एजेंट अपने वातावरण के वास्तविक तंत्रों से जुड़ा होता है, तो वह अधिक प्रभावी ढंग से अन्वेषण करना सीख सकता है और उन समस्याओं को हल कर सकता है जो पहले पहुंच से बाहर थीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।