Reinforcement World Model Learning for LLM-based Agents
यह शोध पत्र रिइन्फोर्समेंट वर्ल्ड मॉडल लर्निंग (RWML) का प्रस्ताव करता है, जो एक स्व-पर्यवेक्षित (self-supervised) विधि है जो LLM-आधारित एजेंटों को उनके आंतरिक सिमेंटिक सिमुलेशन को वास्तविक देखे गए परिणामों के साथ संरेखित करने के लिए प्रशिक्षित करके उन्हें बेहतर बनाती है, जो प्रत्यक्ष सुदृढीकरण शिक्षण (direct reinforcement learning) से बेहतर प्रदर्शन करती है और विशेषज्ञ-डेटा प्रशिक्षण के बराबर है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त रसोई में नेविगेट करना सिखा रहे हैं।
वर्तमान में अधिकांश AI "एजेंट्स" उन छात्रों की तरह हैं जो केवल एक तैयार, पूर्ण रेसिपी को देखकर और उसकी हुबहू नकल करके सीखते हैं। यदि वे कोई गलती करते हैं—जैसे कि गलती से आटे का जार गिरा देना—तो उन्हें वास्तव में यह समझ नहीं आता कि ऐसा क्यों हुआ; उन्हें बस इतना पता होता है कि उन्होंने रेसिपी का ठीक से पालन नहीं किया।
यह पेपर सिखाने का एक नया तरीका पेश करता है जिसे RWML (Reinment World Model Learning) कहा जाता है। विशेषज्ञों की नकल करने के बजाय, यह AI को अपने दिमाग में एक "आंतरिक सिम्युलेटर" (Internal Simulator) बनाने के लिए प्रशिक्षित करता है।
उपमा: "मानसिक फिल्म" बनाम "नकलची"
पुराना तरीका (नकलची):
कल्पना कीजिए कि एक छात्र पेशेवर खिलाड़ियों के वीडियो देखकर फुटबॉल खेलना सीखने की कोशिश कर रहा है। वह देखता है कि खिलाड़ी ने गेंद को किक मारी और गोल किया। छात्र उसी सटीक मूवमेंट की नकल करने की कोशिश करता है। लेकिन अगर घास गीली है या हवा चल रही है, तो छात्र विफल हो जाता है क्योंकि वह केवल नकल करना सीख रहा था, न कि खेल के भौतिक विज्ञान (physics) को समझना।
RWML का तरीका (मानसिक फिल्म):
सिर्फ देखने के बजाय, RWML छात्र को कहा जाता है: "गेंद को किक मारने से पहले, अपनी आँखें बंद करो और कल्पना करो कि क्या होगा। यदि तुम इसे ज़ोर से किक मारते हो, तो क्या यह जाल में जाएगी या बाड़ के ऊपर से उड़ जाएगी?"
AI को "भविष्य की भविष्यवाणी करने" के खेल के लिए प्रशिक्षित किया जाता है। वह एक क्रिया करता है (जैसे "चाकू उठाना") और फिर एक "मानसिक फिल्म" बनाने की कोशिश करता है कि अगला दृश्य कैसा दिखना चाहिए (जैसे "अब मैं एक चाकू पकड़े हुए हूँ")। फिर वह अपनी मानसिक फिल्म की तुलना वास्तविक दुनिया में जो वास्तव में हुआ, उससे करता है। यदि उसकी मानसिक फिल्म गलत थी, तो वह अपनी समझ को तब तक सुधारता है जब तक कि उसका "आंतरिक संसार" वास्तविकता से मेल न खा जाए।
यह कैसे काम करता है (तीन चरण)
- गलती और सुधार (द सैंडबॉक्स): AI को एक डिजिटल वातावरण (जैसे एक वर्चुअल घर या कस्टमर सर्विस चैट) में खुला छोड़ दिया जाता है। वह चीजों से टकराता है, गलतियाँ करता है और देखता है कि क्या होता है।
- "सिम-टू-रियल" चेक: अपनी हर हरकत के लिए, AI खुद से पूछता है: "मुझे लगता है कि अगली स्थिति X जैसी दिखेगी। क्या मैं सही था?" वह यह जांचने के लिए एक गणितीय तरीके का उपयोग करता है कि क्या उसकी "मानसिक छवि" वास्तविक परिणाम के अर्थपूर्ण रूप से समान है। उसे इस बात की परवाह नहीं है कि वह इंसान के समान ही शब्दों का उपयोग कर रहा है या नहीं; उसे इस बात की परवाह है कि वह स्थिति के अर्थ को समझता है या नहीं।
- डबल बूस्ट: एक बार जब AI के पास एक बेहतरीन "मानसिक सिम्युलेटर" हो जाता है, तो वह वास्तविक काम करने में बहुत बेहतर हो जाता है। यह एक शतरंज के खिलाड़ी की तरह है जो दस चालें आगे "देख" सकता है। क्योंकि वह परिणामों की भविष्यवाणी कर सकता है, इसलिए वह मूर्खतापूर्ण गलतियाँ करने में समय बर्बाद नहीं करता है, जिससे वह कार्यों को पूरा करने में बहुत अधिक कुशल हो जाता है।
यह एक बड़ी बात क्यों है?
- यह आत्मनिर्भर है: इसे किसी मानव विशेषज्ञ की ज़रूरत नहीं है जो इसका हाथ थामे रखे या हजारों आदर्श उदाहरण प्रदान करे। यह दुनिया के साथ अंतःक्रिया करके सीखता है, बिल्कुल वैसे ही जैसे एक छोटा बच्चा सीखता है।
- यह अपने दिमाग को "भूलता" नहीं है: आमतौर पर, जब आप किसी AI को नया कौशल सिखाते हैं, तो वह बुनियादी चीजें (जैसे गणित या कोडिंग) करना भूलने लगता है। शोधकर्ताओं ने पाया कि क्योंकि RWML एक विशिष्ट प्रकार के सुदृढीकरण लर्निंग (reinforcement learning) का उपयोग करता है, इसलिए यह अपनी मौजूदा बुद्धिमत्ता को तोड़े बिना नए "दुनिया के नियमों" को सीख लेता है।
- यह सिर्फ तेज़ नहीं, बल्कि स्मार्ट है: क्योंकि AI कार्य करने से पहले "सोच" सकता है, इसलिए वह कम "अमान्य" चालें चलता है (जैसे कि ऐसे टूल का उपयोग करने की कोशिश करना जो मौजूद ही नहीं है) और अधिक "कुशल" चालें चलता है (लक्ष्य तक पहुँचने का सबसे छोटा रास्ता चुनना)।
संक्षेप में: RWML एक AI को निर्देशों को दोहराने वाले तोते से बदलकर एक ऐसे विचारक में बदल देता है जो अपने कार्यों के परिणामों को समझता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।