← नवीनतम पेपर
💬 NLP

Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models

यह शोध पत्र इमेजिन-देन-प्लान (ITP) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो एक नवीन अनुकूली लुकअहेड तंत्र के माध्यम से एक पॉलिसी मॉडल को वर्ल्ड मॉडल के साथ एकीकृत करके एजेंट प्लानिंग को बढ़ाता है, जिससे जटिल, आंशिक रूप से दृश्यमान वातावरण में निर्णय लेने के मार्गदर्शन के लिए बहु-चरणीय कल्पित प्रक्षेप पथों (इमेजिन्ड ट्राजेक्टरीज) का निर्माण सक्षम होता है।

मूल लेखक: Youwei Liu, Jian Wang, Hanlin Wang, Beichen Guo, Wenjie Li

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Youwei Liu, Jian Wang, Hanlin Wang, Beichen Guo, Wenjie Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को सुलझाने की कोशिश कर रहे हैं, जैसे कि एक बिखरे हुए कमरे को व्यवस्थित करना या किसी यात्रा की योजना बनाना।

पुराना तरीका (वर्तमान AI एजेंट्स):
आज के अधिकांश AI एजेंट्स आवेगी पर्यटकों (impulsive tourists) की तरह हैं। वे एक अव्यवस्था देखते हैं, एक शर्ट उठाते हैं और उसे दराज में डाल देते हैं। फिर वे एक किताब देखते हैं, और उसे बिस्तर पर फेंक देते हैं। वे जो अभी देख रहे हैं, उसके आधार पर तुरंत कार्य करते हैं।

  • समस्या: वे अक्सर गलतियाँ करते हैं क्योंकि वे आगे का नहीं सोचते। वे शायद शर्ट को दराज में रख दें, केवल यह महसूस करने के लिए कि पाँच मिनट बाद वह दराज वास्तव में जूतों के लिए थी, और अब उन्हें सब कुछ फिर से ठीक करना पड़ेगा। उनमें "दूरदर्शिता" की कमी है।

नया तरीका (इमेजिन-देन-प्लान / ITP):
यह पेपर इमेजिन-देन-प्लान (Imagine-then-Plan - ITP) नामक एक नया फ्रेमवर्क पेश करता है। इस एजेंट को एक रणनीतिक शतरंज खिलाड़ी (strategic chess player) या एक अभ्यास करने वाले अभिनेता (rehearsing actor) के रूप में सोचें।

वास्तविक दुनिया में एक भी कदम उठाने से पहले, इस एजेंट के पास एक "मानसिक सैंडबॉक्स" होता है। यह एक विशेष टूल का उपयोग करता है जिसे वर्ल्ड मॉडल (World Model) कहा जाता है (जो कि दुनिया कैसे काम करती है, इसके प्रशिक्षण पर आधारित एक 'क्रिस्टल बॉल' की तरह है) ताकि यह सिम्युलेट (simulate) कर सके कि यदि इसने एक निश्चित कार्य किया तो क्या होगा।

यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ दिया गया है:

1. "मानसिक पूर्वाभ्यास" (Mental Rehearsal - World Model)

कल्पना कीजिए कि आप एक जटिल रात्रिभोज बनाने जा रहे हैं। केवल प्याज काटने और बेहतर होने की उम्मीद करने के बजाय, आप अपनी आँखें बंद करते हैं और पूरी प्रक्रिया को विज़ुअलाइज़ (visualize) करते हैं:

  • यदि मैं अभी प्याज काटता हूँ, तो क्या मेरे पास पानी उबालने के लिए पर्याप्त समय होगा?
  • यदि मैं मांस को पैन में डालता हूँ, तो क्या रसोई में बहुत धुआं हो जाएगा?

AI भी यही करता है। यह अपने "वर्ल्ड मॉडल" का उपयोग करके एक फ्यूचर ट्राजेक्टरी (future trajectory) बनाता है—वास्तविकता के अगले कुछ मिनटों का एक नकली संस्करण। यह वास्तविक कार्य करने से पहले ही अपने कार्यों के परिणामों को देख लेता है।

2. "एडेप्टिव लुकअहेड" (Adaptive Lookahead - स्मार्ट टाइमर)

यहाँ चतुराई भरा हिस्सा है। अतीत में, AI या तो:

  • बहुत कम सोचता था: केवल एक कदम आगे देखता था (एक पर्यटक की तरह)।
  • बहुत अधिक सोचता था: हर छोटी निर्णय के लिए 100 कदम आगे का सिम्युलेशन करता था (जैसे कि ब्रश करने के बारे में अत्यधिक विश्लेषण करने वाला कोई जुनूनी व्यक्ति)। इससे समय और ऊर्जा बर्बाद होती है।

ITP अलग है। इसमें एक एडेप्टिव लुकअहेड (Adaptive Lookahead) है। यह एक स्मार्ट GPS की तरह है जो स्थिति के आधार पर यह तय करता है कि उसे कितनी दूर तक देखना है:

  • सरल कार्य: "लाइट चालू करें।" -> AI सोचता है, "ठीक है, यह आसान है," और केवल 1 कदम आगे देखता है। (तेज़ और कुशल)।
  • जटिल कार्य: "चाबियाँ ढूँढें, दरवाज़ा खोलें, और स्टोर तक गाड़ी चलाएं।" -> AI महसूस करता है कि यह जोखिम भरा है। यह डीप मोड (Deep Mode) में स्विच हो जाता है, 10 कदम आगे का सिम्युलेशन करता है ताकि यह सुनिश्चित हो सके कि वह बाहर लॉक न हो जाए या पेट्रोल खत्म न हो जाए।

यह गतिशील रूप से तय करता है: "क्या मुझे 5 सेकंड के लिए ख्यालों में खोना चाहिए, या 5 मिनट के लिए?" यह इस बात पर निर्भर करता है कि वर्तमान समस्या कितनी कठिन है।

3. एजेंट के दो संस्करण

शोधकर्ताओं ने इस स्मार्ट एजेंट के दो संस्करण बनाए हैं:

  • "प्लग-एंड-प्ले" संस्करण (ITP-I): यह एक सामान्य AI को जादुई दर्पण (magic mirror) देने जैसा है। आपको AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस इसे कहते हैं, "कार्य करने से पहले, दर्पण में देखो कि क्या होता है, फिर निर्णय लो।" यह तुरंत काम करता है और बिना अतिरिक्त प्रशिक्षण के AI को बहुत स्मार्ट बना देता है।
  • "ट्रेनिंग" संस्करण (ITP-R): यह AI को मिलिट्री बूट कैंप (military boot camp) भेजने जैसा है। यह सिमुलेशन में हजारों बार अभ्यास करता है, यह सीखते हुए कि ठीक कब ख्यालों में रुकना है और कब कार्य करना है। यह सोचने और कार्य करने के बीच के सही संतुलन को सीखता है, जिससे यह और भी कुशल बन जाता है।

यह क्यों मायने रखता है?

  • कम गलतियाँ: भविष्य का "पूर्वाभ्यास" करके, AI वास्तविक दुनिया में होने से पहले ही अपनी गलतियों को पकड़ लेता है। यह जूते वाली दराज में शर्ट नहीं रखेगा क्योंकि इसने अपनी कल्पना में वह गलती "देख" ली थी।
  • कठिन कार्यों में बेहतर: जटिल कार्यों (जैसे किसी विशिष्ट वस्तु को खरीदने के लिए वेबसाइट नेविगेट करना या घर में रोबोट को नियंत्रित करना) के लिए दीर्घकालिक योजना की आवश्यकता होती है। यह विधि तर्क की इन लंबी श्रृंखलाओं को पिछले तरीकों की तुलना में बहुत बेहतर तरीके से संभालती है।
  • दक्षता (Efficiency): यह सरल चीजों के बारे में सोचने में समय बर्बाद नहीं करता है। यह अपनी "बौद्धिक शक्ति" उन क्षणों के लिए बचाता है जो वास्तव में महत्वपूर्ण हैं।

निष्कर्ष (The Bottom Line)

यह पेपर AI एजेंट्स को आवेगी होने के बजाय सोच-समझकर कार्य करने वाला (deliberate) बनना सिखाता है। उन्हें भविष्य की "कल्पना" करने की क्षमता देकर और यह अनुकूल रूप से तय करने की अनुमति देकर कि उन्हें कितनी दूर तक देखना है, हम ऐसे एजेंट बनाते हैं जो सुरक्षित, स्मार्ट और जटिल, वास्तविक दुनिया की समस्याओं को हल करने में बहुत बेहतर होते हैं।

संक्षेप में: यह एक ऐसे रोबोट के बीच का अंतर है जो अपने पैरों में ही उलझकर गिर जाता है क्योंकि उसने यह नहीं देखा कि वह कहाँ जा रहा है, और एक ऐसे रोबोट के बीच का अंतर जो रुकता है, रास्ते की कल्पना करता है, और सीधे फिनिश लाइन तक चलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →