← नवीनतम पेपर
💻 computer science

From Word to World: Can Large Language Models be Implicit Text-based World Models?

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को एक अंतर्निहित टेक्स्ट-आधारित विश्व मॉडल के रूप में मूल्यांकित करने के लिए एक तीन-स्तरीय ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि हालांकि वे सुसंगत अवस्था भविष्यवाणी और सिंथेटिक अनुभव निर्माण के माध्यम से एजेंट लर्निंग को बढ़ा सकते हैं, उनकी प्रभावशीलता व्यवहारिक कवरेज और पर्यावरण जटिलता पर महत्वपूर्ण रूप से निर्भर करती है।

मूल लेखक: Yixia Li, Hongru Wang, Jiahao Qiu, Zhenfei Yin, Dongdong Zhang, Cheng Qian, Zeping Li, Pony Ma, Guanhua Chen, Heng Ji

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yixia Li, Hongru Wang, Jiahao Qiu, Zhenfei Yin, Dongdong Zhang, Cheng Qian, Zeping Li, Pony Ma, Guanhua Chen, Heng Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना सिखा रहे हैं, जैसे कि एक टेक्स्ट-आधारित एडवेंचर जहाँ आपको एक चाबी ढूँढनी है, एक दरवाज़ा खोलना है और एक पहेली सुलझानी है।

वास्तविक दुनिया में, इस रोबोट को प्रशिक्षित करना धीमा और महंगा है। आपको इसे दीवारों से टकराने, गड्ढों में गिरने और सीखने के लिए हजारों बार असफल होने के लिए छोड़ना पड़ता है। यह वह "अनुभव की बाधा" (experience bottleneck) है जिसके बारे में पेपर बात करता है: वास्तविक जीवन गलतियों से सीखने के लिए बहुत धीमा है।

शोधकर्ताओं ने एक बड़ा सवाल पूछा: क्या हम रोबोट को गेम खेलने के बजाय गेम की कल्पना करना सिखा सकते हैं?

उन्होंने एक लार्ज लैंग्वेज मॉडल (LLM)—वही तरह का AI जो कविताएँ लिखता है और सवालों के जवाब देता है—का उपयोग करने का प्रस्ताव दिया—एक "वर्ल्ड मॉडल" (World Model) के रूप में। इस वर्ल्ड मॉडल को एक चैटबॉट के रूप में नहीं, बल्कि एक सिम्युलेटर (simulator) या "ड्रीम मशीन" (dream machine) के रूप में सोचें।

यहाँ उनके निष्कर्षों का सरल उपमाओं के साथ विवरण दिया गया है:

1. मुख्य विचार: "अगले शब्द" से "अगली अवस्था" तक

आमतौर पर, एक LLM वाक्य में अगले शब्द की भविष्यवाणी करता है (जैसे, "बिल्ली चटाई पर बैठी... [मैट]")।
शोधकर्ताओं ने इन मॉडल्स को दुनिया की अगली अवस्था (next state) की भविष्यवाणी करने के लिए प्रशिक्षित किया (जैसे, "मैंने दरवाजा खोला, और अब मैं एक ड्रैगन देख रहा हूँ")।

  • उपमा: एक ऐसे उपन्यासकार की कल्पना करें जिसने अस्तित्व की हर किताब पढ़ ली है। यदि आप उन्हें बताते हैं, "नायक संदूक खोलता है," तो वे तुरंत अगले पैराग्राफ को लिख सकते हैं जिसमें बताया गया हो कि उसके अंदर क्या है, कमरे में कैसी गंध आ रही है, और आगे क्या होता है। उन्हें यह जानने के लिए वास्तव में संदूक खोलने की आवश्यकता नहीं है कि आमतौर पर क्या होता है। उन्होंने AI को इसमें बदल दिया: एक यथार्थ का भविष्य बताने वाला कहानीकार (predictive storyteller of reality)

2. तीन परीक्षण (एक "रिपोर्ट कार्ड")

शोधकर्ताओं ने केवल उम्मीद नहीं की कि यह काम करेगा; उन्होंने AI को तीन-भाग वाला परीक्षण दिया:

  • फिडेलिटी (Fidelity - क्या यह सटीक है?): यदि AI कहता है "आपने सेब उठाया," तो क्या गेम में वास्तव में सेब दिखाई देता है?
    • परिणाम: संरचित खेलों में (जैसे स्पष्ट नियमों वाले घर में), AI अविश्वसनीय रूप से सटीक था। वह पहली बार खेलने वाले इंसान से बेहतर नियमों, भौतिकी और तर्क को जानता था।
  • कंसिस्टेंसी (Consistency - क्या यह ट्रैक पर रहता है?): यदि AI 50-चरणों की यात्रा का अनुकरण करता है, तो क्या वह भूल जाता है कि उसने कहाँ से शुरुआत की थी? क्या वह बीच में ही कल्पना करने लगता है कि सेब केला बन गया है?
    • परिणाम: सरल, नियम-आधारित दुनिया में, यह सुसंगत रहा। लेकिन अराजक, खुली दुनियाओं में (जैसे लाखों उत्पादों वाली शॉपिंग वेबसाइट), यह कभी-कभी भ्रमित हो गया और अपने रास्ते से "भटक" (drift) गया।
  • यूटिलिटी (Utility - क्या यह रोबोट की मदद करता है?): यदि हम इस AI का उपयोग रोबोट को प्रशिक्षित करने के लिए करते हैं, तो क्या रोबोट बेहतर होता है?
    • परिणाम: हाँ! रोबोट तेजी से सीखा और कम खतरनाक गलतियाँ कीं।

3. "ड्रीम मशीन" रोबोट की मदद कैसे करती है

पेपर ने पाया कि यह वर्ल्ड मॉडल एजेंटों (रोबोट) की मदद करने के तीन मुख्य तरीके हैं:

  • "सुरक्षा जाल" (अपूरणीय गलतियों को रोकना):
    • परिदृश्य: गेम में, यदि आप गलत वस्तु खरीदते हैं, तो आप अपने सभी पैसे खो देते हैं। आप इसे वापस नहीं ले सकते।
    • समाधान: रोबട്ട് "खरीदें" (Buy) पर क्लिक करने से पहले, वह वर्ल्ड मॉडल से पूछता है: "यदि मैं इसे खरीदता हूँ, तो क्या होगा?" मॉडल भविष्य का अनुकरण करता है। यदि सिमुलेशन कहता है "आप कंगाल हो जाएंगे," तो रोबोट रुक जाता है। यह पिकनिक पर जाने का निर्णय लेने से पहले मौसम के पूर्वानुमान की जाँच करने जैसा है।
  • "सिंथेटिक ट्रेनर" (अभ्यास डेटा उत्पन्न करना):
    • परिदृश्य: वास्तविक अभ्यास धीमा है।
    • समाधान: वर्ल्ड मॉडल सेकंडों में हजारों नकली अभ्यास परिदृश्य उत्पन्न कर सकता है। रोबोट इन "सपनों" पर प्रशिक्षण ले सकता है और वास्तविक डेटा पर प्रशिक्षित होने जितना ही अच्छा प्रदर्शन कर सकता है। यह एक पायलट की तरह है जो असली विमानों को क्रैश करने के बजाय उड़ान सिम्युलेटर का उपयोग करके सीखता है।
  • "वॉर्म-अप" (शुरुआत में बढ़त मिलना):
    • परिदृश्य: शून्य से शुरू करना कठिन है।
    • समाधान: रोबोट पहले वर्ल्ड मॉडल की भविष्यवाणियों को "पढ़कर" यह समझ लेता है कि दुनिया कैसे काम करती है (भौतिकी, कारण-और-प्रभाव)। फिर, जब वह वास्तविक गेम शुरू करता है, तो उसे पहले से ही एक "अहसास" होता है कि चीजें कैसे काम करती हैं। वह बहुत तेज़ी से सीखता है।

4. पकड़: यह अभी जादू नहीं है

पेपर इसके सीमित पक्षों के बारे में ईमानदार है। "ड्रीम मशीन" तब सबसे अच्छा काम करती है जब दुनिया के नियम स्पष्ट होते हैं (जैसे बोर्ड गेम या विज्ञान प्रयोगशाला)।

  • सीमा: यदि दुनिया बहुत अराजक या खुली हुई है (जैसे अनंत चरों वाली वास्तविक दुनिया की शॉपिंग साइट), तो AI की कल्पना भटकने लगती है। यह भविष्यवाणी कर सकता है कि एक ड्रैगन प्रकट हुआ है जबकि वास्तव में वह एक बिल्ली है।
  • समाधान: इसे अस्त-व्यस्त दुनिया में काम करने के लिए, आपको इसे अधिक डेटा और अधिक विभिन्न प्रकार के एजेंटों (केवल एक आदर्श रोबोट नहीं, बल्कि कई अलग-अलग प्रकार के एजेंट) के साथ प्रशिक्षित करने की आवश्यकता है।

बड़ी तस्वीर

यह पेपर एक सेतु (bridge) है। यह सुझाव देता है कि जिस तकनीक ने AI को अच्छी कहानियाँ लिखने में सक्षम बनाया है, वह AI को यह समझने में भी सक्षम बना सकती है कि दुनिया कैसे काम करती है

केवल एक तोते (parrot) के रूप में जो शब्दों को दोहराता है, इसके बजाय ये मॉडल्स सिम्युलेटर बन सकते हैं जो एजेंटों को वास्तविक दुनिया में कदम रखने से पहले एक सुरक्षित, तेज़, आभासी दुनिया में अभ्यास करने, विफल होने और सीखने की अनुमति देते हैं। यह "करने से सीखने" को "सपनों से सीखने" में बदल देता है, जो AI एजेंटों को स्मार्ट और सुरक्षित बनाने की दिशा में एक बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →