← नवीनतम पेपर
🤖 machine learning

Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation

यह शोधपत्र डिस्क्रीट टेक्स्टुअल लेटेंट स्टेट्स और एक फैक्टराइज्ड GRPO ट्रेनिंग मेथड को पेश करके टेक्स्ट-आधारित वर्ल्ड मॉडल्स में हिस्ट्री बाईपास के कारण होने वाली अनआइडेंटिफिएबल लेटेंट स्टेट्स की चुनौती का समाधान करता है, जो सख्त मीडिएशन को लागू करता है और इसके परिणामस्वरूप रिप्रेजेंटेशन क्वालिटी और लॉन्ग-होरिज़न रोलआउट परफॉर्मेंस में महत्वपूर्ण सुधार लाता है।

मूल लेखक: Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das

प्रकाशित 2026-06-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को टेक्स्ट-आधारित एडवेंचर गेम (जैसे कि कोई पुराना "चूज़ योर ओन एडवेंचर" बुक) खेलना सिखाने की कोशिश कर रहे हैं। रोबोट पूरी दुनिया को देख नहीं सकता; वह केवल उस कमरे का टेक्स्ट विवरण देख सकता है जिसमें वह वर्तमान में है। अच्छी तरह खेलने के लिए, उसे याद रखना होगा कि पहले क्या हुआ था: मैं कहाँ गया था? क्या मैंने चाबी उठाई? क्या दरवाज़ा बंद है?

AI की दुनिया में, इस याद को "लेटेंट स्टेट" (latent state) कहा जाता है।

यह पेपर एक विशिष्ट समस्या पर काम करता है: हम यह कैसे सुनिश्चित करें कि रोबोट वास्तव में एक अच्छी याद बनाना सीखता है, न कि केवल नकल या धोखाधड़ी करना?

समस्या: "चीट शीट" (Cheat Sheet) का लूपहोल

अधिकांश आधुनिक AI मॉडल उन छात्रों की तरह हैं जिन्हें परीक्षा में अपनी पूरी पाठ्यपुस्तक ले जाने की अनुमति होती है।

  • सेटअप: AI के पास गेम का इतिहास (पाठ्यपुस्तक) और वर्तमान कमरा होता है।
  • धोखा (The Cheat): भले ही AI को इतिहास का सारांश एक छोटे से "मेमोरी नोट" (लेटेंट स्टेट) में लिखने के लिए कहा गया हो, लेकिन AI इतना स्मार्ट है कि वह उस नोट को अनदेखा कर देता है। वह सवाल का जवाब देने के लिए पूरी पाठ्यपुस्तक (इतिहास) को देखता है।
  • परिणाम: AI टेस्ट में बेहतरीन स्कोर प्राप्त करता है (अगले कमरे का सही अनुमान लगा लेता है), लेकिन उसका "मेमोरी नोट" खाली या बेकार होता है। यह वैसा ही है जैसे किसी छात्र ने अवधारणाओं को समझने के बजाय केवल उत्तर रट लिए हों। आप यह नहीं बता सकते कि उसकी याददाश्त अच्छी है क्योंकि AI बस अतीत को देखकर धोखाधड़ी कर रहा है।

लेखक इसे "आइडेंटिफिएबिलिटी प्रॉब्लम" (Identifiability Problem) कहते हैं। यदि AI अपनी याददाश्त को दरकिनार कर सकता है, तो आप यह नहीं जान सकते कि उसकी याददाश्त वास्तव में काम कर रही है या नहीं।

समाधान: "स्ट्रिक्ट मीडिएटर" (Strict Mediator)

लेखक "स्ट्रिक्ट मीडिएशन" (Strict Mediation) नामक एक नियम प्रस्तावित करते हैं। इसे एक सख्त रेफरी की तरह समझें जिसका एक स्वर्ण नियम है:

"एक बार जब आप अपना मेमोरी नोट लिख लें, तो आपको पाठ्यपुस्तक को फेंक देना चाहिए। आप अगले क्या होने वाला है, इसका अनुमान लगाने के लिए केवल अपने मेमोरी नोट और अपने अगले कदम का उपयोग करने के लिए अधिकृत हैं।"

यदि AI इस नियम का पालन करता है:

  1. उसे अपनी सारी महत्वपूर्ण जानकारी मेमोरी नोट में डालनी ही होगी, अन्यथा वह टेस्ट में विफल हो जाएगा।
  2. यदि वह टेस्ट पास कर लेता है, तो आप निश्चित रूप से जानते हैं कि उसका मेमोरी नोट बेहतरीन है।
  3. यदि वह टेस्ट में विफल रहता है, तो आप जानते हैं कि उसके मेमोरी नोट में कुछ कमी है।

यह मेमोरी की गुणवत्ता को परखने योग्य (testable) बनाता है।

चुनौती: टेक्स्ट पेचीदा है

आमतौर पर, AI मेमोरी नंबरों (वेक्टर्स) से बनी होती है जिन्हें गणित के साथ बदलना आसान होता है। लेकिन यह पेपर चाहता है कि मेमोरी टेक्स्ट (जैसे तथ्यों की एक सूची: "मेरे पास एक चाबी है," "दरवाज़ा बंद है") के रूप में हो।

  • टेक्स्ट क्यों? यह पढ़ने योग्य है। इंसान मेमोरी को देख सकते हैं और समझ सकते हैं।
  • समस्या: आप टेक्स्ट पर गणित आसानी से लागू करके उसे "ट्वीक" या सुधार नहीं सकते। यह अक्षरों पर कैलकुलस करने की कोशिश करने जैसा है। साथ ही, यदि आप AI को एक शक्तिशाली दिमाग (लार्ज लैंग्वेज मॉडल) देते हैं, तो वह मेमोरी नोट को अनदेखा करने और इतिहास को देखने की कोशिश करेगा।

समाधान: "संभावनाओं का पेड़" (Tree of Possibilities - fGRPO)

टेक्स्ट-आधारित मेमोरी सीखने के लिए AI को बिना धोखाधड़ी किए प्रशिक्षित करने के लिए, लेखकों ने फैक्टराइज्ड GRPO (fGRPO) नामक एक नई प्रशिक्षण पद्धति का आविष्कार किया है।

कल्पना कीजिए कि आप एक कुत्ते को गेंद लाने के लिए प्रशिक्षित कर रहे हैं, लेकिन आप उसे इनाम (treats) नहीं दे सकते (क्योंकि आप टेक्स्ट को गणित से बदल नहीं सकते)। इसके बजाय, आप "क्या होगा अगर?" के खेल का उपयोग करते हैं:

  1. शाखाओं वाला पेड़ (The Branching Tree): केवल एक भविष्य का अनुमान लगाने के बजाय, AI संभावनाओं का एक पूरा पेड़ बनाता है।
    • शाखा 1: "क्या होगा अगर मेरी मेमोरी कहती है कि मेरे पास चाबी है?" -> परिणाम: भविष्यवाणी करता है कि दरवाज़ा खुल जाता है।
    • शाखा 2: "क्या होगा अगर मेरी मेमोरी कहती है कि मेरे पास चाबी नहीं है?" -> परिणाम: भविष्यवाणी करता है कि दरवाज़ा बंद रहता है।
  2. स्कोर: AI को अंक तभी मिलते हैं जब भविष्यवाणी वास्तविकता से मेल खाती है।
  3. सबक: यदि AI मेमोरी को अनदेखा करने और केवल इतिहास के आधार पर अनुमान लगाने की कोशिश करता है, तो "पेड़" ढह जाता है क्योंकि वह मेमोरी के बिना भविष्य की सही भविष्यवाणी नहीं कर पाता। AI सीख जाता है कि गेम जीतने के लिए, उसे अपने टेक्स्ट-आधारित मेमोरी में सही तथ्य डालने ही होंगे।

परिणाम: बेहतर मेमोरी, लंबे रोमांच

लेखकों ने इसका परीक्षण दो टेक्स्ट-गेम वातावरण (TextWorld और ScienceWorld) पर किया।

  • सटीकता (Accuracy): AI ने अगले कमरे की भविष्यवाणी उतनी ही अच्छी तरह की जितनी कि "धोखाधड़ी करने वाले" मॉडल्स ने की।
  • मेमोरी की गुणवत्ता: "स्ट्रिक्ट" मॉडल्स के मेमोरी नोट्स बहुत बेहतर थे। वे अधिक सटीक थे और उनमें सही तथ्य शामिल थे।
  • दीर्घकालिक स्थिरता (Long-Term Stability): यह सबसे बड़ी जीत है। लंबे गेम्स (कई स्टेप्स) में, "धोखाधड़ी करने वाले" मॉडल भ्रमित हो जाते हैं और विफल हो जाते हैं क्योंकि वे उस इतिहास पर निर्भर होते थे जो गेम के दौरान उपलब्ध नहीं होता। "स्ट्रिक्ट" मॉडल, जो केवल अपनी संक्षिप्त मेमोरी पर निर्भर थे, 9 स्टेप्स के बाद भी सटीक रहे, जबकि अन्य मॉडल बिखर गए।

एनालॉजी (उपमा) सारांश

  • पुराना तरीका (लीकी/Leaky): एक छात्र टेस्ट देता है जिसमें वह चीट शीट का उपयोग करता है। वह 100% अंक प्राप्त करता है, लेकिन आप नहीं जानते कि उसने कुछ सीखा भी है या नहीं।
  • नया तरीका (स्ट्रिक्ट/Strict): छात्र को एक कमरे में बंद कर दिया जाता है जहाँ उसके पास केवल एक इंडेक्स कार्ड है। उसे टेस्ट शुरू होने से पहले सब कुछ उस कार्ड पर लिखना होगा। यदि वह टेस्ट पास कर लेता है, तो आप जानते हैं कि कार्ड एकदम सही था।
  • प्रशिक्षण विधि: छात्र को केवल एक बार ग्रेड देने के बजाय, शिक्षक उसे कई अलग-अलग परिदृश्यों की कल्पना करने के लिए कहता है। यदि कार्ड गलत है, तो छात्र अधिकांश परिदृश्यों में विफल हो जाएगा। यह छात्र को एक परफेक्ट कार्ड लिखने के लिए मजबूर करता है।

यह क्यों महत्वपूर्ण है?

यह पेपर साबित करता है कि आप AI को टेक्स्ट में "सोचना" सिखा सकते हैं और उसे वास्तव में दुनिया का एक संक्षिप्त सारांश बनाने के लिए मजबूर कर सकते है, न कि केवल अतीत को रटने के लिए। यह उन AI की दिशा में एक महत्वपूर्ण कदम है जो भ्रमित हुए बिना लंबी अवधि तक योजना बना सकते हैं और तर्क कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →