← नवीनतम पेपर
🤖 machine learning

Learning POMDP World Models from Observations with Language-Model Priors

यह शोध पत्र पिंडक्टर (Pinductor) को प्रस्तुत करता है, जो एक ऐसी विधि है जो सीमित अवलोकन-क्रिया प्रक्षेप पथों (observation-action trajectories) से आंशिक रूप से-अवलोकनीय मार्कोव निर्णय प्रक्रिया (Partially-Observable Markov Decision Process - POMDP) विश्व मॉडल को कुशलतापूर्वक सीखने के लिए भाषा मॉडल पूर्वग्रहों (language model priors) का लाभ उठाता है, जो विशेषाधिकार प्राप्त-अवस्था (privileged-state) विधियों के तुलनीय प्रदर्शन प्राप्त करते हुए नमूना दक्षता (sample efficiency) में पारंपरिक आधार रेखाओं (baselines) से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Valentin Six, Frederik Panse, Mathis Fajeau, Lancelot Da Costa, Mridul Sharma, Alfonso Amayuelas, Tim Z. Xiao, David Hyland, Philipp Hennig, Bernhard Schölkopf

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Valentin Six, Frederik Panse, Mathis Fajeau, Lancelot Da Costa, Mridul Sharma, Alfonso Amayuelas, Tim Z. Xiao, David Hyland, Philipp Hennig, Bernhard Schölkopf

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपको एक बिल्कुल नए, घने अंधेरे भूलभुलैया (maze) में छोड़ दिया गया है। आप दीवारों, बंद रास्तों या बाहर निकलने के रास्ते को नहीं देख सकते। आप केवल इतना जानते हैं कि जब आप एक कदम आगे बढ़ाते हैं, तो आप किसी चीज़ से टकरा सकते हैं, या आपको कोई आवाज़ सुनाई दे सकती है, या यदि आपको खजाना मिल जाता है, तो आप एक इनाम महसूस कर सकते हैं। आपको यह समझना होगा कि यह भूलभुलैया कैसे काम करती है, और यह सब केवल अपने अहसासों और अनुभवों के माध्यम से करना है, बिना कभी पूरे नक्शे को देखे।

यह POMDPs (पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस) की चुनौती है। यह उस गणित के पीछे का विज्ञान है जो यह सीखने में मदद करता है कि दुनिया कैसे काम करती है जब आप पूरी तस्वीर नहीं देख पाते।

यह पेपर एक नई विधि पेश करता है जिसे Pinductor (शॉर्ट फॉर "POMDP-इंडक्टर") कहा जाता है, जो एक लार्ज लैंग्वेज मॉडल (LLM)—जैसे कि वह AI जिससे आप चैट कर सकते हैं—का उपयोग करके इस समस्या को हल करता है। यह यहाँ कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके समझते हैं:

समस्या: अंधेरे में सीखना

आमतौर पर, किसी AI को भूलभुलैया में नेविगेट करना सिखाने के लिए, आप उसे एक "चीट शीट" (cheat sheet) देते हैं। आप उसे हर चाल के बाद छिपा हुआ नक्शा (सच्ची स्थिति/true state) दिखाते हैं ताकि वह अपनी गलतियों से सीख सके। लेकिन वास्तविक दुनिया में, रोबोट और एजेंट शायद ही कभी चीट शीट प्राप्त करते हैं। वे केवल वही देखते हैं जो उनके ठीक सामने होता है।

पिछले तरीकों ने AI का उपयोग करके नक्शे का अनुमान लगाने की कोशिश की, लेकिन वे अभी भी सीखने के लिए गुप्त रूप से छिपे हुए नक्शे को देखने पर निर्भर थे। यदि आप चीट शीट हटा देते हैं, तो वे तरीके विफल हो जाते हैं।

समाधान: Pinductor (एक "डिटेक्टिव" AI)

Pinductor एक जासूस की तरह है जिसे अपराधी को देखे बिना अपराध को सुलझाना है। इसके बजाय, जासूस एक सुपर-स्मार्ट AI सहायक (LLM) का उपयोग करता है जो यह जानता है कि दुनिया आमतौर पर कैसे काम करती है।

यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

  1. अनुमान (The Hypothesis):
    AI सहायक भूलभुलैया में नेविगेट करने वाले किसी व्यक्ति के कुछ छोटे वीडियो क्लिप्स (अवलोकन और क्रिया डेटा) को देखता है। भूलभुलैया, चाबियों और दरवाजों के बारे में अपने विशाल ज्ञान के आधार पर, सहायक एक कंप्यूटर प्रोग्राम लिखता है जो यह समझाने की कोशिश करता है कि भूलभुलैया कैसे व्यवहार करती है।

    • उपमा: कल्पना कीजिए कि AI एक नियम पुस्तिका लिखता है: "यदि आप आगे बढ़ते हैं और दीवार से टकराते हैं, तो आप वहीं रुक जाते हैं। यदि आप एक चाबी उठाते हैं, तो आप लाल दरवाजा खोल सकते हैं।"
  2. परीक्षण (The Simulation):
    सिस्टम इस नियम पुस्तिका को लेता है और एक सिमुलेशन चलाता है। यह भूलभुलैया में एजेंट होने का नाटक करता है, और AI द्वारा लिखे गए नियमों का पालन करता है। यह पूछता है: "यदि मैं इन नियमों का पालन करता हूँ, तो क्या मैं वही चीजें देख पाऊँगा जो वास्तविक एजेंट ने देखी थीं?"

    • ट्विस्ट: चूंकि सिस्टम को वास्तविक छिपी हुई स्थिति (true state) का पता नहीं होता, इसलिए यह एक "विश्वास प्रणाली" (belief system) का उपयोग करता है। यह संभावित स्थानों के एक समूह (जैसे मधुमक्खियों का झुंड) को रखता है और एजेंट जो देखता है उसके आधार पर उन्हें अपडेट करता है। यदि मधुमक्खियों का झुंड अवलोकनों की व्याख्या कर सकता है, तो नियम पुस्तिका अच्छी है। यदि मधुमक्खियां भ्रमित हो जाती हैं और देखे गए विवरणों की व्याख्या नहीं कर पातीं, तो नियम पुस्तिका खराब है।
  3. सुधार (The Refinement):
    सिस्टम AI की नियम पुस्तिका की तुलना वास्तविक वीडियो क्लिप्स से करता है। यह गलतियों को ढूंढ निकालता है।

    • उदाहरण: "हे, आपकी नियम पुस्तिका कहती है कि लावा पर चलना सुरक्षित है, लेकिन वीडियो दिखाता है कि एजेंट लावा को छूते ही मर गया।"
      सिस्टम फिर यह फीडबैक वापस AI सहायक को भेजता है: "आपने लावा वाले हिस्से को गलत समझा। अपना कोड ठीक करें।"
      AI कोड को फिर से लिखता है, और यह चक्र तब तक दोहराया जाता है जब तक कि नियम पुस्तिका भूलभुलैया में होने वाली घटनाओं की सटीक भविष्यवाणी न करने लगे।

यह एक बड़ी बात क्यों है?

  • चीट शीट की आवश्यकता नहीं: पिछले तरीकों के विपरीत, Pinductor केवल वही सीखता है जो एजेंट देखता है और करता है। इसे कभी भी छिपे हुए नक्शे को झाँकने की अनुमति नहीं मिलती।
  • यह कुशल है: यह बहुत तेज़ी से सीखता है। पेपर दिखाता है कि केवल कुछ वीडियो क्लिप्स (जैसे 10 छोटी दौड़) के साथ, AI एक ऐसा मॉडल बना सकता है जो उन तरीकों के लगभग बराबर काम करता है जिनके पास चीट शीट होती है।
  • यह "कॉमन सेंस" का उपयोग करता है: जादू LLM के पूर्व ज्ञान से आता है। AI पहले से ही जानता है कि "लावा गर्म होता है" या "दरवाजों को चाबियों की आवश्यकता होती है।" यह इस कॉमन सेंस का उपयोग एक शिक्षित अनुमान लगाने के लिए करता है, और फिर उस अनुमान को बारीक रूप से सुधारने (fine-tune) के लिए डेटा का उपयोग करता है।

परिणाम

शोधकर्ताओं ने इसका परीक्षण "MiniGrid" वातावरण (सरल ग्रिड-वर्ल्ड गेम्स) पर किया।

  • प्रदर्शन (Performance): Pinductor ने "चीट शीट" वाले तरीकों के समान प्रदर्शन किया और उन पारंपरिक तरीकों की तुलना में बहुत बेहतर प्रदर्शन किया जो AI का उपयोग नहीं करते हैं।
  • विश्वास की सटीकता (Belief Accuracy): जैसे-जैसे एजेंट भूलभुलैया के माध्यम से आगे बढ़ता है, उसकी आंतरिक "विश्वास" (belief) कि वह कहाँ है, अधिक स्पष्ट और सटीक होती जाती है, और अंततः वास्तविक स्थान का पता लगा लेती है, भले ही उसने कभी नक्शा न देखा हो।
  • निर्भरता (Dependency): यह विधि AI की बुद्धिमत्ता पर बहुत अधिक निर्भर करती है। यदि आप एक "कम बुद्धिमान" AI का उपयोग करते हैं या वातावरण के टेक्स्ट विवरण को हटा देते हैं, तो प्रदर्शन गिर जाता है। यह साबित करता है कि AI अपने भाषा ज्ञान का उपयोग अंतराल को भरने के लिए कर रहा है।

सारांश

संक्षेप में, Pinductor एक AI को एक अंधेरे कमरे का मानसिक मानचित्र बनाने के लिए प्रशिक्षित करता है, जिसमें एक सुपर-स्मार्ट लैंग्वेज मॉडल कमरे के नियमों का अनुमान लगाता है, और फिर एजेंट जो वास्तव में देखता है उसके आधार पर उन अनुमानों को सुधारा जाता है। यह यह सीखने का एक तरीका है कि दुनिया कैसे काम करती है, बिना किसी चीट शीट की आवश्यकता के, जो रोबोटों को वास्तविक, अस्त-व्यस्त और अप्रत्याशित वातावरण में स्वतंत्र रूप से नेविगेट करने के योग्य बनाने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →