← नवीनतम पेपर
💻 computer science

Planning with Unified Multimodal Models

यह शोध पत्र Uni-Plan को प्रस्तुत करता है, जो एक नवीन प्लानिंग फ्रेमवर्क है जो नीति (policy), गतिकी (dynamics) और मूल्य फलनों (value functions) के रूप में एक साथ कार्य करने के लिए एकीकृत मल्टीमॉडल मॉडल्स का लाभ उठाता है, जबकि मतिभ्रम (hallucinations) को कम करने और विशेषज्ञ प्रदर्शनों (expert demonstrations) की आवश्यकता के बिना श्रेष्ठ एम्बॉडीड निर्णय लेने (embodied decision-making) में प्रदर्शन प्राप्त करने के लिए स्व-विभेदित फ़िल्टरिंग (self-discriminated filtering) का उपयोग करता है।

मूल लेखक: Yihao Sun, Zhilong Zhang, Yang Yu, Pierre-Luc Bacon

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihao Sun, Zhilong Zhang, Yang Yu, Pierre-Luc Bacon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल बोर्ड गेम खेलना सिखाने की कोशिश कर रहे हैं, जैसे कि एक मेज पर एक लाल पंचकोण (red pentagon) को एक विशिष्ट स्थान पर ले जाना।

वर्तमान में अधिकांश AI रोबोट आंखों पर पट्टी बांधे हुए शतरंज के खिलाड़ियों की तरह हैं। वे नियमों को पढ़ सकते हैं और खेल के बारे में बहुत अच्छी तरह से बात कर सकते हैं (टेक्स्ट का उपयोग करके), लेकिन वे योजना बनाने के लिए अपने मन में बोर्ड को देख नहीं पाते हैं। उन्हें अनुमान लगाना पड़ता है कि यदि वे किसी मोहरे को हिलाते हैं तो क्या होगा, और वे अक्सर गलत अनुमान लगाते हैं क्योंकि वे परिणाम को विज़ुअलाइज़ (दृश्य रूप में देखना) नहीं कर पाते हैं।

यह पेपर Uni-Plan पेश करता है, जो रोबोट को सोचने और योजना बनाने का एक नया तरीका है। केवल आंखों पर पट्टी बांधने के बजाय, Uni-Plan रोबोट को एक "मानसिक मूवी प्रोजेक्टर" देता है।

यह कैसे काम करता है, यहाँ इसके सरल भागों में विवरण दिया गया है:

1. "स्विस आर्मी नाइफ" जैसा रोबोट दिमाग

आमतौर पर, एक रोबोट प्लानर बनाने के लिए तीन अलग-अलग विशेषज्ञों की आवश्यकता होती है:

  • द प्लानर (The Planner): तय करता है कि अगला कदम क्या उठाया जाए।
  • द प्रेडिक्टर (The Predictor): अनुमान लगाता है कि उस कदम के बाद दुनिया कैसी दिखेगी।
  • द जज (The Judge): यह तय करता है कि वह भविष्य अच्छा है या बुरा।

Uni-Plan विशेष है क्योंकि यह तीनों काम एक साथ करने के लिए एक ही मस्तिष्क (एक यूनिफाइड मल्टीमॉडल मॉडल) का उपयोग करता है। यह आपके निर्देशों को पढ़ सकता है, भविष्य की तस्वीर की कल्पना कर सकता है, और यह निर्णय ले सकता है कि वह तस्वीर जीत है या हार—सब कुछ एक ही बार में।

2. "मानसिक फिल्म" (डायनेमिक्स मॉडल)

Uni-Plan का मूल आधार चित्र (images) उत्पन्न करने की इसकी क्षमता है। जब आप इसे कहते हैं, "लाल ब्लॉक को नीले तारे की ओर ले जाओ," तो यह केवल "ठीक है" नहीं कहता। यह वास्तव में उस चीज़ का चित्र बनाता है कि कदम उठाने के बाद मेज कैसी दिखेगी।

इसे एक बच्चे के रूप में सोचें जो LEGO के साथ खेल रहा है। इससे पहले कि वे एक ईंट को हिलाएं, वे अपनी आँखें बंद करते हैं और कल्पना करते हैं कि वह कहाँ गिरेगी। Uni-java यह काम छवियों के साथ करता है। यह भविष्य का एक "मानसिक मूवी" बनाता है ताकि यह देख सके कि क्या योजना समझ में आती है।

3. "स्व-सुधार" फ़िल्टर (सेल्फ-डिस्क्रिमिनेटेड फ़िल्टरिंग)

यहाँ पेचीदा हिस्सा आता है: कभी-कभी, रोबोट की "मानसिक फिल्म" गलत होती है। यह भ्रमित (hallucinate) हो सकता है (कल्पना कर सकता है) कि एक ब्लॉक गायब हो गया या ऐसी जगह चला गया जहाँ वह पहुँच ही नहीं सकता था। इसे "हैलुसिनेशन" कहा जाता है।

इसे ठीक करने के लिए, लेखकों ने रोबोट को एक दूसरा दिमाग दिया है जो एक सख्त संपादक (editor) के रूप में कार्य करता है।

  • चरण 1: रोबोट एक भविष्य की कल्पना करता है (जैसे, "मैंने ब्लॉक को यहाँ हिलाया")।
  • चरण 2: "संपादक" उस भविष्य की तस्वीर को देखता है और पूछता है, "यदि मैंने यह तस्वीर देखी होती, तो किस चाल के कारण ऐसा हुआ होता?"
  • चरण 3: यदि संपादक कहता है, "वह तस्वीर तभी संभव होती यदि आपने ब्लॉक को बाएं हिलाया होता, लेकिन आपने मुझे बताया कि आपने इसे दाएं हिलाया है," तो रोबोट जान जाता है कि वह तस्वीर नकली है। वह उस खराब भविष्यवाणी को फेंक देता है।

यह एक लेखक की तरह है जो एक कहानी लिखता है, फिर उसे उल्टा (पीछे से) पढ़ता है ताकि यह जांच सके कि कहानी में कोई छेद तो नहीं है। यदि वे नहीं मिलते, तो वह उस संस्करण को हटा देता है और फिर से प्रयास करता है।

4. परिणाम: यह क्यों जीतता है

शोधकर्ताओं ने छह अलग-अलग कार्यों पर इसका परीक्षण किया, जिसमें भूलभुलैया (mazes) से लेकर वास्तविक मेज पर वस्तुओं को व्यवस्थित करना तक शामिल है।

  • केवल टेक्स्ट से बेहतर: जो रोबोट केवल टेक्स्ट का उपयोग करते हैं (जैसे मानक चैटबॉट्स), वे अक्सर विफल हो जाते क्योंकि वे भौतिक दुनिया को विज़ुअलाइज़ नहीं कर पाते थे। Uni-Plan बहुत अधिक बार सफल रहा क्योंकि यह अपनी गलतियों को वास्तविक कदम उठाने से पहले ही देख सकता था।
  • गलतियों से सीखना: आमतौर पर, रोबots को विशेषज्ञों द्वारा उन्हें आदर्श चालें दिखाने के माध्यम से सिखाने की आवश्यकता होती है। Uni-Plan ने "गैर-विशेषज्ञ" डेटा का उपयोग करके भी उतना ही अच्छा (और कभी-कभी बेहतर) सीखा—बेसिक रूप से, इसने लोगों को रैंडम मूव्स करते हुए देखकर और पैटर्न को समझकर सीखा, बिना किसी परफेक्ट टीचर की आवश्यकता के।
  • गति: क्योंकि यह सब कुछ करने के लिए एक ही मॉडल का उपयोग करता है, इसलिए यह उन प्रणालियों की तुलना में बहुत तेज़ है जो विभिन्न उपकरणों को जोड़ने का प्रयास करती हैं।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि स्मार्ट रोबोट बनाने के लिए, हमें केवल उन्हें बेहतर तरीके से बात करना ही नहीं सिखाना चाहिए; हमें उन्हें विज़ुअलाइज़ (दृश्य रूप में देखना) करने में बेहतर बनाना होगा। रोबोट को भविष्य की छवियां उत्पन्न करने और फिर यह जांचने की अनुमति देकर कि क्या वे छवियां तार्किक हैं, रोबोट भौतिक समस्याओं को हल करने में बहुत अधिक विश्वसनीय हो जाता है।

संक्षेप में: Uni-Plan एक ऐसा रोबोट है जो न केवल भविष्य के बारे में सोचता है; बल्कि वह भविष्य का चित्र बनाता है, यह जांचता है कि क्या वह चित्र समझ में आता है, और फिर सबसे अच्छे संस्करण पर कार्य करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →