← नवीनतम पेपर
💻 computer science

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

यह शोध पत्र फ्यूचर-एक्सपीरियंस कंडीशनिंग (FEC) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मल्टी-स्टेप रोबोट मैनिपुलेशन कार्यों में अन्वेषण (exploration) और पॉलिसी अनुकूलन को महत्वपूर्ण रूप से बढ़ाने के लिए LLM-निर्देशित, लघु-क्षितिज भविष्य के वीडियो अनुमानों को संरचित प्रायर्स (structured priors) के रूप में उपयोग करता है, यह प्रदर्शित करते हुए कि त्रुटिपूर्ण भविष्य के परिकल्पनाएं भी प्रदर्शन में सुधार करती हैं जबकि असंगत परिकल्पनाएं इसे कम करती हैं।

मूल लेखक: Mohammad Khoshnazar, Andrew Melnik, Michael Beetz

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohammad Khoshnazar, Andrew Melnik, Michael Beetz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दराज खोलने, लाइट चालू करने या कप को कैबिनेट के अंदर धकेलने का काम सिखाने की कोशिश कर रहे हैं। ये केवल "यहाँ दबाओ" जैसे सरल कार्य नहीं हैं; ये कई चरणों वाली पहेलियाँ हैं जहाँ जो आप अभी करते हैं, वह अगले कुछ सेकंड के लिए दुनिया को बदल देता है। समस्या यह है कि रोबोट अक्सर अंधे होकर काम करते हैं, वे केवल उसी पर प्रतिक्रिया देते हैं जो वे इस क्षण देख रहे हैं, बिना यह सोचे कि आगे क्या होने वाला है।

यह शोध पत्र एक चतुर तरीका पेश करता है जिससे रोबोट को एक "क्रिस्टल बॉल" (भविष्य दिखाने वाला गोला) दी जा सके—लेकिन यह कोई एकदम सटीक गोला नहीं है। यह एक शॉर्ट-होरिजन फ्यूचर वीडियो (कम समय के भविष्य का वीडियो) है जो रोबोट को दिखाता है कि कुछ सेकंड बाद दृश्य कैसा दिख सकता है।

यह सिस्टम कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "दिमाग" (LLM Reasoner)

सबसे पहले, रोबोट को एक कार्य मिलता है (जैसे, "दराज खोलो")। एक लार्ज लैंग्वेज मॉडल (एक बहुत ही बुद्धिमान AI दिमाग की तरह) कमरे को देखता है और निर्देश को समझता है। वह केवल अनुमान नहीं लगाता; वह एक "नियम पुस्तिका" (ऑन्टोलॉजी) का उपयोग करके यह पता लगाता है कि:

  • किस वस्तु को हिलाने की आवश्यकता है?
  • वस्तु के किस हिस्से को छुआ जाना चाहिए?
  • वस्तु को कैसे हिलना चाहिए?

इसे शतरंज में चाल चलने की योजना बनाने जैसा समझें: "यदि मैं इस मोहरे को चलता हूँ, तो प्रतिद्वंद्वी का राजा असुरक्षित हो जाएगा।" AI चाल के इरादे की योजना बनाता है।

2. "घोस्ट" (डिजिटल ट्विन)

इसके बाद, सिस्टम एक "घोस्ट वीडियो" (भूतिया वीडियो) बनाता है। यह योजना के अनुसार वस्तु को चलते हुए सिम्युलेट करता है, लेकिन इसमें रोबोट का हाथ दिखाई नहीं देता। यह एक पारदर्शी एनीमेशन की तरह है जो दिखाता है कि दराज फिसलकर खुल रही है या बल्ब जल रहा है। यह "डिजिटल ट्विन" वाला हिस्सा है—यह वस्तु की गति का एक साफ, आदर्श सिमुलेशन है।

3. "पेंटर" (वीडियो डिफ्यूजन मॉडल)

अब, सिस्टम को भविष्य में खुद को उस दृश्य में दिखाना होगा। यह "घोस्ट वीडियो" लेता है और एक विशेष AI पेंटर (वीडियो डिफ्यूजन मॉडल) का उपयोग करके उसमें रोबोट के हाथ को "इनपेंट" (चित्रित) करता है।

  • जादुई ट्रिक: यह यह जाने बिना करता है कि रोबोट का हाथ पिक्सेल-दर-पिक्सेल कहाँ है। यह बस पहले फ्रेम और घोस्ट एनीमेशन को देखता है, और फिर भविष्य को साकार करने के लिए स्वाभाविक रूप से रोबोट के हाथ को पेंट करता है।
  • परिणाम एक छोटा, 16-फ्रेम का वीडियो क्लिप है जो सफलतापूर्वक कार्य पूरा होते हुए दिखाता है।

4. "कोच" (फ्यूचर-एक्सपीरियंस कंडीशनिंग)

यही मुख्य नवाचार है। रोबोट के कंट्रोलर (वह हिस्सा जो मोटरों को चलाता है) को एक साथ दो चीजें दी जाती हैं:

  1. वह जो वह अभी देख रहा है।
  2. ऊपर बनाया गया भविमंत वीडियो क्लिप।

रोबोट को मूल रूप से कहा जाता है: "यहाँ वह है जो तुम अभी कर रहे हो, और यहाँ वह छोटा सा वीडियो है जो तुम्हें अगले कुछ सेकंड में करना चाहिए। उस मूवी का उपयोग अपने अगले कदम के मार्गदर्शन के लिए करें।"

प्रयोग: क्या क्रिस्टल बॉल काम करती है?

शोधकर्ताओं ने एक सिम्युलेटेड किचन (RoboCasa और CALVIN) में चार अलग-अलग परिदृश्यों में इसका परीक्षण किया:

  • कोई भविष्य नहीं (No Future): रोबोट को कोई क्रिस्टल बॉल नहीं मिलती। वह केवल प्रतिक्रिया देता है। (वह संघर्ष करता है)।
  • पूर्ण भविष्य (GTFuture): रोबोट को भविष्य का एक परफेक्ट वीडियो मिलता है (जो एक मानव विशेषज्ञ से लिया गया है)। (वह सबसे तेजी से सीखता है और सबसे अच्छा प्रदर्शन करता है)।
  • जेनरेटेड भविष्य (GenFuture): रोबोट को AI सिस्टम द्वारा बनाया गया वीडियो मिलता है। (वह बहुत अच्छा प्रदर्शन करता है, लगभग उतना ही अच्छा जितना कि परफेक्ट वाला)।
  • गलत भविष्य (WrongFuture): रोबol को एक ऐसा वीडियो मिलता है जिसमें गलत चीज़ हो रही है (जैसे, दराज खुलने के बजाय बंद हो रही है)। (वह पूरी तरह विफल हो जाता है, 0% सफलता पर अटक जाता है)।

मुख्य निष्कर्ष

यह शोध पत्र सिद्ध करता है कि भविष्य के बारे में एक "अच्छा अनुमान" होने से रोबोट तेजी से सीखता है और बेहतर काम करता है।

  • उपमा: गाड़ी चलाना सीखने की कल्पना करें। यदि आप केवल अपने सामने वाले बंपर को देखते हैं (No Future), तो आप टकरा सकते हैं। यदि कोई आपको 5 सेकंड आगे का रास्ता दिखाने वाला एक वीडियो देता है जिसमें एक स्पष्ट रास्ता दिख रहा है (Generated Future), तो आप सुचारू रूप से स्टीयरिंग कर सकते हैं। लेकिन यदि वे आपको एक खाई दिखाने वाला वीडियो देते हैं (Wrong Future), तो आप घबरा जाएंगे और दुर्घटनाग्रस्त हो जाएंगे।
  • परिणाम: AI-जेनरेटेड भविष्य के वीडियो का उपयोग करने वाले रोबोट ने उस रोबोट की तुलना में काफी तेजी से सीखा जिसने भविष्य नहीं देखा था और कम गलतियाँ कीं। भले ही AI के भविष्य के वीडियो 100% सटीक नहीं थे, फिर भी वे एक सहायक मार्गदर्शक के रूप में कार्य करने के लिए "पर्याप्त अच्छे" थे।

महत्वपूर्ण नोट: शोध पत्र स्पष्ट रूप से कहता है कि यह एक सिमुलेशन अध्ययन है। उन्होंने इसे एक कंप्यूटर की दुनिया में परखा है, न कि वास्तविक रसोई में किसी वास्तविक भौतिक रोबोट पर। वे यह दावा नहीं कर रहे हैं कि यह अभी वास्तविक हार्डवेयर पर काम करता है, और न ही वे चिकित्सा या नैदानिक अनुप्रयोगों के बारे में चर्चा कर रहे हैं। लक्ष्य केवल यह सिद्ध करना था कि "भविष्य की कल्पना करना" नियंत्रित वातावरण में रोबोट को बेहतर तरीके से सीखने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →