← नवीनतम पेपर
🤖 AI

Visual Foresight for Robotic Stow: A Diffusion-Based World Model from Sparse Snapshots

यह शोध पत्र FOREST को प्रस्तुत करता है, जो एक डिफ्यूजन-आधारित वर्ल्ड मॉडल है जो विरल स्नैपशॉट्स (sparse snapshots) और नियोजित स्टोव एक्शन (stow actions) से भविष्य के बिन कॉन्फ़िगरेशन की भविष्यवाणी करता है, जो ह्यूरिस्टिक्स (heuristics) की तुलना में बेहतर ज्यामितीय सटीकता प्रदर्शित करता है और डाउनस्ट्रीम वेयरहाउस प्लानिंग कार्यों के लिए मूल्यवान फॉरसाइट सिग्नल प्रदान करता है।

मूल लेखक: Lijun Zhang, Nikhil Chacko, Petter Nilsson, Ruinian Xu, Shantanu Thakar, Bai Lou, Harpreet Sawhney, Zhebin Zhang, Mudit Agrawal, Bhavana Chandrashekhar, Aaron Parness

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lijun Zhang, Nikhil Chacko, Petter Nilsson, Ruinian Xu, Shantanu Thakar, Bai Lou, Harpreet Sawhney, Zhebin Zhang, Mudit Agrawal, Bhavana Chandrashekhar, Aaron Parness

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: रोबोट का "क्रिस्टल बॉल" (भवि счет बताने वाला गोला)

कल्पना कीजिए कि आप एक बिखरी हुई बुकशेल्फ़ को व्यवस्थित कर रहे हैं। आपके हाथ में एक नई किताब है, और आप जानना चाहते हैं: "अगर मैं इस किताब को यहाँ अंदर धकेलता हूँ, तो क्या यह बगल की किताबों को गिरा देगा? क्या यह बाईं ओर या दाईं ओर खिसक जाएगी?"

इंसान यह काम तुरंत कर लेते हैं। हमारे दिमाग में एक आंतरिक "फिजिक्स इंजन" होता है जो हमें वास्तव में हिलने-डुलने से पहले भविष्य का अनुकरण (simulate) करने की अनुमति देता है।

अमेज़न के गोदामों में काम करने वाले रोबोटों को भी इसी समस्या का सामना करना पड़ता है, लेकिन बहुत बड़े पैमाने पर। उन्हें हर दिन फैब्रिक बिन्स (fabric bins) में लाखों सामान रखने होते हैं। वर्तमान में, रोबोट अक्सर किसी चीज़ को रखने की कोशिश करते हैं, देखते हैं कि क्या हुआ, और फिर उसे ठीक करते हैं। यह धीमा और अक्षम है।

यह पेपर FOREST (Foresight for STow) पेश करता है। FOREST को एक रोबोटिक क्रिस्टल बॉल के रूप में समझें। यह रोबोट को एक बिन को देखने, एक नया आइटम देखने और यह अनुमान लगाने की अनुमति देता है कि रोबोट द्वारा आइटम डालने के बाद वह बिन बिल्कुल कैसा दिखेगा, और वह यह सब तब कर लेता है जब रोबोट ने अभी तक अपनी एक मांसपेशी भी नहीं हिलाई है।

समस्या: "स्पार्स स्नैपशॉट" (Sparse Snapshot) की चुनौती

आमतौर पर, यह सीखने के लिए कि चीजें कैसे चलती हैं, आपको एक वीडियो की आवश्यकता होती है। आपको उस पूरी फिल्म की आवश्यकता होती है जिसमें रोबोट चीजों को धकेल रहा हो।

लेकिन एक वास्तविक गोदाम में, हर एक सेकंड की हर रोबोटिक आर्म की फिल्म बनाना असंभव है। उनके पास मौजूद डेटा एक फलिपबुक की तरह है जिसके पन्ने गायब हैं। उनके पास केवल दो तस्वीरें हैं:

  1. तस्वीर A: आइटम जोड़ने से पहले का बिन।
  2. तस्वीर B: आइटम जोड़ने के बाद का बिन।

रोबोट को उस "मूवी" (गति, खिसकना, गिरना) का अनुमान लगाना होता है जो उन दो स्थिर तस्वीरों के बीच हुई। यह अविश्वसनीय रूप से कठिन है क्योंकि सामान फिसल सकता है, पलट सकता है या अप्रत्याशित तरीकों से धकेला जा सकता है।

समाधान: FOREST

शोधकर्ताओं ने इसे हल करने के लिए FOREST नामक एक मॉडल बनाया है। यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. "स्लॉट" सिस्टम (अराजकता को व्यवस्थित करना)

कल्पना कीजिए कि बिन एक पहेली बोर्ड (puzzle board) है। बिखरे हुए सामान को एक धुंधली फोटो के रूप में देखने के बजाय, FOREST हर आइटम को एक विशिष्ट "पहेली के टुकड़े" या "स्लॉट" में बदल देता है।

  • यह "पहले" की तस्वीर को देखता है और हर आइटम को एक विशिष्ट सीट (स्लॉट 1, स्लॉट 2, स्लॉट 3) आवंटित करता है।
  • यह "बाद" की तस्वीर को देखता है और देखता है कि नए आइटम ने एक नई सीट ले ली है, और शायद पुराने आइटम अपनी सीटें बदल चुके हैं।
  • बिखरी हुई भीड़ को "किसने कहाँ जगह बदली" की एक साफ सूची में बदलकर, रोबमान खेल के नियमों को बहुत बेहतर तरीके से सीख सकता है।

2. "मैजिक पेंटब्रश" (डिफ्यूजन मॉडल)

भविष्य की भविष्यवाणी करने के लिए, FOREST एक डिफ्यूजन मॉडल (Diffusion Model) का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आपके पास "बाद" की स्थिति की एक स्पष्ट फोटो है, लेकिन किसी ने उस पर स्टैटिक शोर (जैसे टीवी का शोर/static noise) से ढक दिया है।
  • मॉडल एक खाली, शोर भरे कैनवास से शुरू होता है। यह पूछता है: "यदि मैं जानता हूँ कि बिन पहले कैसा दिखता था, और मैं जानता हूँ कि नया आइटम क्या है, तो इस शोर को सही 'बाद' वाली तस्वीर में बदलने के लिए कैसा दिखना चाहिए?"
  • यह धीरे-धीरे इमेज को "डिनोइज़" (denoise) करता है, स्टेप-दर-स्टेप, स्टैटिक को हटाते हुए, जब तक कि भविष्य के बिन की एक स्पष्ट, वास्तविक तस्वीर उभर कर सामने नहीं आती। यह धुंध से एक मूर्ति को तराशने जैसा है।

3. "इंस्ट्रक्शन मैनुअल" (स्टो इंटेंट - रखने का इरादा)

रोबोट केवल रैंडम अंदाज़ा नहीं लगाता। उसे एक संकेत दिया जाता है: "मैं जगह बनाने के लिए सामान को बाईं ओर धकेलने की योजना बना रहा हूँ।"
FOREST इस निर्देश (इरादे) का उपयोग अपनी भविष्यवाणी को निर्देशित करने के लिए करता है। यदि रोबोट सामान को एक तरफ हटाने की योजना बनाता है, तो मॉडल को एक बड़े बदलाव की भविष्यवाणी करने का संकेत मिलता है। यदि रोबोट आइटम को धीरे से छोड़ने की योजना बनाता है, तो मॉडल एक छोटे बदलाव की भविष्यवाणी करता है।

यह क्यों मायने रखता है? ("टेस्ट ड्राइव")

शोधकर्ताओं ने केवल यह नहीं कहा कि "यह कूल है।" उन्होंने इसे दो तरीकों से टेस्ट किया:

1. "सटीकता परीक्षण" (Accuracy Test)
उन्होंने FOREST की भविष्यवाणियों की तुलना वास्तविक परिणाम से की।

  • पुराना तरीका (Heuristics): रोबोट बस नए आइटम को बिन में एक स्टिकर की तरह चिपका देता है। यह भौतिकी (physics) को अनदेखा करता है। परिणाम: यह 70% बार गलत होता है।
  • FOREST: यह झुकने और फिसलने की भविष्यवाणी करता है। परिणाम: यह ज्यामिति (geometry) को 70-80% बार सही पकड़ लेता है। यह ब्लॉक जोड़ने वाले बच्चे और एक मास्टर आर्किटेक्ट के बीच के अंतर जैसा है।

2. "डाउनस्ट्रीम टेस्ट" (क्या यह अन्य रोबोटों की मदद कर सकता है?)
उन्होंने पूछा: "यदि हम FOREST की नकली भविष्यवाणी का उपयोग वास्तविक फोटो के बजाय करते हैं, तो क्या यह अन्य रोबोट कार्यों को खराब कर देगा?"

  • कार्य A (स्पेस चेक): क्या रोबोट बता सकता है कि कितनी खाली जगह बची है? FOREST की भविष्यवाणी का उपयोग करने से त्रुटि बहुत कम (लगभग नगण्य) रही।
  • कार्य B (लॉन्ग-टर्म प्लानिंग): क्या रोबोट 4 कदम आगे की योजना बना सकता है? हाँ! भले ही रोबोट ने अपने अगले कदम के लिए अपनी ही भविष्यवाणियों का उपयोग किया, वह विफल नहीं हुआ। वह कई चरणों तक भविष्य के परिदृश्य का "रोल आउट" कर सका।

निष्कर्ष (Takeaway)

FOREST वेयरहाउस रोबोटों के लिए एक सिम्युलेटर है।

एक क्रिया करने और फिर उम्मीद करने के बजाय कि सब ठीक होगा, रोबोट अब एक "मानसिक सिमुलेशन" चला सकता है। वह पूछ सकता है, "अगर मैं इस भारी बॉक्स को यहाँ रखता हूँ, तो क्या इसके बगल वाला हल्का बॉक्स गिर जाएगा?" और तुरंत एक बहुत सटीक उत्तर प्राप्त कर सकता है।

इसका मतलब है कि रोबोट:

  • बिन्स को अधिक सघनता से पैक कर सकते हैं (अधिक दक्षता)।
  • चीजों को गिरने से बचा सकते हैं (कम नुकसान)।
  • जटिल चालों की योजना बिना पहले प्रयास किए बना सकते हैं (तेज़ थ्रूपुट)।

संक्षेप में, FOREST रोबोटों को आगे सोचने की क्षमता देता है, जिससे वे अनाड़ी पैकर्स से विशेषज्ञ ऑर्गनाइज़र बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →