← नवीनतम पेपर
💻 computer science

Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation

यह शोध पत्र AHEAD को प्रस्तुत करता है, जो एक 'प्रिडिक्ट-देन-एक्ट' (predict-then-act) फ्रेमवर्क है जो फ्रोजन विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स को भविष्य के विजुअल टोकन्स का पूर्वानुमान लगाने के लिए एक लाइटवेट, मोशन-अवेयर लेटेंट वर्ल्ड मॉडल के साथ संवर्धित करता है, जिससे सिमुलेटेड और फिजिकल रोबोट्स दोनों पर सुदृढ़ डायनेमिक मैनिपुलेशन सक्षम होता है जहाँ मौजूदा बेसलाइन्स विफल हो जाते हैं।

मूल लेखक: Shahram Najam Syed, Arthur Jakobsson, Haoran Hao, Jeffrey Ichnowski

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shahram Najam Syed, Arthur Jakobsson, Haoran Hao, Jeffrey Ichnowski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य समस्या: "समय में जम जाने वाला" रोबोट

कल्पना कीजिए कि आप अपने एक दोस्त के साथ कैच खेलने खेल रहे हैं। यदि आपका दोस्त आपकी ओर एक गेंद फेंकता है, तो आप केवल गेंद के आपके हाथ से टकराने का इंतज़ार नहीं करते और फिर अपना हाथ हिलाते हैं। ऐसा करना बहुत धीमा होगा! इसके बजाय, आप गेंद को देखते हैं, अंदाज़ा लगाते हैं कि वह कहाँ जा रही है, और फिर उस जगह पर अपना हाथ ले जाते हैं जहाँ वह एक सेकंड के हिस्से में होगी।

वर्तमान रोबोट "दिमाग" (जिन्हें विज़न-लैंग्वेज-एक्शन या VLA मॉडल कहा जाता है) ऐसे खिलाड़ी की तरह हैं जो हर बार गेंद देखने पर एक पल के लिए जम जाते हैं। वे गेंद को देखते हैं, निर्णय लेते हैं कि क्या करना है, और फिर हिलते हैं। लेकिन जब तक वे वास्तव में हिलते हैं, गेंद पहले ही आगे बढ़ चुकी होती है। यदि गेंद तेज़ चल रही है (जैसे कन्वेयर बेल्ट पर या फेंकी जा रही हो), तो रोबोट हमेशा उस जगह पहुँचने की कोशिश करता है जहाँ गेंद थी, न कि जहाँ वह जा रही है। वह हर बार चूक जाता है।

समाधान: AHEAD (एक "क्रिस्टल बॉल" वाला आवरण)

शोधकर्ताओं ने AHEAD (Anticipatory Horizon Extrapolation with Adaptive Dynamics) नामक एक नया सिस्टम बनाया है। AHEAD को एक नए दिमाग के रूप में नहीं, बल्कि एक विशेष चश्मे के रूप में सोचें जिसे आप एक मौजूदा रोबोट दिमाग के ऊपर पहनते हैं।

इसके नीचे का रोबोट दिमाग "जमा हुआ" है (यह पहले से ही प्रशिक्षित है और हम इसे फिर से प्रशिक्षित नहीं करना चाहते)। AHEAD एक स्मार्ट सहायक की तरह काम करता है जो कहता है: "रुको, जो तुम अभी देख रहे हो उस पर प्रतिक्रिया मत दो। इस भविष्यवाणी को देखो कि एक सेकंड के छोटे से हिस्से में दृश्य कैसा दिखेगा, और फिर अपनी चाल चलो।"

यह कैसे काम करता है: तीन जादुई ट्रिक्स

1. "स्पॉटलाइट" (भाषा और गति का महत्व)
एक व्यस्त रसोई की कल्पना करें जिसमें सौ चीजें हिल रही हैं: एक घूमता हुआ पंखा, एक लहराता हुआ पर्दा, और एक शेफ जो एक बर्तन में बत्तख फेंक रहा है। रोबोट को पंखे या पर्दे की भविष्यवाणी करने की आवश्यकता नहीं है; उसे केवल बत्तख की परवाह है।

  • AHEAD क्या करता है: यह रोबोट के भाषाई निर्देशों (जैसे, "पीली बत्तख उठाओ") और एक मोशन डिटेक्टर का उपयोग करके केवल हिलती हुई बत्तख पर एक स्पॉटलाइट डालता है। यह बाकी सब कुछ अनदेखा कर देता है। यह कंप्यूटिंग पावर का एक बड़ा हिस्सा बचाता है, जिससे रोबोट तेज़ी से सोचने में सक्षम होता है।

2. "भौतिकी की क्रिस्टल बॉल" (लेटेंट वर्ल्ड मॉडल)
रसोई का एक नया चित्र बनाने की कोशिश करने के बजाय (जो धीमा और पिक्सेल-भारी होता है), AHEAD भविष्य की भविष्यवाणी एक "गुप्त कोड" (लेटेंट स्पेस) में करता है जिसे रोबोट का दिमाग पहले से ही समझता है।

  • उपमा: कल्पना कीजिए कि रोबोट का दिमाग "रोबोट-ईज़" बोलता है। AHEAD कोई नई भाषा सीखने की कोशिश नहीं करता; यह बस "रोबोट-ईज़" में भविष्य की फुसफुसाहट करता है।
  • ट्रिक: यह सरल भौतिकी नियमों का उपयोग करता है (जैसे यह जानना कि यदि एक गेंद पहाड़ी से नीचे लुढ़क रही है, तो उसकी गति बढ़ेगी) ताकि यह अनुमान लगाया जा सके कि वस्तु कहाँ होगी। इसे शुरुआत से जटिल भौतिकी सीखने की आवश्यकता नहीं है; यह बस वेग (velocity) और त्वरण (acceleration) के गणित को "गुप्त कोड" पर लागू करता है।

3. "स्मार्ट स्टॉप" (अनुकूली क्षितिज/Adaptive Horizon)
कभी-कभी, भविष्य की भविष्यवाणी करना आसान होता है (एक सीधी रेखा में लुढ़कती गेंद)। कभी-कभी, यह अराजक होता है (एक गेंद तीन अलग-अलग दीवारों से टकराकर उछलती है)।

  • AHEAD क्या करता है: यह अपनी भविष्यवाणी को समय में आगे की ओर बढ़ाता है। यदि भविष्यवाणी बहुत धुंधली या अनिश्चित हो जाती है (जैसे जब एक गेंद दीवार से टकराती है और बेतरतीब ढंग से उछलती है), तो AHEAD कहता है, "ठीक है, मैं इतनी दूर तक स्पष्ट रूप से नहीं देख सकता। चलिए भविष्यवाणी करना बंद करते हैं और आखिरी स्पष्ट अनुमान पर कार्य करते हैं।" यह रोबज़ को बेतुकी भविष्यवाणी करने में समय बर्बाद करने से रोकता है।

परिणाम: पकड़ से बाहर को भी पकड़ना

शोधकर्ताओं ने एक वास्तविक रोबोटिक हाथ (xArm 7) और कंप्यूटर सिमुलेशन में इसका परीक्षण किया।

  • चुनौती: उन्होंने रोबोट को गेंदें पकड़ने, लुढ़कती गेंदों को रोकने और चलती हुई कन्वेयर बेल्ट से वस्तुओं को उठाने का अभ्यास कराया।
  • प्रतिस्पर्धा: उन्होंने AHEAD की तुलना सबसे अच्छे मौजूदा रोबोट दिमागों से की।
    • पुराना तरीका: जब वस्तुएं तेज़ चलती थीं, तो अन्य रोबोट लगभग 100% बार विफल हो जाते थे। वे हमेशा खाली जगह की ओर हाथ बढ़ाते रह जाते थे।
    • AHEAD: यह सिमुलेशन कार्यों में 79% से 97% तक सफल रहा। वास्तविक रोबोट पर, इसने एक उड़ती हुई गेंद को 30 में से 19 बार सफलतापूर्वक पकड़ा, जबकि अन्य सभी रोबोट 30 में से 0 बार भी सफल नहीं हो पाए।

निचोड़

AHEAD एक रोबोट को "वेन ग्रेट्स्की" वाली मानसिकता देने जैसा है। जैसा कि प्रसिद्ध हॉकी खिलाड़ी ने कहा था, "मैं वहां स्केट करता हूँ जहाँ पक (puck) जाने वाला है, न कि वहां जहाँ वह था।"

मौजूदा रोबोट दिमाग के ऊपर एक छोटा, तेज़ "भविदर्शक" जोड़कर, यह सिस्टम रोबोट को पूरी तरह से पुन: प्रशिक्षित किए बिना चलती हुई वस्तुओं का पूर्वानुमान लगाने की अनुमति देता है। यह केवल महत्वपूर्ण चीजों पर ध्यान केंद्रित करके, भविष्य का अनुमान लगाने के लिए सरल भौतिकी का उपयोग करके, और यह जानकर कि कब अनुमान लगाना बंद करना है और कार्य शुरू करना है, काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →