← नवीनतम पेपर
💻 computer science

Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

यह शोध पत्र E3Flow को प्रस्तुत करता है, जो एक नवीन हाइब्रिड SE(3)-इक्विवैरिएंट विज़ुओमोटर पॉलिसी है, जो कुशल रेक्टिफाइड फ्लो को मल्टी-मोडल लर्निंग के साथ एकीकृत करने के लिए स्फेरिकल हार्मोनिक्स और एक फीचर एन्हांसमेंट मॉड्यूल का लाभ उठाता है, जिससे रोबोट मैनिपुलेशन कार्यों में बेहतर सफलता दर और अत्याधुनिक डिफ्यूजन विधियों की तुलना में 7 गुना तेज़ इन्फरेंस स्पीड प्राप्त होती है।

मूल लेखक: Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कॉफी का मग उठाने और उसे कप में डालने के लिए सिखा रहे हैं। यदि आप रोबोट को यह एक बार करके दिखाते हैं, तो वह सीख सकता है। लेकिन क्या होगा अगर आप मेज को घुमा दें, मग को किसी दूसरी जगह रख दें, या दृश्य को थोड़ा तिरछा कर दें? एक सामान्य रोबोट का दिमाग भ्रमित हो सकता है और मग गिरा सकता है, यह सोचते हुए, "मैंने इस तरह का मग पहले कभी नहीं देखा!"

यही वह समस्या है जिसे E3Flow हल करता है। यह रोबोट के लिए एक नया "दिमाग" है जो उन्हें कार्यों को सीखने में अविश्वसनीय रूप से स्मार्ट, तेज़ और कुशल बनाता है, भले ही उनके आस-पास की दुनिया बदल जाए।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: एक "कठोर" (Rigid) रोबोट का दिमाग

अधिकांश वर्तमान रोबोट सीखने के तरीके एक ऐसे छात्र की तरह हैं जो शहर के मानचित्र को रट लेता है लेकिन यदि सड़क के संकेत घूम जाएं, तो वह रास्ता भटक जाता है। वे सीखने के लिए भारी मात्रा में डेटा (हजारों उदाहरणों) पर निर्भर रहते हैं, और सोचने में धीमे होते हैं। यदि रोबोट किसी खिलौने को एक नई स्थिति में देखता है, तो वह अक्सर विफल हो जाता है क्योंकि उसने वह सटीक कोण पहले नहीं देखा होता।

2. समाधान: "आकार बदलने वाली" सुपरपावर (Equivariance)

लेखकों ने E3Flow को Equivariance नामक एक विशेष सुपरपावर के साथ बनाया है।

  • उपमा: कल्पना कीजिए कि आपके पास एक घूमता हुआ ग्लोब है। यदि आप ग्लोब को घुमाते हैं, तो महाद्वीप हिल जाते हैं, लेकिन उनके बीच का संबंध वही रहता है। उत्तर अभी भी भूमध्य रेखा के उत्तर में ही रहता है।
  • यह कैसे मदद करता है: E3Flow इस नियम को समझता है। यदि आप रोबोट को दिखाते हैं कि कप को सीधा पकड़ना कैसे है, और फिर आप कप को घुमा देते हैं, तो रोबोट को कार्य को फिर से सीखने की आवश्यकता नहीं होती है। यह बस नए कोण के साथ अपने स्वयं के प्लान को "रोटेट" (घुमा) देता है। यह जानता है कि "पकड़ना" एक ही क्रिया है, बस एक अलग दिशा में। इसका मतलब है कि इसे सीखने के लिए बहुत कम डेटा की आवश्यकता है क्योंकि यह नए कोणों को खुद ही समझ सकता है।

3. गुप्त सूत्र: स्फेरिकल हार्मोनिक्स (The "3D Compass")

इस रोटेशन जादू को काम करने देने के लिए, E3Flow Spherical Harmonics का उपयोग करता है।

  • उपमा: E3Flow के मानक रोबोट विजन सिस्टम को एक सपाट तस्वीर की तरह समझें। यदि आप फोटो को तिरछा करते हैं, तो छवि केवल तिरछी हो जाती है। लेकिन E3Flow दुनिया को एक 3D कंपास या ग्लोब की तरह देखता है। यह 3D दुनिया को गणितीय "परतों" (जैसे पेड़ के छल्ले या ग्लोब की अक्षांश रेखाओं) में तोड़ देता है।
  • यह क्यों शानदार है: क्योंकि यह दुनिया को इन 3D परतों में देखता है, यह गणितीय रूप से गारंटी दे सकता है कि यदि दुनिया घूमती है, तो रोबोट की समझ भी उसके साथ पूरी तरह से घूम जाएगी। कोई अनुमान नहीं, कोई भ्रम नहीं।

4. आँखें: पॉइंट क्लाउड्स और फोटो का मिश्रण (The "Hybrid Vision")

रोबोट आमतौर पर दुनिया को एक तरीके से देखते हैं: या तो 3D डॉट्स के बादल के रूप में (जैसे लेजर स्कैन) या एक सपाट 2D चित्र के रूप में (जैसे कैमरा)।

  • दोष: 3D डॉट्स आकार के लिए अच्छे हैं लेकिन रंग या बनावट देखने में खराब हैं। 2D चित्र विवरणों के लिए अच्छे हैं लेकिन गहराई समझने में खराब हैं।
  • समाधान: E3Flow एक फीचर एन्हांसमेंट मॉड्यूल (FEM) का उपयोग करता है।
    • उपमा: कल्पना कीजिए कि एक जासूस अपराध स्थल को देख रहा है। एक साथी के पास 3D लेजर स्कैनर है (जो फर्नीचर का आकार देख रहा है), और दूसरे के पास हाई-रेज़ोल्यूशन कैमरा है (जो कालीन पर लाल धब्बा देख रहा है)। E3Flow वह जासूस है जो दोनों की रिपोर्ट को तुरंत संयोजित करता है। यह 3D आकार लेता है और कैमरे से विस्तृत रंग और बनावट की जानकारी को 3D मॉडल में "इंजेक्ट" करता है। यह रोबोट को दृश्य की एक सुपर-क्लियर, विस्तृत समझ देता है।

5. गति: "एक्सप्रेस लेन" (Rectified Flow)

पुराने AI रोबोट जो "डिफ्यूजन" (एक लोकप्रिय विधि) का उपयोग करते हैं, वे एक ऐसे चित्रकार की तरह हैं जो एक बार में एक छोटा सा ब्रशस्ट्रोक जोड़ता है। चित्र पूरा करने के लिए, उन्हें 100 चरणों की आवश्यकता हो सकती है। यह धीमा है।

  • समाधान: E3Flow Rectified Flow का उपयोग करता है।
    • उपमा: "भ्रमित" अवस्था से "क्रिया" तक पहुँचने के लिए 100 छोटे, घुमावदार कदम उठाने के बजाय, E3Flow एक सीधी रेखा खींचता है। यह वर्तमान स्थिति से सही क्रिया तक का सबसे सीधा रास्ता सीखता है।
    • परिणाम: यह पिछले सर्वोत्तम तरीकों की तुलना में 7 गुना तेज़ है। यह लगभग तुरंत निर्णय ले सकता है, जिससे यह वास्तविक समय के उपयोग के लिए व्यावहारिक बन जाता है।

निष्कर्ष: यह क्यों मायने रखता है

शोधकर्ताओं ने 8 अलग-अलग रोबोट कार्यों (जैसे ब्लॉक स्टैकिंग, सफाई करना और नट असेंबल करना) पर E3Flow का परीक्षण किया।

  • सफलता: यह पिछले सर्वोत्तम तरीकों की तुलना में अधिक सटीक था (लगभग 3% बेहतर)।
  • गति: यह 7 गुना तेज़ था।
  • डेटा: इसने आधे डेटा के साथ भी उतना ही अच्छा सीखा।

संक्षेप में: E3Flow एक रोबोट को 3D कंपास, एक हाइब्रिड सुपर-आई, और उसके निर्णयों के लिए एक सीधी रेखा वाले हाईवे को देने जैसा है। यह रोबोट को नए कार्यों को तेज़ी से सीखने, कमरे में बदलावों के अनुकूल होने और बिना भ्रमित हुए वास्तविक दुनिया में उपयोगी होने के लिए पर्याप्त तेज़ कार्य करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →