← नवीनतम पेपर
💻 computer science

Ada3Drift: Adaptive Training-Time Drifting for One-Step 3D Visuomotor Robotic Manipulation

Ada3Drift एक वन-स्टेप (one-step) 3D विज़ुओमोटर पॉलिसी है जो पुनरावृत्ति परिशोधन (iterative refinement) को प्रशिक्षण समय (training time) में स्थानांतरित करके मौजूदा सिंगल-स्टेप विधियों के मल्टीमॉडल कोलैप्स (multimodal collapse) और डिफ्यूजन मॉडल्स की लेटेंसी (latency) पर विजय प्राप्त करती है, जिससे 10×10\times कम फंक्शन इवैल्यूएशन (function evaluations) के साथ अत्याधुनिक रोबोटिक मैनिपुलेशन प्रदर्शन प्राप्त होता है।

मूल लेखक: Chongyang Xu, Yixian Zou, Ziliang Feng, Fanman Meng, Shuaicheng Liu

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chongyang Xu, Yixian Zou, Ziliang Feng, Fanman Meng, Shuaicheng Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को एक कप उठाकर उसे तश्तरी (saucer) पर रखने के लिए सिखा रहे हैं। यह सुनने में सरल लगता है, लेकिन एक रोबोट के लिए यह विकल्पों का एक दुस्वप्न (nightmare) है।

समस्या: "औसत" की गलती (The "Average" Mistake)

अतीत में, रोबोट इंसानों को देखकर सीखते थे। लेकिन इंसान पेचीदा होते हैं। कभी मेज के चारों ओर जाने के लिए, आप बाईं ओर हाथ बढ़ाते हैं। कभी-कभी आप दाईं ओर हाथ बढ़ाते हैं। दोनों ही सही हैं।

पुराने रोबोट सीखने के तरीके (जिन्हें "डिफ्यूजन मॉडल्स" कहा जाता है) एक धीमे, सावधान कलाकार की तरह थे। वे एक रास्ता स्केच करते, उसे मिटाते, फिर से बनाते और बार-बार सुधारते (10 से 100 बार) जब तक कि रोबोट को यह पता न चल जाए कि उसे बाईं ओर जाना है या दाईं ओर। यह बहुत अच्छा काम करता था, लेकिन यह बहुत धीमा था। जब तक रोबोट अपनी "सोच-विचार" की प्रक्रिया पूरी करता, तब तक कप गिर चुका होता।

नए तरीकों ने तेज़ होने की कोशिश की। उन्होंने कहा, "आइए बस एक कदम में उत्तर का अनुमान लगा लें!" लेकिन इसमें एक घातक दोष था: द एवरेज ट्रैप (The Average Trap - औसत का जाल)

यदि आप एक तेज़ रोबोट से "बाईं ओर पहुँचने" और "दाईं ओर पहुँचने" के बीच अनुमान लगाने को कहते हैं, तो वह अक्सर दोनों का औसत (average) निकाल लेता है।

  • परिणाम: रोबोट मेज के बीच में सीधा आगे की ओर बढ़ जाता है।
  • उपमा: कल्पना कीजिए कि एक ड्राइवर देखता है कि सड़क दो हिस्सों में बँटी है—एक बाईं लेन और एक दाईं लेन। एक धीमा, सावधान ड्राइवर एक को चुनता है। एक भ्रमित, तेज़ ड्राइवर बीच के डिवाइडर (median strip) पर गाड़ी चलाने की कोशिश करता है और दुर्घटनाग्रस्त हो जाता है। रोबोटिक्स में, यह "औसत" वाला मूव अक्सर रोबोट को वस्तु पकड़ने के बजाय किसी बाधा से टकरा देता है।

समाधान: Ada3Drift (द "ड्रिफ्टिंग" कोच)

इस पेपर के लेखकों ने एक शानदार तरकीब निकाली। उन्होंने महसूस किया कि जबकि रोबटों को कार्य के दौरान (inference) तेज़ होने की आवश्यकता होती है, उनके पास अभ्यास (training) करने के लिए पूरी दुनिया का समय होता है।

मुख्य विचार:
रोबोट को काम करते समय धीरे सोचने के बजाय, उन्होंने रोबोट को सीखते समय गहनता से "सोचना" सिखाया, ताकि जब वह वास्तव में काम करे, तो उसे केवल एक पल की नज़र डालने की आवश्यकता हो।

उन्होंने इसे कैसे किया, इसके लिए एक सरल उपमा यहाँ दी गई है:

1. "ड्रिफ्टिंग फील्ड" (चुंबकीय कोच)

कल्पना कीजिए कि रोबोट टोकरी में गेंद फेंकना सीख रहा है। वहाँ दो टोकरियाँ हैं: एक बाईं ओर और एक दाईं ओर।

  • पुराने तेज़ तरीके: रोबोट बस बीच का अनुमान लगा लेता है।
  • Ada3Drift: ट्रेनिंग के दौरान, लेखकों ने एक "चुंबकीय कोच" जोड़ा।
    • यदि रोबोट गेंद को बाईं टोकरी की ओर थोड़ा सा फेंकता है, तो कोच उसे धीरे से बाईं ओर खींचता है।
    • यदि रोबोट गेंद को दाईं टोकरी की ओर फेंकता है, तो कोच उसे बीच से दूर धकेलता है और दाईं ओर ले जाता है।
    • महत्वपूर्ण रूप से, कोच रोबोट को अन्य "नकली" थ्रो से भी दूर धकेलता है जो वास्तविक मानवीय चाल की तरह नहीं दिखते।

यह एक "ड्रिफ्टिंग फील्ड" बनाता है जो रोबोट को स्पष्ट और अलग रास्ते (बाएँ या दाएँ) सीखने के लिए मजबूर करता है, न कि एक धुंधले, खतरनाक बीच के रास्ते के लिए।

2. "सिगमॉइड शेड्यूल" (ट्रेनिंग कैंप)

आप एक नौसिखिए को पहले ही दिन जटिल अभ्यास नहीं सिखा सकते।

  • प्रारंभिक प्रशिक्षण: रोबोट भ्रमित है। "चुंबकीय कोच" बहुत मजबूत है और रोबोट को और अधिक भ्रमित कर सकता है। इसलिए, लेखक कोच को ब्रेक लेने के लिए कहते हैं। रोबोट बस बुनियादी बातें सीखता है: "हे, मुझे अपना हाथ हिलाना है।"
  • देर से प्रशिक्षण: एक बार जब रोबोट बुनियादी बातें जान जाता है, तो कोच जाग जाता है। अब, कोच उसके कौशल को तेज करना शुरू करता है, उसे "बाएँ" या "दाएँ" मोड की ओर मजबूती से धकेलता है और खतरनाक बीच के रास्ते से दूर रखता है।

यह एक स्पोर्ट्स कोच की तरह है जो एक नए खिलाड़ी को पहले महीने में सिर्फ दौड़ने के लिए कहता है, और केवल तभी जटिल खेल सिखाना शुरू करता है जब वह फिट हो जाता है।

3. "मल्टी-स्केल" दृश्य (ज़ूम इन और ज़ूम आउट)

कुछ रोबोट कार्य बहुत सूक्ष्म होते हैं (एक मिलीमीटर द्वारा उंगली हिलाना), जबकि अन्य बहुत बड़े होते हैं (पूरा हाथ हिलाना)।

  • Ada3Drift एक साथ तीन अलग-अलग "ज़ूम स्तरों" (तापमान/temperatures) का उपयोग करता है।
  • एक ज़ूम स्तर सूक्ष्म विवरणों (मिलीमीटर सटीकता) को देखता है।
  • दूसरा बड़ा चित्र (हाथ की स्थिति) देखता है।
  • यह सुनिश्चित करता है कि रोब \text{ट} पेड़ों के लिए जंगल को या जंगल के लिए पेड़ों को न भूल जाए।

परिणाम: तेज़, सुरक्षित और स्मार्ट

कार्य के दौरान सारी कठिन "सोच" को प्रशिक्षण चरण में स्थानांतरित करके, Ada3Drift दोनों दुनियाओं का सर्वश्रेष्ठ परिणाम देता है:

  1. गति: जब रोबोट वास्तव में काम कर रहा होता है, तो उसे क्या करना है यह तय करने के लिए वह केवल एक कदम लेता है। यह पुराने धीमे तरीकों की तुलना में 10 गुना तेज़ है।
  2. सुरक्षा: क्योंकि इसने अभ्यास के दौरान "बाएँ" और "दाएँ" के बीच अंतर करना सीखा, यह कभी भी खतरनाक "औसत" बीच में नहीं फंसता।
  3. वास्तविक दुनिया की सफलता: उन्होंने इसे वास्तविक रोबोटों पर परखा (केवल सिमुलेशन पर नहीं)। रोबोट ने 79% सफलता दर के साथ ब्लॉक को स्टैक किया, कप रखे और दराजें बंद कीं, जो सभी अन्य तेज़ तरीकों को पीछे छोड़ देता है।

सारांश

Ada3Drift को एक ऐसे रोबोट के रूप में समझें जिसने एक सख्त कोच के साथ विशिष्ट चालों का अभ्यास करने के लिए पूरी रात एक वर्चुअल जिम में बिताई है। जब तक वह वास्तविक फैक्ट्री फ्लोर पर कदम रखता है, उसे सोचने की आवश्यकता नहीं होती; वह तुरंत और पूरी तरह से प्रतिक्रिया करता है, यह जानते हुए कि उसे कौन सा रास्ता लेना है और बिना कभी बीच में टकराए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →