← नवीनतम पेपर
💻 computer science

μ0\mu_0: A Scalable 3D Interaction-Trace World Model

यह शोध पत्र μ0\mu_0 को प्रस्तुत करता है, जो एक स्केलेबल 3D वर्ल्ड मॉडल है जो घने पिक्सेल या विशिष्ट कार्यों के बजाय इंटरेक्शन पॉइंट्स के सुचारू प्रक्षेपवक्र (trajectories) की भविष्यवाणी करता है, जिससे एक नवीन "TraceExtract" सिस्टम के माध्यम से एम्बोडिमेंट-अज्ञेय (embodiment-agnostic) रोबोट लर्निंग सक्षम होती है जो विविध वीडियो स्रोतों से स्वचालित रूप से 3D सुपरविजन उत्पन्न करता है।

मूल लेखक: Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang, Furong Huang

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang, Furong Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना, सफाई करना या चीजें बनाना सिखाना चाहते हैं। आमतौर पर, आपके पास दो बुरे विकल्प होते हैं:

  1. "पिक्सेल" विधि (The "Pixel" Method): आप रोबोट को हजारों वीडियो दिखाते हैं और उससे पूछते हैं कि स्क्रीन का हर एक पिक्सेल अगली बार कैसा दिखेगा। यह एक छात्र को दरवाजा खोलने के लिए केवल इसलिए याद करने के लिए कहने जैसा है कि दीवार की हर ईंट का रंग क्या है। यह उन बैकग्राउंड विवरणों (जैसे फर्श का रंग) पर बहुत अधिक मानसिक शक्ति बर्बाद करता है जो रोबट को हिलने-डुलने में वास्तव में मदद नहीं करते।

  2. "एक्शन" विधि (The "Action" Method): आप एक इंसान को कोई काम करते हुए रिकॉर्ड करते हैं और रोबोट को बताते हैं, "अपना बायां हाथ 3 इंच आगे बढ़ाएं, फिर दबाएं।" समस्या यह है कि यह केवल उस विशिष्ट रोबोटिक हाथ के लिए काम करता है। यदि आप उस रोबोट को किसी दूसरे आकार के रोबोट से बदल देते हैं, तो निर्देश बेकार हो जाते हैं। आपको सब कुछ फिर से रिकॉर्ड करना होगा।

मिलिए µ0 (उच्चारण "म्यू-ज़ीरो") से: रोबोट को सिखाने का एक नया तरीका जो ठीक बीच में स्थित है। पिक्सेल देखने या विशिष्ट हाथ की गतिविधियों को याद करने के बजाय, µ0 3D "इंटरैक्शन ट्रेसेस" (interaction traces) की भविष्यवाणी करना सीखता है।

मुख्य विचार: "घोस्ट पाथ" (The "Ghost Path")

एक रोबोट के कप उठाने की कोशिश करने के बारे में सोचें। पूरे कप या पूरे कमरे के बारे में सोचने के बजाय, µ0 उन विशिष्ट "घोस्ट पॉइंट्स" (ghost points) पर ध्यान केंद्रित करता है जो महत्वपूर्ण हैं:

  • ग्रिपर (पकड़ने वाला हिस्सा) की नोक।
  • कप का हैंडल।
  • वह स्थान जहाँ हाथ मेज को छूता है।

µ0 इन विशिष्ट बिंदुओं के भविष्य के सुचारू 3D पथ की भविष्यवाणी करता है। यह हवा में एक चमकती हुई, अदृश्य रेखा खींचने जैसा है जो दिखाती है कि कप को वास्तव में कहाँ जाना चाहिए। यह पथ एम्बॉडिमेंट-अग्नोस्टिक (embodiment-agnostic) है, जिसका अर्थ है कि इसे इससे फर्क नहीं पड़ता कि रोबोट एक विशाल औद्योगिक हाथ है, एक छोटा पहियों वाला बॉट है, या एक मानव हाथ है। यदि "घोस्ट पाथ" कहता है "कप को यहाँ ले जाओ," तो कोई भी रोबोट उस रेखा का अनुसरण करने के लिए अपने अद्वितीय शरीर को कैसे चलाना है, यह समझ सकता है।

उन्होंने इसे कैसे सिखाया: "ट्रेसएक्सट्रैक्ट" फैक्ट्री (The "TraceExtract" Factory)

µ0 को सिखाने के लिए, शोधकर्ताओं ने TraceExtract नामक एक डेटा इंजन बनाया। एक मूवी एडिटर की कल्पना करें जो हजारों अस्त-व्यस्त वीडियो (इंसानों, रोबोटों और विभिन्न कैमरों से) को देखता है और स्वचालित रूप से तीन चीजें करता है:

  1. सितारों को चुनना: यह बैकग्राउंड को अनदेखा करता है और AI विजन का उपयोग करके शो के "सितारों" (कप, टूल, हाथ) को ढूंढता है।
  2. रेखाएं खींचना: यह उन बिंदुओं को 3D स्पेस में उठाता है, जिससे एक सुसंगत 3D पथ बनता है, भले ही कैमरा हिल रहा हो या चल रहा हो।
  3. स्क्रिप्ट लिखना: यह वीडियो को छोटे "इवेंट्स" (जैसे "कप को पकड़ना" या "पानी डालना") में तोड़ता है और प्रत्येक गतिविधि के लिए एक संक्षिप्त कैप्शन लिखता है।

यह अस्त-व्यस्त, बिना लेबल वाले वीडियो को एक साफ टेक्स्टबुक में बदल देता है: "यहाँ एक बिंदु है, और यहाँ वह 3D पथ है जिसे इस लक्ष्य को प्राप्त करने के लिए अपनाना चाहिए।"

दो-चरणीय सीखने की प्रक्रिया

µ0 दो चरणों में काम करता है, जैसे एक मास्टर आर्किटेक्ट और एक निर्माण दल:

  1. आर्किटेक्ट (µ0): पहले, µ0 को केवल वीडियो पर प्रशिक्षित किया जाता है। यह एक "वर्ल्ड मॉडल" (World Model) बनना सीखता है। यह एक तस्वीर और एक वाक्य (जैसे, "नारंगी कप उठाओ") को देखता है और मुख्य बिंदुओं के भविष्य के 3D पथ की भविष्यवाणी करता है। यह कभी रोबोट के मोटर कमांड नहीं देखता; यह केवल इस भौतिकी (physics) को सीखता है कि चीजों को कहाँ जाना चाहिए। एक बार प्रशिक्षित होने के बाद, यह हिस्सा "फ्रोजन" (frozen) हो जाता है—यह एक पुन: प्रयोज्य विशेषज्ञ है जो कभी नहीं बदलता।
  2. निर्माण दल (Action Expert): जब आप किसी विशिष्ट रोबोट का उपयोग करना चाहते हैं, तो आप फ्रोजन µ0 को लेते हैं और उसके साथ एक छोटा, नया "एक्शन एक्सपर्ट" जोड़ते हैं। यह नया हिस्सा µ0 द्वारा अनुमानित 3D पथों को देखता है और यह पता लगाता है, "ठीक है, मेरे विशिष्ट हाथ के आकार को देखते हुए, मुझे उस पथ का पालन करने के लिए किन मोटर कमांड्स की आवश्यकता है?"

यह एक बड़ी बात क्यों है

पेपर का दावा है कि µ0 एक गेम-चेंजर है क्योंकि:

  • यह स्केलेबल है: आप इसे इंटरनेट पर मौजूद किसी भी वीडियो पर प्रशिक्षित कर सकते हैं, न कि केवल महंगे रोबोट रिकॉर्डिंग पर।
  • यह कुशल है: यह उबाऊ बैकग्राउंड को अनदेखा करता है और केवल उन चलते हुए हिस्सों पर ध्यान केंद्रित करता है जो महत्वपूर्ण हैं।
  • यह बेहतर काम करता है: परीक्षणों में, µ0 के "घोस्ट पाथ" का उपयोग करने वाले रोबोटों ने विशिष्ट रोबोट-एक्शन डेटा के विशाल मात्रा के साथ प्रशिक्षित रोबोटों के समान (और कभी-कभी बेहतर) प्रदर्शन किया।
  • यह पुन: प्रयोज्य है: आप µ0 को एक बार प्रशिक्षित कर सकते हैं, और फिर इसे किसी भी नए रोबोट में बिना पूरे सिस्टम को फिर से प्रशिक्षित किए प्लग कर सकते हैं जिसे आप बनाते हैं।

संक्षेप में, µ0 रोबोट को गति की अवधारणा (3D पथ) सिखाता है, न कि गति की यांत्रिकी (विशिष्ट मांसपेशी कमांड), जिससे वे ऑनलाइन उपलब्ध मानव वीडियो के विशाल पुस्तकालय से सीख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →