← नवीनतम पेपर
🤖 machine learning

Task Robustness via Re-Labelling Vision-Action Robot Data

यह शोध पत्र TREAD को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो मौजूदा रोबोटिक्स डेटासेट को विविध सेमेंटिक सब-टास्क और भाषाई रूप से भिन्न निर्देशों के साथ पुनः लेबल करने और संवर्धित करने के लिए प्री-ट्रेन्ड विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे बिना अतिरिक्त डेटा संग्रह के, नवीन कार्यों पर रोबोट नीतियों के प्लानिंग और लैंग्वेज-कंडीशन्ड जनरलाइजेशन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Artur Kuramshin, Özgür Aslan, Cyrus Neary, Glen Berseth

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Artur Kuramshin, Özgür Aslan, Cyrus Neary, Glen Berseth

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि "एक सैंडविच बनाओ और फिर मेज साफ करो।" आप रोबोट को एक इंसान द्वारा यह करते हुए एक वीडियो दिखाते हैं। रोबोट पूरा वीडियो देखता है और उसकी नकल करने की कोशिश करता है।

समस्या यह है, जैसा कि इस पेपर के अनुसार, कि रोबोट वर्तमान में हमारे द्वारा दिए गए शब्दों को समझने में बहुत खराब हैं। यदि आप कहते हैं "सैंडविच उठाओ (Grab the sandwich)," तो रोबोट रुक सकता है यदि आपने पहले "सैंडविच पकड़ो (Pick up the sandwich)" कहा था। यह एक ऐसे छात्र की तरह है जिसने परीक्षा के सटीक उत्तर रट लिए हैं लेकिन यदि शिक्षक प्रश्नों की शब्दावली बदल दे, तो वह असफल हो जाता है।

हमारे पास जो वीडियो हैं वे अक्सर बहुत लंबे और अव्यवजित होते हैं। रोबोट "सैंडविच बनाने" का एक लंबा वीडियो देखता है लेकिन वह व्यक्तिगत चरणों को स्पष्ट रूप से नहीं समझ पाता: 1. ब्रेड लें, 2. चीज़ लें, 3. ब्रेड पर चीज़ रखें। वह केवल गति का एक धुंधला सा दृश्य देखता है।

पेश है TREAD (टास्क रोबस्टनेस वाया री-लेबलिंग विज़न-एक्शन रोबोट डेटा)।

TREAD को एक सुपर-स्मार्ट, AI-संचालित मूवी एडिटर और स्क्रिप्ट राइटर के रूप में सोचें जो हमें नए वीडियो फिल्माए बिना रोबोट को बेहतर तरीके से सिखाने में मदद करता है। यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

तीन-चरणों वाला जादू (The Three-Step Magic Trick)

1. "दृश्य का विवरण" (सेगमेंटेशन - Segmentation)
कल्पना कीजिए कि आपके पास लेगो कैसल (Lego castle) बनाने वाले किसी व्यक्ति की 10 मिनट की फिल्म है। यह रोबोट के सीखने के लिए एक साथ बहुत लंबी है।
TREAD एक विशाल AI मस्तिष्क (जिसे विज़न-लैंग्वेज मॉडल कहा जाता है) का उपयोग करता है जो उस फिल्म को देखता है और कहता है, "ठीक है, आइए इसे छोटे दृश्यों में काटते हैं।"

  • कट 1: "लाल ब्लॉक उठाओ।"
  • कट 2: "लाल ब्लॉक को नीले आधार पर रखें।"
  • कट 3: "टावर का हिस्सा उठाएं।"
    AI स्वचालित रूप से लंबे वीडियो को छोटे, अर्थपूर्ण टुकड़ों में काट देता है, जिनमें से प्रत्येक के अपने विशिष्ट निर्देश होते हैं।

2. "स्क्रिप्ट का पुनर्लेखन" (री-लेबलिंग - Re-labelling)
अब, कल्पना कीजिए कि रोबोट केवल "लाल ब्लॉक उठाओ" वाक्यांश जानता है। यदि आप उसे "लाल ईंट पकड़ो (Grab the red brick)" कहते हैं, तो वह भ्रमित हो जाता है।
TREAD एक रचनात्मक लेखक की तरह कार्य करता है। यह लाल ब्लॉक उठाने के उस छोटे से वीडियो क्लिप को देखता है और उसी चीज़ को कहने के कई अलग-अलग तरीके लिखता है, जबकि वह वास्तव में जो देख रहा है उसका वर्णन भी करता है।

  • मूल: "लाल ब्लॉक उठाओ (Pick up the red block)।"
  • नया संस्करण A: "छोटा लाल ईंट पकड़ो (Grab the small red brick)।"
  • नया संस्करण B: "नीले वाले के बगल में रखी लाल ब्लॉक को लो (Take the red block next to the blue one)।"
  • नया संस्करण C: "लाल वस्तु को पकड़ो (Hold the red object)।"
    ऐसा करके, रोबोट सीखता है कि "पकड़ना (grab)," "उठाना (pick up)," और "लेना (take)" सभी एक ही चीज़ का अर्थ हैं, और "लाल ब्लॉक" और "लाल ईंट" एक ही वस्तु हैं।

3. "अभ्यास सत्र" (ट्रेनिंग - Training)
अंत में, रोबोट को इस नए, समृद्ध डेटा लाइब्रेरी पर प्रशिक्षित किया जाता है। 100 लंबे, उबाऊ वीडियो देखने के बजाय, वह सैकड़ों अलग-अलग तरीकों से वर्णित हजारों छोटे, स्पष्ट क्लिप देखता है।

जब उन्होंने इसे आज़माया तो क्या हुआ?

शोधकर्ताओं ने इसका परीक्षण Octo और π0-FAST नामक रोबोट लर्निंग सिस्टम पर किया। उन्होंने LIBERO (रोबोट के लिए एक वर्चुअल किचन और लिविंग रूम) नामक एक मानक टेस्ट सुइट का उपयोग किया।

  • परिणाम: TREAD की मदद से प्रशिक्षित रोबोट उन निर्देशों का पालन करने में बहुत बेहतर थे जिन्हें उन्होंने पहले कभी नहीं देखा था।
  • "मोशन" की जीत: जब रोबोट को एक नए कमरे (एक नए वातावरण) में रखा गया लेकिन उसे एक परिचित कार्य करने के लिए कहा गया, तो वह बहुत अधिक बार सफल रहा। यह एक ऐसे छात्र की तरह था जिसने केवल एक विशिष्ट दराज के हैंडल को रटने के बजाय "दराज खोलने" की अवधारणा सीखी थी।
  • "लैंग्वेज" की जीत: जब शोधकर्ताओं ने उनसे चीजें करने के तरीके को बदला (जैसे, "कप को मेज पर रखें (place the cup on the table)" के बजाय "कप को मेज पर रखें (put the cup on the table)" कहना), तो TREAD-प्रशिक्षित रोबोट तुरंत समझ गए। पुराने रोबोट अक्सर अटक जाते थे।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर दावा करता है कि आपको रोबोट को स्मार्ट बनाने के लिए महीनों तक नए वीडियो फिल्माने की आवश्यकता नहीं है। इसके बजाय, आप जो वीडियो आपके पास पहले से हैं, उन्हें ले सकते हैं, एक शक्तिशाली AI का उपयोग करके उन्हें छोटे चरणों में काट सकते हैं, और निर्देशों को कई अलग-अलग तरीकों से फिर से लिख सकते हैं।

यह रोबोट को अधिक रोबस्ट (Robust) बनाता है—जिसका अर्थ है कि वह बिना घबराए नए कमरों और बोलने के नए तरीकों को संभाल सकता है। यह रोबोट को केवल एक एकल, कठोर स्क्रिप्ट देने के बजाय एक शब्दकोश और एक मानचित्र देने जैसा है।

सीमाओं पर नोट: लेखक स्वीकार करते हैं कि उनकी विधि एक विशिष्ट, शक्तिशाली AI (Gemini) पर निर्भर करती है जो ओपन-सोर्स नहीं है, जिससे दूसरों के लिए इसे ठीक से कॉपी करना थोड़ा कठिन हो जाता है। हालाँकि, मुख्य विचार—कि कार्यों को तोड़ने और भाषा को विविध बनाने से रोबोट बेहतर सीखते हैं—मुख्य संदेश है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →