← नवीनतम पेपर
🤖 AI

Sim2real Image Translation Enables Viewpoint-Robust Policies from Fixed-Camera Datasets

यह शोध पत्र MANGO को प्रस्तुत करता है, जो एक नवीन अनपेयर्ड इमेज ट्रांसलेशन (unpaired image translation) विधि है जो सेगमेंटेशन-कंडीशन्ड (segmentation-conditioned) InfoNCE लॉस और विशिष्ट डिस्क्रिमिनेटर डिज़ाइन का लाभ उठाता है ताकि फिक्स्ड-कैमरा वास्तविक दुनिया के डेटासेट और स्केलेबल सिमुलेशन से विविध, व्यूपॉइंट-रोबस्ट (viewpoint-robust) प्रशिक्षण डेटा उत्पन्न किया जा सके, जो कैमरा व्यूपॉइंट शिफ्ट के तहत रोबोट मैनिपुलेशन पॉलिसियों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Jeremiah Coholich, Justin Wit, Robert Azarcon, Zsolt Kira

प्रकाशित 2026-02-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jeremiah Coholich, Justin Wit, Robert Azarcon, Zsolt Kira

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सोडा कैन उठाने के लिए सिखा रहे हैं। आप रोबोट को एक इंसान द्वारा कैन उठाने का वीडियो दिखाते हैं, लेकिन एक पेच है: कैमरा हमेशा एक ही जगह पर स्थिर है।

अब, कल्पना कीजिए कि आप उस रोबोट का उपयोग एक असली रसोई में करने की कोशिश करते हैं, लेकिन अब कैमरा छत के बजाय काउंटर पर है, या शायद रोबोट की कलाई पर है। अचानक, रोबोट भ्रमित हो जाता है। उसे नहीं पता कि कैन कहाँ है क्योंकि "तस्वीर" पूरी तरह से अलग दिखती है। यह वैसा ही है जैसे आपने केवल ऊपर से सीधे देखे जाने वाले नक्शे को देखकर कार चलाना सीखा हो; यदि आप कार में बैठते हैं और विंडशील्ड से बाहर देखते हैं, तो आपको समझ नहीं आएगा कि स्टीयरिंग कैसे घुमाना है।

यही वह समस्या है जिसे MANGO हल करता है।

समस्या: "एक-दृष्टिकोण" (One-View) का जाल

ज्यादातर रोबोट ट्रेनिंग डेटा उबाऊ होता है। इसे एक निश्चित कैमरा एंगल से लिया जाता है क्योंकि इसे सेट करना आसान है। लेकिन रोबोट को लचीला होना चाहिए। यदि वे केवल एक एंगल से सीखते हैं, तो एंगल बदलते ही वे विफल हो जाते हैं।

इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर सिमुलेशन (रोबोट के लिए वीडियो गेम) की ओर मुड़ते हैं। एक सिमुलेशन में, आप आसानी से 1,000 अलग-अलग एंगल्स से तस्वीरें ले सकते हैं। लेकिन एक पेच है: सिमुलेशन नकली लगते हैं। वे कार्टून की तरह दिखते हैं, जबकि असली दुनिया एक फोटोग्राफ की तरह दिखती है। यदि आप रोबोट को "कार्टून" वाले डेटा पर प्रशिक्षित करते हैं, तो वह वास्तविक दुनिया में विफल हो जाता है। इसे Sim2Real Gap कहा जाता है।

समाधान: MANGO (द "स्टाइल ट्रांसलेटर")

लेखकों ने MANGO नामक एक टूल बनाया है। MANGO को एक सुपर-स्मार्ट फोटो एडिटर या एक डिजिटल ट्रांसलेटर के रूप में सोचें।

  1. इनपुट: MANGO सिमुलेशन से एक "कार्टून" तस्वीर लेता है (जिसमें कई शानदार, अजीब कैमरा एंगल्स होते हैं)।
  2. ट्रेनिंग: यह केवल एक निश्चित एंगल से ली गई असली तस्वीरों के एक छोटे, उबाऊ ढेर को देखता है।
  3. जादू: MANGO असली दुनिया की "शैली" (लाइटिंग, मेज की बनावट, सोडा कैन का रूप) को सीखता है और इसे कार्टून तस्वीरों पर लागू करता है।

परिणाम: MANGO एक अजीब नए एंगल से ली गई सिमुलेशन फोटो को ले सकता है और उसे उसी अजीब नए एंगल से ली गई एक असली फोटो जैसा बना सकता है।

यह कैसे काम करता है? (सीक्रेट सॉस)

आमतौर पर, जब आप किसी फोटो की स्टाइल बदलने की कोशिश करते हैं, तो AI भ्रमित हो जाता है और वस्तुओं का आकार भी बदल देता है। कैमरा हिलने पर वह सोडा कैन को सोडा बोतल में बदल सकता है। MANGO तीन चतुर तरीकों से इससे बचता है:

  • "सेगमेंटेशन मैप" (आउटलाइन): MANGO एक विशेष मैप का उपयोग करता है जो वस्तुओं को रेखांकित करता है (जैसे कि एक कलरिंग बुक की आउटलाइन)। यह AI को मजबूर करता है कि वह लाइटिंग और टेक्सचर बदलते समय भी वस्तुओं को बिल्कुल उसी आकार में रखे। यह एक कलाकार को यह बताने जैसा है, "आप पेंट का रंग बदल सकते हैं, लेकिन रेखाओं को न हिलाएं।"
  • "पैच" ट्रिक: पूरी तस्वीर का एक साथ निर्णय लेने के बजाय, AI छवि के छोटे-छोटे चौकोर टुकड़ों (पैचेस) को देखता है। यह सीखता है कि "लकड़ी की मेज" का एक पैच असली लकड़ी की मेज जैसा दिखना चाहिए, भले ही वह किसी अजीब जगह पर हो।
  • "नो-फॉल्स-अलार्म" नियम: AI को इस बात के लिए प्रशिक्षित किया जाता है कि क्या चीज़ "मैच" होती है, इस बारे में बहुत सख्त रहे। यह रोबोट को दोहराव वाले पैटर्न (जैसे कि चेक वाली मेजपोश) से भ्रमित होने से रोकता है जो हर जगह एक जैसे दिखते हैं।

यह बड़ी बात क्यों है?

यह पेपर अन्य तरीकों की तुलना में MANGO की तुलना करता है, जिसमें विशाल, सुपर-कॉम्प्लेक्स AI मॉडल (जैसे डिफ्यूजन मॉडल) भी शामिल हैं।

  • भारी भरकम मॉडल: अन्य तरीके एक बुलडोजर से पहाड़ हटाने की कोशिश करने जैसे हैं। उन्हें भारी मात्रा में कंप्यूटर पावर (GPU घंटे) की आवश्यकता होती है और उन्हें चलने में बहुत समय लगता है।
  • MANGO: MANGO एक छिपकर वार करने वाले निंजा की तरह है। यह छोटा, तेज़ और अविश्वसनीय रूप से कुशल है। यह भारी प्रतिस्पर्धियों की तुलना में 2,700 गुना तेज़ काम करता है।

वास्तविक दुनिया का परीक्षण

शोधकर्ताओं ने इस पर वास्तविक रोबोटों के साथ परीक्षण किया जो कप को स्टैक करने, लैपटॉप बंद करने और सोडा उठाने जैसे कार्य कर रहे थे।

  • MANGO के बिना: यदि वे रोबोट को फिक्स्ड-कैमरा डेटा पर प्रशिक्षित करते और फिर कैमरा बदलते, तो रोबोट लगभग 100% बार विफल हो जाता।
  • MANGO के साथ: उन्होंने अलग-अलग एंगल्स से हजारों "नकली" ट्रेनिंग फोटो बनाने के लिए MANGO का उपयोग किया। जब उन्होंने इन पर रोबोट को प्रशिक्षित किया, तो नए कैमरा एंगल्स पर रोबोट की सफलता दर 40% से अधिक बढ़ गई

निचोड़

MANGO एक चतुर, हल्का टूल है जो रोबोट को लचीला बनाना सिखाता है। यह सिमुलेशन से आसान, नकली डेटा लेता है, उसे असली जैसा बनाता है, और रोबोट को दुनिया को किसी भी एंगल से समझना सिखाता है, न कि केवल उस एक एंगल से जिस पर उसे प्रशिक्षित किया गया था। यह एक ऐसे रोबोट के बीच का अंतर है जो केवल एक सीधे, खाली रास्ते पर चल सकता है और एक ऐसे रोबोट के बीच का अंतर है जो व्यस्त, घुमावदार शहर की सड़कों पर नेविगेट कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →