← नवीनतम पेपर
💻 computer science

SciFlow: Semantic Cross Interference for Self-Supervised Optical Flow Domain Generalization

SciFlow एक नेटवर्क-अज्ञेय (network-agnostic), स्व-पर्यवेक्षित (self-supervised) प्रशिक्षण दृष्टिकोण है जो सिंथेटिक से वास्तविक दुनिया के वातावरण में ऑप्टिकल फ्लो डोमेन सामान्यीकरण को बढ़ाने के लिए ज्यामितीय निरंतरता (geometric consistency) के माध्यम से वैधता सुनिश्चित करते हुए, सिंथेटिक डेटा पर ओपन-वर्ल्ड छवियों से सिमेंटिक क्रॉस-इंटरफेरेंस (semantic cross-interference) आरोपित करता है।

मूल लेखक: Jamie Menjay Lin, Jisoo Jeong, Hong Cai, Kai Wang, Fatih Porikli

प्रकाशित 2026-06-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jamie Menjay Lin, Jisoo Jeong, Hong Cai, Kai Wang, Fatih Porikli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि वीडियो में चीजें कैसे चलती हैं। इस कौशल को "ऑप्टिकल फ्लो" (optical flow) कहा जाता है, जो बिल्कुल वैसा ही है जैसे आप रोबोट को हवा के चलने से पत्तों के हिलने या सड़क पर कार के चलने को देखना सिखा रहे हों।

समस्या यह है कि वास्तविक दुनिया में रोबोट को यह सिखाना अविश्वसनीय रूप से कठिन और महंगा है। आपको रोबोट को यह दिखाने के लिए लाखों वास्तविक वीडियो के हर एक पिक्सेल को लेबल करना होगा कि वास्तव में क्या और कहाँ चला। चूंकि यह असंभव है, इसलिए वैज्ञानिक आमतौर पर रोबोट को वीडियो गेम्स (सिंथेटिक दुनिया) में प्रशिक्षित करते हैं जहाँ कंप्यूटर को सटीक उत्तर पता होते हैं।

लेकिन यहाँ एक पेंच है: जो रोबोट केवल वीडियो गेम में प्रशिक्षित हुआ है, वह उस छात्र की तरह है जिसने केवल एक शांत पुस्तकालय में पढ़ाई की हो। जब आप उस छात्र को एक शोर-शराबे वाले, अराजक शहर (वास्तविक दुनिया) में ले जाते हैं, तो वे भ्रमित हो जाते हैं—अलग-अलग रोशनी, धुंधली गति और वास्तविक वस्तुओं के अजीब आकार उन्हें उलझा देते हैं। वे सामान्य रूप से काम करने में विफल रहते हैं।

समाधान: SciFlow

यह शोध पत्र एक नई विधि पेश करता है जिसे SciFlow कहा जाता है। इसे एक "प्रशिक्षण सिम्युलेटर" के रूप में समझें जो रोबोट को बुनियादी बातें सीखते समय ही एक अराजक वातावरण में अभ्यास करने के लिए मजबूर करता है।

SciFlow कैसे काम करता है, इसके लिए एक सरल उपमा का उपयोग करते हैं:

1. "शिक्षक" और "छात्र"
एक कक्षा की कल्पना करें जिसमें दो रोबोट हैं:

  • शिक्षक (The Teacher): यह रोबोट एक साफ, एकदम सही वीडियो गेम दृश्य को देखता है और कहता है, "यहाँ कार कैसे चली।" इसे उत्तर पता है क्योंकि इसे सटीक डेटा पर प्रशिक्षित किया गया है।
  • छात्र (The Student): यह वह रोबोट है जिसे हम प्रशिक्षित करने की कोशिश कर रहे हैं।

2. "सेमेंटिक क्रॉस इंटरफेरेंस" (जादुई ट्रिक)
आमतौर पर, छात्र भी शिक्षक की तरह ही उसी साफ वीडियो गेम दृश्य को देखेगा। लेकिन SciFlow कुछ चतुर करता है। यह वास्तविक दुनिया की एक तस्वीर लेता है (जैसे व्यस्त सड़क की एक धुंधली फोटो) और डिजिटल रूप से उसके कुछ हिस्सों को साफ वीडियो गेम दृश्य पर "चिपका" देता है।

  • उपमा: कल्पना कीजिए कि शिक्षक एक आदर्श ट्रैक पर एक सफेद कार का वर्णन कर रहा है। हालाँकि, छात्र उसी कार को देख रहा है, लेकिन किसी ने उस पर कीचड़ छिड़क दिया है, अजीब छाया डाल दी है और किनारों को धुंधला कर दिया है।
  • लक्षक: छात्र को कीचड़ और धुंधलेपन के बावजूद कार की गति का अनुमान लगाना होगा, और फिर शिक्षक के साफ उत्तर के साथ अपने उत्तर की जाँच करनी होगी।

3. यह क्यों काम करता है
छात्र को "इंटरफेरेंस" (कीचड़, धुंध, वास्तविक दुनिया की रोशनी) के साथ पहेली सुलझाने के लिए मजबूर करके, रोबोट उन बिखरे हुए विवरणों को अनदेखा करना और वास्तविक गति पर ध्यान केंद्रित करना सीख जाता है। यह एक ड्राइविंग टेस्ट के लिए तूफानी बारिश में अभ्यास करने जैसा है ताकि जब आप अंततः धूप में गाड़ी चलाएं, तो यह आसान लगे।

4. "नकल न करने" का नियम
सबसे अच्छी बात यह है कि रोबोट यह सीखता है बिना किसी इंसान के उसे वास्तविक दुनिया की तस्वीरों के लिए सही उत्तर बताए। वह बस अपने "अव्यवस्थित" अनुमान की तुलना अपने शिक्षक के "साफ" अनुमान से करता है। यदि वे मेल खाते हैं, तो रोबोट सीख जाता है। यदि नहीं, तो वह खुद को सुधारता है।

परिणाम

इस शोध पत्र ने दो प्रकार के रोबोटों पर परीक्षण किया: एक बड़ा, शक्तिशाली रोबोट और एक छोटा, हल्का रोबोट (जो फोन के लिए अच्छा है)।

  • SciFlow से पहले: रोबोट वीडियो गेम में बहुत अच्छे थे लेकिन वास्तविक दुनिया के वीडियो में संघर्ष करते थे, विशेष रूप से कम रोशनी में या जब चीजें तेजी से चल रही होती थीं।
  • SciFlow के बाद: रोबोट बहुत अधिक सक्षम हो गए। वे एक अव्यवस्थित, वास्तविक दुनिया के वीडियो (जैसे पार्क का एक हिलता हुआ फोन रिकॉर्डिंग) को देख सकते थे और अभी भी लोगों और वस्तुओं की गति को सटीक रूप से ट्रैक कर सकते थे, भले ही उन्होंने पहले कभी वह विशिष्ट वास्तविक दृश्य न देखा हो।

सारांश

SciFlow मोशन-ट्रैकिंग रोबोटों को वास्तविक दुनिया को संभालने के लिए सिखाने का एक सरल और स्मार्ट तरीका है। केवल एक आदर्श सिमुलेशन में अध्ययन करने के बजाय, यह उन्हें "वास्तविक दुनिया के शोर" के साथ अभ्यास करने के लिए मजबूर करता है, जिसमें एक शिक्षक-छात्र प्रणाली का उपयोग करके महंगे मानवीय लेबल की आवश्यकता नहीं होती। यह रोबोटों को अधिक मजबूत और लैब के बाहर की अस्त-व्यस्त, अप्रत्याशित दुनिया के लिए तैयार बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →