← नवीनतम पेपर
💻 computer science

CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking

यह शोध पत्र विविध दृश्य स्थितियों में क्रॉस-डोमेन रेफरिंग मल्टी-ऑब्जेक्ट ट्रैकिंग (CD-RMOT) के मूल्यांकन के लिए एक एकीकृत बेंचमार्क, CD-RMOT-Bench पेश करता है, और भाषा-निर्देशित ट्रैकिंग में डोमेन शिफ्ट के कारण होने वाली प्रदर्शन गिरावट को संबोधित करने के लिए एक क्वेरी-सेंट्रिक एडाप्टेशन (QCA) फ्रेमवर्क का प्रस्ताव करता है।

मूल लेखक: Xiangqun Zhang, Likai Wang, Zekun Qian, Ruize Han, Wei Feng

प्रकाशित 2026-07-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiangqun Zhang, Likai Wang, Zekun Qian, Ruize Han, Wei Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त शहर में परम टूर गाइड बनने के लिए प्रशिक्षित कर रहे हैं। आप नहीं चाहते कि वह केवल "एक कार" या "एक व्यक्ति" को ढूंढे; आप चाहते हैं कि वह उस विशिष्ट लाल कार को ढूंढे जो दूर जा रही है, या दोस्तों के उस समूह को ढूंढे जो साथ चल रहे हैं, जैसा कि आपके द्वारा दिए गए निर्देशों जैसे, "बाएं मुड़ती हुई नीली बस का पीछा करें" पर आधारित हो। यह रिफरिंग मल्टी-ऑब्जेक्ट ट्रैकिंग (RMOT) की दुनिया है। यह कहने का एक शानदार तरीका है: "वीडियो देखें, मेरे वाक्य को सुनें, और अपनी नज़रें ठीक उसी चीज़ पर टिकाए रखें जिसके बारे में मैं बात कर रहा हूँ।"

लंबे समय तक, वैज्ञानिक इन रोबोट गाइडों को आदर्श, धूप वाले हालातों में प्रशिक्षित करते रहे हैं। वे उन्हें सड़कों के स्पष्ट वीडियो दिखाते हैं और उन्हें निर्देशों का पालन करना सिखाते हैं। लेकिन यहाँ एक पेंच है: वास्तविक दुनिया अव्यवस्थित होती है। कभी मूसलाधार बारिश हो रही होती है, कभी धुंध छाई होती है, और कभी कैमरा एक अजीब कोण पर झुका होता है। बड़ा सवाल यह है कि, यदि आप अपने रोबोट गाइड को धूप वाले दिन प्रशिक्षित करते हैं, तो क्या वह भ्रमित हो जाएगा और लक्ष्य को खो देगा जब मौसम खराब हो जाता है या दृश्य बदल जाता है? यह शोध पत्र ठीक इसी समस्या की जांच करता है, यह पूछते हुए कि क्या हमारे भाषा-निर्देशित ट्रैकर्स बिना दोबारा से सिखाए दृश्य में अचानक आए बदलाव को संभाल सकते हैं।

इस शोध पत्र के पीछे के शोधकर्ताओं, जियांगक्वान झांग (Xiangquun Zhang) और उनकी टीम ने अनुमान लगाना बंद करने और परीक्षण करने का निर्णय लिया। उन्होंने महसूस किया कि जबकि हमारे पास आदर्श स्थितियों में ट्रैकिंग के लिए बेहतरीन उपकरण हैं, हमें वास्तव में यह नहीं पता कि ये उपकरण कितने प्रभावी ढंग से काम करते हैं जब दृश्य दुनिया नाटकीय रूप से बदल जाती है। इसे ठीक करने के लिए, उन्होंने एक नया खेल का मैदान बनाया जिसे CD-RMOT-Bench कहा गया। इस बेंचमार्क को एक विशाल, नियंत्रित सिमुलेशन लैब के रूप में समझें। उन्होंने निर्देशों के साथ वास्तविक दुनिया के वीडियो लिए और उनके "डिजिटल ट्विन्स" बनाए—उसी दृश्य की सटीक प्रतियां लेकिन मौसम बदलकर बारिश या धुंध कर दिया गया, या कैमरा एंगल को बाईं या दाईं ओर झुका दिया गया। उन्होंने इसमें खराब मौसम में लिए गए वास्तविक वीडियो भी मिलाए ताकि यह देखा जा सके कि रोबोटों ने एक साफ, डिजिटल दुनिया से एक अव्यवस्थित, वास्तविक दुनिया में जाने के दौरान कैसा प्रदर्शन किया।

उन्होंने जो पाया वह थोड़ा चौंकाने वाला था। भले ही रोबोट अभी भी वस्तुओं को देख सकते थे (जैसे बारिश में कार को पहचानना), लेकिन निर्देश दिए जाने पर वे पूरी तरह से भूल गए कि कौन सी कार का पीछा करना है। ऐसा नहीं था कि रोबोट कार को ढूंढ नहीं पा रहा था; समस्या यह थी कि एक बार बारिश शुरू होने के बाद, जब निर्देश दिए गए, तो रोबोट इस बात को लेकर भ्रमित हो गया कि कौन सी कार "दाहिनी ओर की लाल कार" के विवरण से मेल खाती है। अध्ययन से पता चलता है कि सबसे बड़ी विफलता वस्तु को पहचानने में नहीं है, बल्कि दृश्य स्थितियाँ बदलने पर बोले गए शब्दों और चलते हुए लक्ष्य के बीच संबंध बनाए रखने में है।

इसे ठीक करने में मदद करने के लिए, टीम ने एक नई विधि प्रस्तावित की जिसे QCA (क्वेरी-सेंट्रिक अडैप्टेशन) कहा जाता है। कल्पना कीजिए कि रोबोट के पास एक मानसिक "स्टिकी नोट" है जिस पर लिखा है "लाल कार का पीछा करें।" जब मौसम बदलता है, तो वह स्टिकी नोट फिसलने लगता है या धुंधला होने लगता है। QCA उस नोट को लगातार फिर से स्थापित करने वाली एक नई प्रणाली की तरह है, जो यह सुनिश्चित करती है कि रोबोट का आंतरिक ध्यान सही लक्ष्य पर चिपका रहे, भले ही बारिश सब कुछ अलग दिखा दे। उनके प्रयोगों ने दिखाया कि इस विधि ने रोबोटों को ट्रैक पर रहने में काफी मदद की, जिससे मौसम और दृश्य परिवर्तन के कारण होने वाले प्रदर्शन के नुकसान की काफी हद तक भरपाई हुई।

संक्षेप में, यह शोध पत्र सिद्ध करता है कि रोबोट को भाषा का निर्देश देना पर्याप्त नहीं है; रोबोट को इतना सक्षम होना चाहिए कि वह अपनी सोच की कड़ी टूटे बिना दुनिया में अचानक आए बदलाव को संभाल सके। उन्होंने इस कमजोरी को मापने के लिए एक नया परीक्षण बनाया और भविष्य के रोबोट गाइडों को अधिक विश्वसनीय बनाने के लिए एक मजबूत आधार प्रदान किया, चाहे वे धूप वाले शहर में चल रहे हों या धुंध भरे तूफान में नेविगेट कर रहे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →