← नवीनतम पेपर
💻 computer science

QTrack: Query-Driven Reasoning for Multi-modal MOT

यह शोध पत्र QTrack को प्रस्तुत करता है, जो एक क्वेरी-संचालित मल्टी-मोडल ट्रैकिंग फ्रेमवर्क है जो ऑब्जेक्ट ट्रैकिंग को प्राकृतिक भाषा द्वारा निर्देशित एक स्पैटियोटेम्पोरल रीजनिंग कार्य के रूप में तैयार करता है, जिसे एक नए बड़े पैमाने के बेंचमार्क (RMOT26) और एक टेम्पोरल परसेप्शन-अवेयर ऑप्टिमाइज़ेशन रणनीति द्वारा समर्थित किया गया है ताकि मजबूत, भाषा-निर्देशित लक्ष्य स्थानीयकरण और ट्रैकिंग प्राप्त की जा सके।

मूल लेखक: Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुरक्षा कैमरे पर एक व्यस्त सड़क के दृश्य को देख रहे हैं। दर्जनों लोग चल रहे हैं, दौड़ रहे हैं और एक-दूसरे के रास्ते से गुजर रहे हैं।

पुराना तरीका (पारंपरिक ट्रैकिंग):
कल्पना कीजिए कि एक सुरक्षा गार्ड को बताया गया है, "हर किसी पर नज़र रखो।" तो, गार्ड वीडियो में हर व्यक्ति पर एक लाल बिंदु लगा देता है, चाहे वे कोई भी हों। यदि आप पूछते हैं, "लाल हुडी वाला व्यक्ति कहाँ है?" तो उसे 50 लाल बिंदुओं की सूची में से ढूंढना पड़ता है और अनुमान लगाना पड़ता है कि आपका मतलब किससे है। वे सभी को समान रूप से ट्रैक करते हैं, भले ही आप केवल एक विशिष्ट व्यक्ति के बारे में जानना चाहते हों। पारंपरिक मल्टी-ऑब्जेक्ट ट्रैकिंग (MOT) इसी तरह काम करती है: यह "सभी लोगों" को तो ढूंढ लेती है लेकिन वास्तव में यह नहीं समझती कि आप किसके बारे में पूछ रहे हैं।

नया तरीका (QTrack):
अब, एक सुपर-स्मार्ट जासूस की कल्पना करें जो केवल सबको नहीं देखता। आप उन्हें एक नोट देते हैं जिसमें लिखा है: "उस व्यक्ति को खोजें जिसने लाल हुडी पहनी है और नीला बैग ले जा रहा है, और विशेष रूप से उनका पीछा करें।"

यह जासूस उस व्यक्ति को ट्रैक करने में समय बर्बाद नहीं करता जिसने काली सूट पहनी है या जिसने हरी जैकेट पहनी है। वे तुरंत बाकी सभी को अनदेखा कर देते हैं और पूरी तरह से "लाल हुडी" पर ध्यान केंद्रित करते हैं। भले ही वह व्यक्ति किसी पेड़ के पीछे छिप जाए (occlusion) या अपनी दिशा बदल ले, जासूस अपनी नज़रें ठीक उसी व्यक्ति पर टिकाए रखता है, यह याद रखते हुए कि उनकी पहचान वास्तव में क्या है।

यह QTrack है। यह एक प्रकार का नया वीडियो ट्रैकिंग सिस्टम है जो यह तय करने के लिए आपके प्राकृतिक भाषा के निर्देशों को सुनता है कि किसे फॉलो करना है, न कि केवल यह कि चीजें कहाँ जा रही हैं।

तीन बड़ी समस्याएँ जिन्हें QTrack हल करता है

  1. "कौन" बनाम "कहाँ":

    • पुराना तरीका: "कारें कहाँ हैं?" (सभी कारों को ट्रैक करता है)।
    • QTrack: "नीली कार कहाँ है जो अभी बाईं ओर मुड़ी है?" (केवल नीली कार को ट्रैक करता है)।
    • उपमा: यह एक ऐसे कैमरे और एक स्पॉटलाइट के बीच का अंतर है जो पूरे कमरे को रिकॉर्ड करता है और एक ऐसा स्पॉटलाइट जो केवल उस अभिनेता का पीछा करता है जिसे आप देखने के लिए कहते हैं।
  2. "याददाश्त" की समस्या (तर्क):

    • कभी-कभी, जिस व्यक्ति को आप ट्रैक कर रहे हैं, वह भीड़ के कारण छिप जाता है। एक सामान्य कैमरा उन्हें खो सकता है और किसी दूसरे व्यक्ति को चुन सकता है जो उनके जैसा दिखता हो।
    • QTrack "तर्क" (reasoning) का उपयोग करता है। यह एक जासूस की तरह है जो याद रखता है, "आह, लाल हुडी वाला व्यक्ति कॉफी शॉप की ओर जा रहा था, बस स्टॉप की ओर नहीं।" भले ही वह व्यक्ति एक सेकंड के लिए गायब हो जाए, QTrack तर्क और संदर्भ का उपयोग करके यह अनुमान लगाता है कि वह कहाँ फिर से दिखाई दिया, जिससे उसकी पहचान सुसंगत बनी रहती है।
  3. "ड्रिफ्टिंग" (भटकने) की समस्या:

    • पुराने सिस्टम में, यदि ट्रैकर भ्रमित हो जाता है, तो व्यक्ति के चारों ओर बना बॉक्स "ड्रिफ्ट" करने लगता है या बेतरतीब ढंग से इधर-उधर कूदने लगता है।
    • QTrack एक विशेष प्रशिक्षण पद्धति (जिसे TAPO कहा जाता है) का उपयोग करता है जो एक सख्त कोच की तरह काम करती है। यदि ट्रैकर अजीब या अप्राकृतिक तरीके से (जैसे टेलीपोर्ट होने की तरह) हिलने लगता है, तो कोच चिल्लाकर कहता है, "नहीं! इंसान इस तरह नहीं चलता!" यह सिस्टम को यह सीखने के लिए मजबूर करता है कि चीजें समय के साथ वास्तव में कैसे चलती हैं, जिससे ट्रैकिंग सुचारू और वास्तविक बनती है।

नया खेल का मैदान: RMOT26

इस नए जासूस को सिखाने के लिए, शोधकर्ताओं ने एक विशाल, अत्यंत चुनौतीपूर्ण अभ्यास जिम बनाया जिसे RMOT26 कहा जाता है।

  • केवल वीडियो दिखाने के बजाय, उन्होंने AI के लिए विशिष्ट "मिशन" लिखे।
  • मिशन का उदाहरण: "पीले रंग की धारियों वाले काले क्रॉप टॉप वाली डांसर को ट्रैक करें, लेकिन सफेद शर्ट वाली महिला को अनदेखा करें।"
  • यह डेटासेट कठिन स्थितियों से भरा है: भीड़भाड़ वाले कमरे, एक-दूसरे के पीछे छिपते लोग, और ऐसे लोग जो दिखने में बहुत समान हैं। यह AI को केवल अनुमान लगाने के बजाय तर्क करना सीखने के लिए मजबूर करता है।

यह कैसे काम करता है (गुप्त नुस्खा)

शोधकर्ताओं ने AI को केवल चित्रों को "देखना" नहीं सिखाया; उन्होंने इसे कार्य करने से पहले सोचना सिखाया।

  1. चेन ऑफ थॉट (Chain of Thought): किसी व्यक्ति के चारों ओर बॉक्स बनाने से पहले, AI अपने लिए एक छोटा सा नोट लिखता है: "ठीक है, मैं एक भीड़ देख रहा हूँ। क्वेरी लाल हुडी के बारे में पूछ रही है। मुझे तीन लाल हुडी दिख रही हैं। बाईं ओर वाले के पास नीला बैग है। वही व्यक्ति है।"
  2. सुदृढीकरण सीखना (Reinforcement Learning): AI एक खेल खेलता है जहाँ उसे सटीक होने के लिए अंक मिलते हैं और "ड्रिफ्टिंग" करने या लक्ष्य को खो देने पर अंक कटते हैं। समय के साथ, वह पुरस्कार को हासिल करने के लिए सबसे अच्छी रणनीति सीख जाता है।

यह क्यों मायने रखता है?

यह केवल बेहतर वीडियो बनाने के बारे में नहीं है। यह तकनीक वास्तविक दुनिया के अनुप्रयोगों के लिए एक बड़ी छलांग है:

  • निगरानी (Surveillance): एक अधिकारी द्वारा 50 स्क्रीनों को देखने के बजाय, वे कह सकते हैं, "लाल जैकेट वाले संदिग्ध को ट्रैक करें," और सिस्टम इसे स्वचालित रूप से करता है।
  • रोबोटिक्स: एक वेटर रोबोट को निर्देश दिया जा सकता है, "नीली शर्ट वाले ग्राहक का टेबल तक पीछा करें," बिना अन्य ग्राहकों से भ्रमित हुए।
  • खेल विश्लेषण (Sports Analysis): एक कोच पूछ सकता है, "उस खिलाड़ी के पथ (trajectory) को दिखाएं जिसने गोल किया," और सिस्टम केवल उसी खिलाड़ी की गति को अलग कर देता है।

संक्षेप में: QTrack एक कैमरे को एक निष्क्रिय रिकॉर्डर से बदलकर एक सक्रिय, बुद्धिमान सहायक में बदल देता है जो आपके निर्देशों को सुनता है और ठीक उसी का पीछा करता है जिसकी आपको परवाह है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →