← नवीनतम पेपर
🤖 AI

DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking

यह शोध पत्र DRMOT को प्रस्तुत करता है, जो एक नवीन RGBD रेफ़रिंग मल्टी-ऑब्जेक्ट ट्रैकिंग कार्य है, साथ ही DRSet डेटासेट और DRTrack फ्रेमवर्क भी पेश करता है, ताकि मजबूत 3D-सचेत लक्ष्य ट्रैकिंग और स्थानिक-सिमेंटिक ग्राउंडिंग के लिए फ्यूज्ड RGB, डेप्थ और लैंग्वेज मोडैलिटीज़ का लाभ उठाकर केवल 2D-आधारित मॉडलों की सीमाओं को संबोधित किया जा सके।

मूल लेखक: Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाले कमरे में अपने किसी खास दोस्त को खोजने की कोशिश कर रहे हैं। आप अपने स्मार्ट असिस्टेंट से पूछते हैं, "कैमरे के सबसे करीब मौजूद व्यक्ति को ढूँढो।"

यदि आपके असिस्टेंट के पास केवल एक 2D तस्वीर है (जैसे फोन पर एक सपाट फोटो), तो वह भ्रमित हो जाता है। एक सपाट तस्वीर में, हर कोई एक ही समतल सतह पर दिखाई देता है। लेंस के बिल्कुल पास खड़ा व्यक्ति और पीछे खड़ा व्यक्ति भी एक जैसा दिख सकता है यदि उन्होंने समान कपड़े पहने हों। असिस्टेंट गलत अनुमान लगा सकता है, और सामने वाले व्यक्ति के बजाय पीछे खड़े व्यक्ति की ओर इशारा कर सकता है। यह वर्तमान ट्रैकिंग तकनीक की समस्या है: यह दुनिया को एक वास्तविक कमरे के बजाय एक सपाट पेंटिंग की तरह देखती है।

यह शोध पत्र इस समस्या को हल करने का एक नया तरीका पेश करता है, जिसमें असिस्टेंट को 3D चश्मा (डेप्थ इंफॉर्मेशन/गहराई की जानकारी) और एक सुपर-ब्रेन (एक लार्ज लैंग्वेज मॉडल) दिया जाता है।

यहाँ एक सरल विवरण दिया गया है कि लेखकों ने क्या किया है:

1. नया खेल: DRMOT

लेखकों ने एक नई चुनौती बनाई जिसे DRMOT (डेप्थ रेफरिंग मल्टी-ऑब्जेक्ट ट्रैकिंग) कहा जाता है।

  • पुराना तरीका: आप कंप्यूटर को एक वीडियो देते हैं और एक वाक्य देते हैं जैसे "लाल टोपी वाले आदमी को ट्रैक करो।" कंप्यूटर केवल वीडियो के रंगों का उपयोग करके उसका पीछा करने की कोशिश करता है।
  • नया तरीका: आप कंप्यूटर को वीडियो, वाक्य, और एक "डेप्थ मैप" (एक विशेष इमेज जो कंप्यूटर को बताती है कि हर पिक्सेल कितनी दूर है) देते हैं। अब, यदि आप कहते हैं "उस व्यक्ति को ट्रैक करें जो कैमरे के सबसे करीब है," तो कंप्यूटर वास्तव में दूरी को माप सकता है और सही व्यक्ति को चुन सकता है, भले ही वह दूर खड़े किसी दूसरे व्यक्ति जैसा ही क्यों न दिखता हो।

2. नया नक्शा: DRSet

कंप्यूटर को यह नया कौशल सिखाने के लिए, लेखकों ने एक विशेष प्रशिक्षण लाइब्रेरी बनाई जिसे DRSet कहा जाता है।

  • इसे 187 अलग-अलग "सीन" (जैसे पार्क, लिविंग रूम, या सड़क) के एक विशाल पुस्तकालय के रूप में समझें।
  • प्रत्येक सीन के लिए, उनके पास नियमित वीडियो, 3D डेप्थ मैप और मानव भाषा में लिखे गए 240 विशिष्ट निर्देश हैं।
  • महत्वपूर्ण बात यह है कि उनमें से 56 निर्देश दूरी पर आधारित हैं (जैसे "पेड़ के पीछे वाली कार" या "हमारे सबसे करीब वाला व्यक्ति")। यह कंप्यूटर को यह सीखने के लिए मजबूर करता है कि भाषा को समझने के लिए 3D स्पेस का उपयोग कैसे किया जाए।

3. नया दिमाग: DRTrack

उन्होंने इन पहेलियों को हल करने के लिए एक नया सिस्टम भी बनाया जिसे DRTrack कहा जाता है। यह दो चरणों में काम करता है, जैसे एक जासूस जिसके पास दो उपकरण हों:

  • चरण 1: "ईगल आई" (The MLLM):
    वे एक शक्तिशाली AI दिमाग (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल) का उपयोग करते हैं जो वीडियो, डेप्थ मैप और वाक्य को एक साथ देखता है। यह एक ऐसे जासूस की तरह है जो कमरे को 3D में देख सकता है। जब आप कहते हैं, "सबसे करीब वाले व्यक्ति को ढूँढो," तो यह दिमाग डेप्थ मैप का उपयोग करके तुरंत जान जाता है कि वास्तव में कौन आगे है और कौन पीछे है। यह सही व्यक्ति के चारों ओर एक बॉक्स बनाता है।

    • उपमा: यह एक लेजर पॉइंटर की तरह है जो मानचित्र पढ़ते समय दूरी भी मापता है।
  • चरण 2: "स्टिकी टेप" (The Tracker):
    एक बार जब दिमाग पहले फ्रेम में व्यक्ति को ढूंढ लेता है, तो सिस्टम को उन्हें चलते हुए ट्रैक करने की आवश्यकता होती है, भले ही वे किसी दीवार या भीड़ के पीछे छिप जाएं। लेखकों ने उनके ट्रैकिंग मेथड में "डेप्थ टेप" जोड़ा है।

    • आमतौर पर, यदि दो लोग एक-दूसरे के करीब चलते हैं, तो कंप्यूटर उन्हें आपस में मिला सकता है (उनकी पहचान बदल सकता है)।
    • DRTrack के साथ, कंप्यूटर 3D दूरी की जांच करता है। यदि व्यक्ति A 2 मीटर दूर है और व्यक्ति B 5 मीटर दूर है, तो कंप्यूटर जानता है कि वे अलग-अलग लोग हैं, भले ही वे दिखने में बहुत समान क्यों न हों। यह उनकी पहचान को अलग रखता है और भ्रम को रोकता है।

4. परिणाम

लेखकों ने अपने नए सिस्टम का पुराने सिस्टम के खिलाफ परीक्षण किया जो केवल सपाट 2D वीडियो का उपयोग करते थे।

  • परिणाम: नया सिस्टम (DRTrack) सही व्यक्ति को खोजने और बिना भ्रमित हुए उनका पीछा करने में बहुत बेहतर था।
  • यह क्यों महत्वपूर्ण है: इसने साबित कर दिया कि AI को "डेप्थ विजन" देना ही स्थान और दूरी से संबंधित निर्देशों को समझने की कुंजी है, जिसे सपाट 2D कैमरे अकेले नहीं कर सकते।

संक्षेप में: यह शोध पत्र कहता है, "यदि आप चाहते हैं कि एक AI 'हमारे सबसे करीब वाले' जैसे निर्देशों को समझे, तो आपको केवल उसे एक सपाट वीडियो नहीं दिखाना चाहिए। आपको उसे कमरे की 3D गहराई भी दिखानी होगी। हमने यह सिद्ध करने के लिए एक नया डेटासेट और एक नया AI दिमाग बनाया है कि यह काम करता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →