← नवीनतम पेपर
💻 computer science

ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking

यह शोध पत्र ReaMOT को प्रस्तुत करता है, जो तर्क-आधारित मल्टी-ऑब्जेक्ट ट्रैकिंग पर केंद्रित एक नया बेंचमार्क और कार्य है जिसके लिए मॉडलों को निहित तार्किक बाधाओं के माध्यम से लक्ष्यों की पहचान करने की आवश्यकता होती है, जिसके साथ एक बड़े पैमाने का डेटासेट और ReaTrack नामक एक प्रशिक्षण-मुक्त फ्रेमवर्क है जो थिंकिंग-वेरिएंट LVLMs को SAM2 के साथ जोड़ता है।

मूल लेखक: Sijia Chen, Yanqiu Yu, En Yu, Wenbing Tao

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sijia Chen, Yanqiu Yu, En Yu, Wenbing Tao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुरक्षा कैमरे के माध्यम से एक व्यस्त फुटबॉल मैच या एक भीड़भाड़ वाली सड़क देख रहे हैं।

यदि मैं आपसे कहूँ, "लाल कार का पीछा करो," तो आप यह आसानी से कर सकते हैं। आप बस लाल रंग को देखते हैं और कार के आकार का पीछा करते हैं। वर्तमान AI इसी काम में अच्छा है—यह एक ऐसे बच्चे की तरह है जो "नीली गेंद ढूंढो" जैसे सरल निर्देशों का पालन कर सकता है।

लेकिन क्या होगा अगर मैं कहूँ, "उन खिलाड़ियों का पीछा करो जो जीत के लिए मिलकर काम करते हुए लग रहे हैं," या "उस व्यक्ति का पीछा करो जो सड़क पार करने के लिए संघर्ष करता हुआ लग रहा है"?

अचानक, आप केवल रंग या आकार को नहीं देख सकते। आपको सोचना होगा। आपको लोगों के चलने के तरीके, उनके आपसी व्यवहार को देखना होगा, और उस कहानी को समझने के लिए अपने "सामान्य ज्ञान" का उपयोग करना होगा जो वीडियो में घटित हो रही है। वर्तमान AI आमतौर पर यहाँ विफल हो जाता है क्योंकि इसमें तर्क करने वाला "दिमाग" नहीं होता।

यह पेपर ReaMOT पेश करता है, जो AI को केवल देखने के लिए ही नहीं, बल्कि समझने के लिए सिखाने का एक नया तरीका है।

तीन मुख्य सामग्रियां

इसे हल करने के लिए, शोधकर्ताओं ने तीन चीजें बनाईं:

1. "बुद्धिमान" परीक्षा (ReaMOT बेंचमार्क)

इसे AI के लिए एक नई, बहुत कठिन परीक्षा के रूप में समझें। केवल "यह किस रंग का है?" पूछने के बजाय, यह परीक्षा जटिल प्रश्न पूछती है जैसे, "उन लोगों का पीछा करें जो संभवतः एक ही परिवार के सदस्य हैं" या "उन वाहनों का पीछा करें जो सिग्नल का इंतजार कर रहे हैं।" उन्होंने हजारों वीडियो क्लिप और पेचीदा सवालों का एक विशाल पुस्तकालय बनाया है ताकि यह देखा जा सके कि क्या AI वास्तव में इसे "समझ" सकता है।

2. "जासूस" ढांचा (ReaTrack)

इस परीक्षा को पास करने के लिए, शोधकर्ताओं ने ReaTrack नामक एक नई प्रणाली बनाई। आप इसे एक साथ काम करने वाली तीन-सदस्यीय जासूसी टीम के रूप में समझ सकते हैं:

  • स्मार्ट जासूस (रीजनिंग-अवेयर डिटेक्शन): यह एक उच्च-स्तरीय AI ("सोचने वाला" मॉडल) है जो निर्देश पढ़ता है। यह केवल आकारों को नहीं देखता; यह तर्क के माध्यम से सोचता है। यदि निर्देश "जीतने वाली टीम" है, तो जासूस पहले स्कोरबोर्ड को देखता है, यह समझता है कि कौन सी टीम जीत रही है, और फिर उनकी विशिष्ट जर्सी की पहचान करता है।
  • परछाई (मास्क-बेस्ड टेम्पोरल प्रोपेगेशन): एक बार जब जासूस लक्ष्य को ढूंढ लेता है, तो "परछाई" (SAM2 नामक टूल का उपयोग करके) उनसे चिपकी रहती है। भले ही वह व्यक्ति किसी पेड़ या खंभे के पीछे चला जाए, परछाई को ठीक से याद रहता है कि वे कैसे दिखते थे और वह "अनुमान" लगाता है कि दूसरी ओर से वे कब बाहर निकलेंगे।
  • मैनेजर (रीजनिंग-मोशन एसोसिएशन): यह व्यक्ति सब कुछ व्यवस्थित रखता है। वे सुनिश्चित करते हैं कि "स्मार्ट जासूस" का तर्क और "परछाई" की गति तालमेल में रहे। यदि जासूस एक पल के लिए भ्रमित हो जाता है, तो मैनेजर ट्रैक को सुचारू रूप से चलाने के लिए परछाई की स्मृति का उपयोग करता है।

3. परिणाम: एक बड़ी छलांग

जब उन्होंने इस "जासूसी टीम" का पुराने AI के मुकाबले परीक्षण किया, तो अंतर दिन और रात जैसा था। सबसे कठिन श्रेणियों में (जिनके लिए गहरे विचार की आवश्यकता होती है), नया सिस्टम पिछले सर्वोत्तम तरीकों की तुलना में छह गुना बेहतर था।

यह क्यों मायने रखता है?

यह केवल खेल देखने के बारे में नहीं है। भविष्य में, इस तरह के "तर्क करने वाले AI" का उपयोग किया जा सकता है:

  • स्व-चालित कारों (Self-driving cars) में: केवल पैदल यात्री को देखने के ही नहीं, बल्कि यह समझने के लिए कि सड़क की ओर दौड़ता हुआ बच्चा सड़क पार करने का इरादा रखता है।
  • खोज और बचाव (Search and Rescue) में: भीड़भाड़ वाले आपदा क्षेत्र में "एक व्यक्ति जो खोया हुआ या घायल लग रहा है" को खोजने के लिए।
  • स्मार्ट शहरों में: "ट्रैफिक पैटर्न की पहचान करने के लिए जो दुर्घटना होने का संकेत देते हैं" न कि केवल कारों को गिनने के लिए।

संक्षेप में: ReaMOT AI को केवल रंगों को देखने वाले एक साधारण कैमरे से बदलकर एक स्मार्ट पर्यवेक्षक में बदल देता है जो मानवीय व्यवहार को समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →