← नवीनतम पेपर
🤖 AI

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW एक पिक्सेल-ग्राउंडेड वीडियो MLLM है जो टारगेट-स्पेसिफिक ट्रैक्ड फीचर्स और एक डुअल-प्रॉम्ट डिज़ाइन को पेश करके स्थानिक सटीकता और टेम्पोरल रेफरेंशियल कंसिस्टेंसी को बढ़ाता है, जिससे बाहरी डिटेक्टर्स पर निर्भर हुए बिना कई बेंचमार्क में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं और अपने दोस्त से पूछ रहे हैं, "क्या आप उस लाल कार की ओर इशारा कर सकते हैं जो बेकरी के पास से गुजर रही है?"

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे वीडियो ग्राउंडिंग (Video Grounding) कहा जाता है। AI को शब्दों ("लाल कार") को समझना होगा, वीडियो में उस वस्तु को खोजना होगा, और फ्रेम दर फ्रेम उसके चारों ओर एक मास्क बनाना होगा।

लेकिन समस्या यह है: वर्तमान AI मॉडल एक भटका हुआ पर्यटक (distracted tourist) की तरह हैं।

  1. वे रास्ता भटक जाते हैं: यदि लाल कार किसी कोने पर मुड़ जाती है या किसी पेड़ के पीछे छिप जाती है, तो AI अक्सर भूल जाता है कि वह किस कार को ट्रैक कर रहा था। वह अचानक किसी नीली कार या लाल ट्रक की ओर इशारा करने लग सकता है।
  2. वे लड़खड़ाने लगते हैं: जब वीडियो शुरू होता है, तो AI अक्सर कार के लिए गलत जगह का अनुमान लगा लेता है। एक बार जब वह पहली गलती कर देता है, तो वह अगले फ्रेम में इसे "ठीक" करने की कोशिश करता है, लेकिन त्रुटि जमा होती जाती है, जैसे पहाड़ से लुढ़कती हुई बर्फ का गोला, जब तक कि AI कार के बजाय आसमान की ओर इशारा न करने लगे।

पेश है SPARROW (Spatial Precision and Referential Reasoning in Object-centric Video grounding)। SPARROW को एक अति-केंद्रित सुरक्षा गार्ड (super-focused security guard) के रूप में समझें जो कभी भी उस व्यक्ति का पीछा नहीं छोड़ता जिसके बारे में आपने पूछा है।

यहाँ बताया गया है कि SPARROW कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके:

1. "मेमोरी स्टिक" (Target-Specific Tracked Features)

समस्या: पुराने AI मॉडल प्रत्येक वीडियो फ्रेम को एक नई तस्वीर के रूप में देखते हैं। वे यह याद नहीं रखते कि फ्रेम 10 में "लाल कार" वही है जो फ्रेम 11 में है।
SPARROW का समाधान: कल्पना करें कि आप भीड़ में किसी विशिष्ट व्यक्ति को ट्रैक कर रहे हैं। केवल उन्हें देखने के बजाय, आप अपने AI को एक विशेष "मेमोरी स्टिक" (जिसे TSF कहा जाता है) देते हैं।

  • AI द्वारा वीडियो देखना शुरू करने से पहले ही, यह "लाल कार" का एक त्वरित स्नैपशॉट लेता है और उसके अद्वितीय "फिंगरप्रिंट" (उसके आकार, रंग और बनावट) को सहेज लेता है।
  • जैसे-जैसे वीडियो चलता है, AI लगातार इस मेमोरी स्टिक की जांच करता रहता है। भले ही कार आंशिक रूप से छिपी हो या रोशनी बदल जाए, AI कहता है, "आह, यह मेरी मेमोरी स्टिक से मेल खाता है! यह अभी भी वही लाल कार है।"
  • परिणाम: AI कभी भी लक्ष्य को नहीं खोता, भले ही वह एक पल के लिए पेड़ के पीछे गायब हो जाए।

2. "दो-चरणीय जासूस" (Dual-Prompt Design)

समस्या: पुराने AI मॉडल तुरंत वस्तु के सटीक आकार का अनुमान लगाने की कोशिश करते हैं। यह किसी से सड़क का साइन बोर्ड देखे बिना शहर का सटीक नक्शा बनाने के लिए कहने जैसा है। वे अक्सर गलत मोहल्ले का अनुमान लगा लेते हैं।
SPARROW का समाधान: SPARROW दो अलग-अलग उपकरणों का उपयोग करके एक दो-चरणीय जासूस प्रक्रिया का उपयोग करता है:

  • चरण 1: बॉक्स ([BOX]): सबसे पहले, AI उस सामान्य क्षेत्र के चारों ओर एक मोटा, ढीला बॉक्स बनाता है जहाँ वस्तु हो सकती है। यह यह कहने जैसा है कि, "लाल कार इस पार्किंग स्थल में कहीं है।" यह AI को एक ठोस शुरुआती बिंदु देता है ताकि वह भटक न जाए।
  • चरण 2: मास्क ([SEG]): एक बार बॉक्स सेट हो जाने के बाद, AI ज़ूम इन करता है और पिक्सेल दर पिक्सेल कार की सटीक रूपरेखा खींचता है। यह यह कहने जैसा है कि, "ठीक है, अब जब हम जानते हैं कि यह पार्किंग स्थल में है, तो यहाँ लाल कार का सटीक आकार है।"
  • परिणाम: पहले "रफ लोकेशन" को सही करके, AI कभी भी यह लेकर भ्रमित नहीं होता कि वह किस वस्तु को देख रहा है, जिससे बहुत स्पष्ट और सटीक रूपरेखा मिलती है।

3. "ट्रेनिंग कैंप" (The Dataset)

SPARROW को ये कौशल सिखाने के लिए, शोधकर्ताओं ने केवल रैंडम वीडियो का उपयोग नहीं किया। उन्होंने 30,000 से अधिक वीडियो और 45,000 प्रश्नों के साथ एक विशाल ट्रेनिंग कैंप बनाया।

  • उन्होंने विशेष रूप से AI को कठिन स्थितियों को संभालने के लिए प्रशिक्षित किया: तेजी से चलती वस्तुएं, एक-दूसरे के पीछे छिपती वस्तुएं, और ऐसी वस्तुएं जो एक-दूसरे के बहुत समान दिखती हैं।
  • उन्होंने एक "शिक्षक" प्रणाली (अन्य AI टूल्स) का उपयोग किया ताकि वीडियो को परफेक्ट ट्रैकिंग डेटा के साथ प्री-मार्क किया जा सके, ताकि SPARROW वास्तविक वीडियो देखने से पहले बेहतरीन उदाहरणों से सीख सके।

यह क्यों मायने रखता है?

SPARROW से पहले, यदि आप किसी AI को भीड़ भरे डांस वीडियो में किसी विशिष्ट व्यक्ति को ट्रैक करने के लिए कहते, तो यह वीडियो के बीच में ही किसी दूसरे व्यक्ति को ट्रैक करने लग सकता था।

SPARROW के साथ:

  • स्थिरता (Stability): यह शुरुआत से अंत तक उसी वस्तु पर टिका रहता है।
  • परिशुद्धता (Precision): यह रूपरेखा को पूरी तरह से बनाता है, भले ही वस्तु तेजी से चल रही हो या आंशिक रूप से छिपी हो।
  • कोई अतिरिक्त उपकरण नहीं (No Extra Gear): यह यह सब बिना किसी भारी, धीमे बाहरी कैमरे या ट्रैकर को इंस्टॉल किए करता है। यह एक "प्लग-एंड-प्ले" अपग्रेड है जो मौजूदा AI मॉडल को स्मार्ट बनाता है।

संक्षेप में: SPARROW एक भूलक्कड़, लड़खड़ाते हुए AI को एक विश्वसनीय, पैनी नज़र वाले साथी में बदल देता है जो किसी भी वीडियो में किसी भी वस्तु का पीछा कर सकता है, चाहे दृश्य कितना भी अराजक क्यों न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →