STORM: End-to-End Referring Multi-Object Tracking in Videos
यह शोध पत्र STORM को प्रस्तुत करता है, जो एक एंड-टू-एंड MLLM है जो एक टास्क-कंपोजिशन लर्निंग रणनीति के माध्यम से ऑब्जेक्ट ग्राउंडिंग और ट्रैकिंग को एकीकृत करता है, और नए प्रस्तावित STORM-Bench डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही व्यस्त और हलचल भरा वीडियो देख रहे हैं: एक पार्क का दृश्य जहाँ बच्चे खेल रहे हैं, कुत्ते दौड़ रहे हैं और लोग टहल रहे हैं। अब, कल्पना कीजिए कि आप कंप्यूटर को कहना चाहते हैं, "उस छोटी लड़की का पीछा करो जिसने लाल ड्रेस पहनी है और जो गोल्डन रिट्रीवर के पीछे भाग रही है, लेकिन बाकी कुत्तों को अनदेखा कर दो।"
लंबे समय तक, कंप्यूटर इसमें बहुत खराब रहे हैं। वे एक अनाड़ी सहायक की तरह हैं जो या तो एक फोटो में चीजों को ढूँढ सकते हैं या किसी एक वस्तु का पीछा कर सकते हैं, लेकिन वे एक साथ दोनों काम करने में संघर्ष करते हैं। वे अक्सर भ्रमित हो जाते हैं, लड़की का पीछा करना छोड़ देते हैं, या गलत कुत्ते का पीछा करने लगते हैं।
यह पेपर STORM पेश करता है, जो एक नया AI सिस्टम है जो एक अति-बुद्धिमान, चौकस फिल्म निर्देशक की तरह काम करता है जो पूरी फिल्म देख सकता है, आपके विशिष्ट निर्देशों को समझ सकता है, और ठीक उसी व्यक्ति पर अपनी नज़र बनाए रख सकता है जिसे आपने मांगा है।
यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "असेंबली लाइन" बनाम "स्विस आर्मी नाइफ"
STORM से पहले, भाषा के आधार पर वस्तुओं को ट्रैक करना एक पुराने जमाने की फैक्ट्री असेंबली लाइन जैसा था।
- चरण 1: एक मशीन (डिटेक्टर) वीडियो को देखती है और कहती है, "मुझे एक कुत्ता, एक लड़की और एक गेंद दिख रही है।"
- चरण 2: दूसरी मशीन (ट्रैकर) उनका पीछा करने की कोशिश करती है।
- चरण 3: तीसरी मशीन (लैंग्वेज प्रोसेसर) यह समझने की कोशिश करती है कि "लाल ड्रेस वाली लड़की" कौन है।
यदि किसी भी चरण में गलती होती है, तो पूरा काम विफल हो जाता है। यह बोझिल, धीमा है, और मशीनें आपस में ठीक से बात नहीं कर पातीं।
STORM अलग है। यह एक स्विस आर्मी नाइफ है। यह एक एकल, एकीकृत मस्तिष्क (एक मल्टी-मॉडल लार्ज लैंग्वेज मॉडल) है जो वीडियो देखता है, आपकी रिक्वेस्ट सुनता है, और एक साथ उत्तर निकाल लेता है। इसे अलग-अलग उपकरणों की आवश्यकता नहीं है; यह बस एक साथ देखना, सुनना और ट्रैक करना जानता है।
2. ट्रेनिंग का तरीका: "टास्क-कंपोजिशन लर्निंग" (TCL)
किसी रोबोट को "एक वाक्य के आधार पर वीडियो में विशिष्ट लोगों का पीछा करने" जैसा कठिन काम सिखाना अविश्वसनीय रूप से महंगा है। आपको हजारों घंटों के मानव विशेषज्ञों की आवश्यकता होगी जो हर फ्रेम के लिए वस्तुओं के चारों ओर बॉक्स खींचें और वाक्य लिखें। यह एक फिल्म के हर फ्रेम को बनाने के लिए 1,000 लोगों की टीम को काम पर रखने जैसा है।
लेखकों ने महसूस किया कि उन्हें शून्य से शुरुआत करने की आवश्यकता नहीं है। उन्होंने टास्क-कंपोजिशन लर्निंग (TCL) नामक रणनीति का उपयोग किया। इसे एक जैज़ संगीतकार (Jazz Musician) को प्रशिक्षित करने जैसा समझें:
- चरण 1 (बुनियादी बातें): पहले, वे AI को सरल स्केल सिखाते हैं (इमेज ग्राउंडिंग: "इस फोटो में बिल्ली को ढूँढो") और एक स्थिर लय बनाए रखना सिखाते हैं (सिंगल-ऑब्जेक्ट ट्रैकिंग: "इस गेंद का पीछा करो")। ये आसान कार्य हैं जिनके लिए बहुत सारा डेटा उपलब्ध है।
- चरण 2 (सोलो): एक बार जब AI बुनियादी बातों में माहिर हो जाता है, तो वे उसे थोड़े से कठिन, जटिल "जैज़" डेटा (रेफरिंग मल्टी-ऑब्जेक्ट ट्रैकिंग) के साथ देते हैं। क्योंकि वह पहले से ही बुनियादी सिद्धांतों को जानता है, वह जटिल कार्य को अविश्वसनीय रूप से तेज़ी से सीख लेता है।
इसने उन्हें बिना लाखों महंगे, कस्टम-लेबल वाले वीडियो के एक विश्व स्तरीय ट्रैकर बनाने में सक्षम बनाया।
3. नया खेल का मैदान: STORM-Bench
अपने नए निर्देशक को टेस्ट करने के लिए, उन्हें एक बेहतर फिल्म की आवश्यकता थी। मौजूदा डेटासेट खराब स्क्रिप्ट की तरह थे: वे छोटे थे, निर्देश अस्पष्ट थे ("व्यक्ति का पीछा करें"), और कलाकार अक्सर एक जैसे थे (ज्यादातर केवल कारें और पैदल चलने वाले लोग)।
टीम ने STORM-Bench बनाया, जो एक नया डेटासेट है जो एक समृद्ध, विविध पटकथा (Screenplay) की तरह है:
- जटिल स्क्रिप्ट: "कुत्ते का पीछा करो" के बजाय, प्रॉम्प्ट्स ऐसे हैं: "उस कुत्ते का पीछा करो जिसने नीले रंग का बैंडना पहना है जो गिलहरी के पीछे भाग रहा है।"
- विविध कलाकार: इसमें फर्नीचर, जानवर, भोजन और विभिन्न प्रकार के परिवेशों में लोग शामिल हैं, न कि केवल शहर की सड़कें।
- "बॉटम-अप" विधि: यह अनुमान लगाने के बजाय कि वीडियो में कौन सी वस्तुएं हैं और फिर उन्हें वर्णित करने की कोशिश करना (जिससे अक्सर गलतियाँ होती हैं), उन्होंने वस्तुओं से शुरुआत की, उन्हें पूरी तरह से वर्णित किया, और फिर उनके इर्द-गिर्द वाक्य बनाए। यह सुनिश्चित करता है कि निर्देश हमेशा सटीक हों।
4. परिणाम: निर्देशक की जीत
जब उन्होंने STORM को टेस्ट किया, तो इसने केवल जीत हासिल नहीं की; इसने दबदबा बनाया।
- सरल कार्यों पर: यह फोटो में वस्तुओं को खोजने में सर्वश्रेष्ठ था।
- ट्रैकिंग पर: यह एकल वस्तुओं का पीछा करने में सर्वश्रेष्ठ था।
- कठिन कार्यों (RMOT) पर: इसने प्रतियोगिता को पछाड़ दिया। जब "हाथ पकड़े हुए दो लोगों का पीछा करने" के लिए कहा गया जबकि "कुत्ता भौंक रहा है," तो अन्य मॉडल भ्रमित हो गए, लेकिन STORM ने पूरी तरह से सबका पीछा किया, उनके बीच के संबंधों और गति को समझा।
बड़ी तस्वीर (The Big Picture)
संक्षेप में, STORM एक बड़ी सफलता है क्योंकि यह "देखने", "सोचने" और "पीछा करने" को अलग-अलग कामों के रूप में मानना बंद कर देता है। यह उन्हें एक सहज बुद्धिमत्ता में जोड़ देता है।
- पुराना तरीका: विशेषज्ञों की एक टीम जो एक-दूसरे को नोट्स पास करती है, और अक्सर संदेश खो देती है।
- STORM: एक अकेला, प्रतिभाशाली निर्देशक जो दृश्य को देखता है, आपकी रिक्वेस्ट समझता है, और कैमरे को बिल्कुल वैसे ही निर्देशित करता है जैसा आपने मांगा है, चाहे दृश्य कितना भी जटिल क्यों न हो।
यह तकनीक उस AI की ओर एक बड़ा कदम है जो वास्तव में दुनिया को वैसे ही समझ सकता है जैसे इंसान समझते हैं—जो देखते हैं उसे उनके द्वारा कहे गए शब्दों और समय के साथ चीजों के हिलने-डुलने के साथ जोड़कर।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।