← नवीनतम पेपर
💻 computer science

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

यह शोध पत्र SegFS को प्रस्तुत करता है, जो वास्तविक समय के ओपन-वोकैबुलरी वीडियो इंस्टेंस सेगमेंटेशन के लिए एक डुअल-स्ट्रीम फास्ट-स्लो फ्रेमवर्क है, जो स्पार्स कीफ्रेम्स पर मल्टीमॉडल सिमेंटिक अंडरस्टैंडिंग को बाद के फ्रेम्स में डेंस मास्क प्रेडिक्शन के लिए कुशल फीचर-स्पेस कंडीशनिंग से अलग करके, मोबाइल-ओरिएंटेड मॉडल्स की तुलना में 14 गुना तक कम लेटेंसी प्राप्त करता है।

मूल लेखक: Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने स्मार्टफोन से एक व्यस्त सड़क का दृश्य फिल्माने की कोशिश कर रहे हैं, और आप चाहते हैं कि आपका फोन हर चलती हुई कार, कुत्ते और व्यक्ति के चारों ओर तुरंत एक सटीक रूपरेखा (outline) बना दे, भले ही आप इसे ऐसी चीजें खोजने के लिए कहें जिन्हें इसने पहले कभी नहीं देखा है (जैसे कि "एक बैंगनी रंग का स्कूटर")। इसे ओपन-वोकैबुलरी वीडियो इंस्टेंस सेगमेंटेशन (Open-Vocabulary Video Instance Segmentation) कहा जाता है।

समस्या यह है कि इसे उच्च सटीकता के साथ करने के लिए एक सुपरकंप्यूटर की आवश्यकता होती है। मोबाइल फोन पर इतने भारी 'दिमाग' को चलाने से वीडियो लैग हो सकता है, अटक सकता है या फ्रीज हो सकता है।

यह पेपर एक नए सिस्टम SegFS (सेगमेंटिंग, फास्ट एंड स्लो) को पेश करता है जो एक "फास्ट और स्लो" टीम दृष्टिकोण का उपयोग करके इस समस्या को हल करता है। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए:

1. समस्या: "भारी दिमाग" की बाधा (The "Heavy Brain" Bottleneck)

वर्तमान उच्च-तकनीकी वीडियो सिस्टम एक मास्टर शेफ की तरह काम करते हैं जो परोसने से पहले सूप की हर एक सामग्री को चखता है।

  • शेफ (द स्लो पाथ - The Slow Path): यह भारी और सटीक हिस्सा है जो AI का। यह वीडियो को देखता है, आपके टेक्स्ट प्रॉम्प्ट (जैसे, "कुत्ता ढूंढो") को पढ़ता है, और बहुत सावधानी से यह पता लगाता है कि कुत्ता वास्तव में कैसा दिखता है और वह कहाँ है।
  • बाधा (The Bottleneck): यह शेफ अविश्वसनीय रूप से धीमा है। यदि आप उनसे हर एक सेकंड में 30 बार (हर फ्रेम में) सूप चखने के लिए कहते हैं, तो फोन गर्म हो जाएगा और वीडियो रुक जाएगा।

2. समाधान: "फास्ट और स्लो" टीम

मास्टर शेफ को हर एक फ्रेम चखने के लिए कहने के बजाय, SegFS काम को दो भूमिकाओं में विभाजित करता है:

स्लो पाथ: मास्टर शेफ (कीफ्रेम्स - Keyframes)

  • यह क्या करता है: यह भारी-भरत AI हर कुछ सेकंड में केवल एक फ्रेम (जैसे कि एक "कीफ्रेम") को देखता है।
  • कार्य: यह कठिन काम करता है। यह वस्तुओं की पहचान करता है, टेक्स्ट प्रॉम्प्ट को पढ़ता है, और उसके द्वारा पाई गई प्रत्येक वस्तु के लिए एक विस्तृत "आईडी कार्ड" (एम्बेडिंग) बनाता है। यह कहता है, "ठीक है, इस सटीक क्षण में, यहाँ एक कुत्ता है, और यहाँ एक बिल्ली है।"
  • उदाहरण: इसे एक दृश्य की उच्च-गुणवत्ता वाली फोटो लेने और उसमें मौजूद हर व्यक्ति का विस्तृत विवरण लिखने के रूप में सोचें।

फास्ट पाथ: त्वरित स्केच आर्टिस्ट (इंटर-फ्रेम्स - Inter-frames)

  • यह क्या करता है: यह हल्का AI कीफ्रेम्स के बीच के हर एक फ्रेम को देखता है।
  • कार्य: यह फिर से "सोचने" या टेक्स्ट को "पढ़ने" की कोशिश नहीं करता है। इसके बजाय, यह मास्टर शेफ द्वारा बनाए गए "आईडी कार्ड" लेता है और उन्हें एक गाइड के रूप में उपयोग करता है। यह कच्चे वीडियो पिक्सल को देखता है और पूछता है, "शेफ के नोट्स के आधार पर, वह कुत्ता अभी कहाँ है?"
  • चाल (The Trick): फास्ट पाथ बहुत चतुर है। यह जानता है कि छवि का बुनियादी "कंकाल" (आकार और किनारे) पहले से ही वीडियो डेटा में मौजूद है। इसे बस शेफ के निर्देशों के आधार पर रूपरेखा को "पेंट" करने की आवश्यकता है।
  • उदाहरण: कल्पना कीजिए कि मास्टर शेफ एक नक्शा बनाता है कि कुत्ता कहाँ है। स्केच आर्टिस्ट फिर अगले कुछ सेकंड के लिए उस नक्शे पर कुत्ते की गति को जल्दी से ट्रेस करता है। स्केच आर्टिस्ट इतना तेज़ है कि वह मास्टर शेफ के सूप चखने की गति से 14 गुना तेज़ी से चित्र बना सकता है।

3. वे एक-दूसरे से कैसे बात करते हैं

पेपर एक विशेष "इंजेक्शन" प्रक्रिया का वर्णन करता है।

  • जब मास्टर शेफ (स्लो पाथ) एक कुत्ते को पाता है, तो वह केवल एक तस्वीर नहीं भेजता। वह कुत्ते का एक डिजिटल फिंगरप्रिंट भेजता है।
  • स्केच आर्टिस्ट (फास्ट पाथ) इस फिंगरप्रिंट को लेता है और इसे सीधे कच्चे वीडियो डेटा में "इंजेक्ट" करता है।
  • यह स्केच आर्टिस्ट को तुरंत यह जानने में सक्षम बनाता है कि, "आह, यह बाईं ओर घूमती हुई धुंधली आकृति वही कुत्ता है जिसे शेफ ने पहचाना था।" उसे कुत्ते को फिर से पहचानने की आवश्यकता नहीं है; उसे बस फिंगरप्रिंट को ट्रैक करना है।

4. परिणाम: गुणवत्ता खोए बिना गति (Speed Without Losing Quality)

पेपर ने सैमसंग गैलेक्सी S25 अल्ट्रा (एक बहुत शक्तिशाली फोन) पर इसका परीक्षण किया।

  • गति: नया सिस्टम पिछले मोबाइल-फ्रेंडली मॉडलों की तुलना में 14 गुना तेज़ है। यह 30 फ्रेम प्रति सेकंड की दर से वीडियो प्रोसेस कर सकता है, जो स्मूथ रियल-टाइम वीडियो के लिए मानक है।
  • सटीकता: इतना तेज़ होने के बावजूद, यह धीमे और भारी मॉडलों के लगभग समान सटीक है। "स्केच आर्टिस्ट" बहुत कम गलतियाँ करता है क्योंकि वह "मास्टर शेफ" के विस्तृत नोट्स द्वारा निर्देशित होता है।
  • दक्षता (Efficiency): यह बैटरी और कंप्यूटिंग पावर की भारी बचत करता है क्योंकि भारी "चखने" (जटिल गणनाओं) की प्रक्रिया केवल दुर्लभ अंतराल पर होती है, जबकि "स्केचिंग" (हल्की गणनाओं) की प्रक्रिया लगातार होती रहती है।

सारांश

SegFS को एक कंडक्टर और एक ऑर्केस्ट्रा के रूप में समझें।

  • कंडक्टर (स्लो पाथ) हर कुछ सेकंड में मंच पर खड़ा होता है, संगीत की शीट को देखता है, और ऑर्केस्ट्रा को बताता है कि ठीक क्या बजाना है।
  • ऑर्केस्ट्रा (फास्ट पाथ) संगीत को निरंतर बजाता है, कंडक्टर के अंतिम निर्देश का पालन करता है, लेकिन पल के टेम्पो के अनुसार खुद को तुरंत ढाल लेता है।

"सोचने" (धीमी) को "करने" (तेज़) से अलग करके, यह सिस्टम बिना किसी सुपरकंप्यूटर की आवश्यकता के फोन पर रियल-टाइम वीडियो समझ को प्राप्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →