← नवीनतम पेपर
💻 computer science

3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio

VIRST-Audio एक व्यावहारिक ढांचा है जिसने सेगमेंटेशन के लिए ASR के माध्यम से ऑडियो क्वेरी को टेक्स्ट में बदलकर और मतिभ्रम (hallucinated) मास्क को कम करने तथा मजबूती बढ़ाने के लिए एक अस्तित्व-जागरूक गेटिंग तंत्र (existence-aware gating mechanism) का उपयोग करके 5वें PVUW चैलेंज के MeViS-Audio ट्रैक में तीसरा स्थान प्राप्त किया है।

मूल लेखक: Jihwan Hong, Jaeyoung Do

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jihwan Hong, Jaeyoung Do

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं, लेकिन केवल एक्शन देखने के बजाय, आपका एक दोस्त आपके कान में निर्देश फुसफुसा रहा है। आपका दोस्त कह सकता है, "लाल गेंद के पीछे भागते हुए कुत्ते को ढूँढो," या "मुझे कोने में रो रहा हुआ व्यक्ति दिखाओ।"

आपका काम है अपनी उंगली से स्क्रीन की ओर इशारा करना और ठीक उसी चीज़ या व्यक्ति को फ्रेम-दर-फ्रेम ट्रेस करना जिसके बारे में वे बात कर रहे हैं। यही ऑडियो-बेस्ड रेफरिंग वीडियो ऑब्जेक्ट सेगमेंटेशन (ARVOS) की चुनौती है।

आप जिस पेपर के बारे में बता रहे हैं, वह एक टीम (SNU AIDAS) के बारे में है जिसने VIRST-Audio नामक एक रोबोट बनाया। उन्होंने केवल एक रोबोट नहीं बनाया; उन्होंने एक चतुर "अनुवादक" (translator) बनाया जिसने उन्हें एक प्रमुख प्रतियोगिता में तीसरा स्थान दिलाया।

उन्होंने इसे कैसे किया, यहाँ सरल अवधारणाओं में दिया गया है:

1. "अनुवादक" वाली तरकीब (ASR मॉड्यूल)

अधिकांश रोबट टेक्स्ट समझने में बहुत अच्छे होते हैं लेकिन आवाज़ समझने में बहुत खराब। यदि आप किसी रोबट से बात करते हैं, तो उसे केवल शोर सुनाई दे सकता है।

  • समस्या: प्रतियोगिता ने रोबोट को ऑडियो क्लिप्स (लोग बोल रहे हैं) दिए। रोबोट को यह जानने की ज़रूरत थी कि क्या कहा जा रहा है ताकि वह वस्तु को ढूँढ सके।
  • समाधान: टीम ने रोबोट को सीधे आवाज़ समझने के लिए नहीं सिखाया। इसके बजाय, उन्होंने उसे एक अनुवादक (जिसे ASR मॉड्यूल कहा जाता है) दिया।
  • उपमा: कल्पना कीजिए कि आप एक शेफ हैं जो केवल अंग्रेजी में रेसिपी पढ़ना जानते हैं। कोई आपको फ्रेंच में लिखी हुई रेसिपी थमाता है। फ्रेंच सीखने के बजाय, आप एक अनुवादक को काम पर रखते हैं जो तुरंत उस फ्रेंच को अंग्रेजी में बदल देता है। अब, आप व्यंजन को पूरी तरह से बना सकते हैं क्योंकि आप बस अंग्रेजी रेसिपी का पालन कर रहे हैं।
  • यह कैसे काम करता है: रोबोट आवाज़ सुनता है, अनुवादक उसे टेक्स्ट में बदल देता है (जैसे, "बिल्ली"), और फिर रोबोट अपने मौजूदा "टेक्स्ट-पढ़ने वाले" दिमाग का उपयोग करके वीडियो में बिल्ली को ढूँढता है। इसने उन्हें एक ऐसे मॉडल का उपयोग करने की अनुमति दी जिसे टेक्स्ट पर प्रशिक्षित किया गया था और बिना हज़ारों ऑडियो उदाहरणों की आवश्यकता के इसे ऑडियो पर लागू करने में मदद की।

2. "एग्ज़िस्टेंस गेट" (भ्रम/Hallucinations को रोकना)

इस खेल का सबसे कठिन हिस्सा केवल वस्तु को ढूँढना नहीं है; बल्कि यह जानना भी है कि जब कुछ भी मौजूद न हो तो क्या करना है।

  • समस्या: कभी-कभी ऑडियो कहता है, "उड़ते हुए हाथी को ढूँढो।" यदि वीडियो में केवल एक कुत्ता है, तो एक खराब रोबोट भ्रमित हो सकता है और कुत्ते के चारों ओर मास्क बनाने की कोशिश कर सकता है, यह सोचकर, "शायद कुत्ता ही हाथी है?" इसे हैलुसिनेशन (hallucination) कहा जाता है।
  • समाधान: टीम ने रोबोट के दिमाग के प्रवेश द्वार पर एक विशेष सुरक्षा गार्ड ("Existence-Aware Gating Mechanism") जोड़ा।
  • उपमा: एक क्लब के बाउंसर (bouncer) के बारे में सोचें। रोबोट द्वारा वस्तु को खोजने का प्रयास करने से पहले, बाउंसर गेस्ट लिस्ट की जाँच करता है।
    • यदि ऑडियो कहता है "बिल्ली को ढूँढो" और वहाँ एक बिल्ली है, तो बाउंसर कहता है, "जाओ, उन्हें अंदर आने दो!"
    • यदि ऑडियो कहता है "बिल्ली को ढूँढो" लेकिन वहाँ कोई बिल्ली नहीं है, तो बाउंसर कहता है, "रुको! प्रवेश निषेध!" और रोबोट एक खाली स्क्रीन आउटपुट देता है।
  • यह क्यों मायने रखता है: यह रोबोट को ऐसी चीज़ें बनाने से रोकता है जो वहाँ मौजूद ही नहीं हैं, जो वास्तविक दुनिया में विश्वसनीयता के लिए बहुत महत्वपूर्ण है।

3. परिणाम: एक स्मार्ट, अनुकूलन योग्य रोबोट

अनुवादक (ऑडियो \to टेक्स्ट) और सुरक्षा गार्ड (अस्तित्व की जाँच) को जोड़कर, VIRST-Audio एक बहुत ही मजबूत प्रतियोगी बन गया।

  • प्रतियोगिता: उन्होंने 5वीं PVUW चुनौती में भाग लिया, एक ऐसी प्रतियोगिता जहाँ टीमें वीडियो समझने की सबसे कठिन समस्याओं को हल करने की कोशिश करती हैं।
  • स्कोर: वे 13 टीमों में से तीसरे स्थान पर आए।
  • जादू: सबसे प्रभावशाली बात यह है कि उन्हें रोबोट को विशेष रूप से ऑडियो डेटा पर प्रशिक्षित करने की आवश्यकता नहीं थी। उन्होंने बस उसे टेक्स्ट पढ़ना सिखाया, उसे एक अनुवादक दिया, और उसने खुद समझ लिया कि ऑडियो को कैसे संभालना है।

सारांश

VIRST-Audio को एक स्मार्ट सहायक के रूप में समझें जो:

  1. एक वॉयस कमांड को सुनता है।
  2. उस आवाज़ को एक टेक्स्ट नोट में अनुवादित करता है।
  3. जाँच करता है कि उल्लेखित चीज़ वास्तव में कमरे में है या नहीं।
  4. यदि वह वहाँ है तो उसकी ओर इशारा करता है, या यदि नहीं है तो कंधे उचका देता है।

यह दृष्टिकोण सरल, कुशल है, और यह साबित करता है कि आपको हर नए कार्य के लिए हमेशा एक विशाल, विशिष्ट मस्तिष्क की आवश्यकता नहीं होती है; कभी-कभी, आपको बस एक अच्छे अनुवादक और थोड़े सामान्य ज्ञान की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →