Active Perception Agent for Omnimodal Audio-Video Understanding
OmniAgent पहले पूर्णतः सक्रिय धारणा एजेंट (fully active perception agent) को पेश करता है जो विशिष्ट एकरूपी (unimodal) उपकरणों को गतिशील रूप से व्यवस्थित करता है और बिना प्रशिक्षण के अत्याधुनिक सर्वव्यापी (omnimodal) ऑडियो-वीडियो समझ प्राप्त करने के लिए एक नवीन मोटे-से-सूक्ष्म (coarse-to-fine) ऑडियो-निर्देशित प्रतिमान का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक लंबी, शोर भरी फिल्म में एक रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास एक सवाल है: "उस दुकान के साइन बोर्ड का नाम क्या था जिसका जिक्र पात्र ने बिल्ली के बच्चे के म्याऊं करने से ठीक पहले किया था?"
यदि आप एक मानक AI (जैसे कि एक विशिष्ट "OmniLLM") से पूछते हैं, तो यह पूरी फिल्म को एक साथ देखने और पूरे साउंडट्रैक को एक साथ सुनने और फिर उत्तर का अनुमान लगाने जैसा है। वे अभिभूत हो सकते हैं, उस विशिष्ट क्षण को मिस कर सकते हैं जब बिल्ली का बच्चा म्याऊं किया था, या दुकान के साइन को किसी और चीज़ के साथ भ्रमित कर सकते हैं। वे सब कुछ एक साथ प्रोसेस करने की कोशिश करते हैं, जिससे अक्सर गलतियाँ होती हैं।
मिलिए OmniAgent से।
यह पेपर पेश करता है कि OmniAgent एक सुपर-स्मार्ट जासूस की तरह है जो केवल फिल्म को निष्क्रिय रूप से "देखता" नहीं है। इसके बजाय, यह जासूस सक्रिय रूप से कदम-दर-कदम जांच करता है, और यह तय करता है कि उसे कब देखना है और कब सुनना है।
यहाँ बताया गया है कि OmniAgent कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. जासूस का टूलकिट (द "टूल्स")
एक विशाल मस्तिष्क होने के बजाय जो एक साथ सब कुछ करने की कोशिश करता है, OmniAgent के पास विशेष गैजेट्स वाला एक टूलबॉक्स है:
- "कान" (ऑडियो टूल्स): ये लोग जो कह रहे हैं उसे तुरंत ट्रांसक्राइब कर सकते हैं और, सबसे महत्वपूर्ण बात यह है कि वे जासूस को बता सकते हैं कि कोई ध्वनि ठीक कब हुई (जैसे बिल्ली के बच्चे का म्याऊं करना)।
- "आंखें" (वीडियो टूल्स): ये पूरी फिल्म को जल्दी से स्कैन करके उसका सार समझ सकते हैं, या बारीकियों को देखने के लिए किसी विशिष्ट 10-सेकंड के क्लिप पर ज़ूम कर सकते हैं (जैसे दीवार पर लगे साइन को पढ़ना)।
- "सर्च इंजन" (इवेंट टूल्स): यह जासूस का गुप्त हथियार है। यह ऑडियो सुनता है और "महत्वपूर्ण क्षणों" का एक मानचित्र बनाता है (जैसे "1:48 पर म्याऊं," "2:10 पर हंसी")।
2. जांच प्रक्रिया (द "लूप")
OmniAgent "सोचें-कार्य करें-अवलोकन करें-चिंतन करें" (Think-Act-Observe-Reflect) नामक एक चक्र का पालन करता है। यहाँ यह पेपर के उदाहरण से रहस्य को कैसे सुलझाता है:
- चरण 1: सुराग (सोचें और कार्य करें): जासूस को "बिल्ली के बच्चे" के बारे में प्रश्न मिलता है। पूरी फिल्म को दोबारा देखने के बजाय, यह अपने ऑडियो सर्च इंजन का उपयोग करता है। यह ऑडियो को स्कैन करता है और कहता है, "आह! मैं 1:48 और 1:49 के बीच बिल्ली के बच्चे के म्याऊं करने की आवाज़ सुन सकता हूँ।"
- चरण 2: संदर्भ (अवलोकन करें): अब इसे पता है कि कब देखना है। यह ऑडियो टूल से पूछता है: "म्याऊं से ठीक पहले क्या कहा जा रहा था?" टूल जवाब देता है: "पात्र ने कहा, 'ओह, नान के (Nán Kē), मैंने कोनन (Conan) देखा...'"
- चरण 3: सत्यापन (चिंतन करें और कार्य करें): अब जासूस के पास "नान के" और "कोनन" शब्दों के बारे में एक संदेह है। वह वीडियो क्लिप टूल का उपयोग करके उसी सटीक क्षण (1:30–1:40) पर वीडियो को ज़ूम इन करने का निर्णय लेता है। वह स्क्रीन को ध्यान से देखता है और एक साइन देखता है जिस पर "नान के" लिखा है।
- चरण 3: निष्कर्ष (चिंतन करें): जासूस डॉट्स को जोड़ता है: ऑडियो ने "नान के" का उल्लेख किया, और वीडियो ने "नान के" लिखा हुआ एक साइन दिखाया। वह महसूस करता है कि "नान के" एक पुरानी चीनी कहानी का संदर्भ है, और "कोनन" एक जापानी एनीमे है। वह आत्मविश्वास के साथ प्रश्न का उत्तर देता है।
3. यह दूसरों से बेहतर क्यों है
पेपर OmniAgent की तुलना अन्य मॉडलों (जैसे Qwen3-Omni या Gemini) से करता है और पाता है कि OmniAgent सूक्ष्म समझ (fine-grained understanding) में बहुत बेहतर है।
- पुराना तरीका (निष्क्रिय): कल्पना कीजिए कि आप एक किताब पढ़ने की कोशिश कर रहे हैं जबकि कोई आप पर चिल्ला रहा है, और आपको बिना किसी विशिष्ट पृष्ठ को चेक किए उत्तर का अनुमान लगाना है। आप गलत हो सकते हैं।
- OmniAgent का तरीका (सक्रिय): कल्पना कीजिए कि एक जासूस कहता है, "रुको, मुझे समय खोजने के लिए पहले ऑडियो चेक करने की ज़रूरत है। ठीक है, अब मुझे समय पता है। अब, मुझे उस जगह पर वीडियो को रोकना चाहिए और ज़ूम करना चाहिए ताकि मैं टेक्स्ट पढ़ सकूँ।"
मुख्य निष्कर्ष
पेपर का दावा है कि AI को यह सक्रिय रूप से चुनने देकर कि उसे सुनना है या देखना है, और वीडियो को देखने के सटीक समय को खोजने के लिए ऑडियो का उपयोग करके, यह उन समस्याओं को हल करता है जिन्हें अन्य मॉडल गलत करते हैं।
परीक्षणों में (डेली-ओमनी और वर्ल्डसेंस जैसे बेंचमार्क पर), OmniAgent ने मौजूदा सर्वश्रेष्ठ मॉडलों की तुलना में 10% से 20% अधिक प्रश्न सही किए, भले ही इसे फिर से प्रशिक्षित करने की आवश्यकता नहीं थी। इसने साबित कर दिया कि एक "स्मार्ट जासूस" होना जो जानता है कि अपने कानों का उपयोग कब करना है और अपनी आंखों का उपयोग कब करना है, केवल एक "बड़े मस्तिष्क" होने से बेहतर है जो एक साथ सब कुछ करने की कोशिश करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।