OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models
ओम्नीफोकस (OmniFocus) एक प्रशिक्षण-मुक्त, क्वेरी-निर्देशित टोकन संपीड़न विधि है जो ओम्नी-मोडल लार्ज लैंग्वेज मॉडल्स के लिए ऑडियो और वीडियो टोकन के महत्व का स्वतंत्र रूप से आकलन करके मोडैलिटी-सिमेट्रिक संपीड़न प्राप्त करती है, जिससे क्रॉस-मोडल संरेखण को बनाए रखते हुए और सटीकता-दक्षता ट्रेड-ऑफ में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करते हुए अनुमान लागत को कम किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक (Omni-Modal Large Language Model) है जो एक साथ वीडियो देख सकता है और ऑडियो सुन सकता है। यह रोबोट अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन इसे एक समस्या है: जब आप इसे ध्वनि के साथ एक लंबा वीडियो दिखाते हैं, तो यह ट्रांसक्रिप्ट के हर एक शब्द को पढ़ने और वीडियो के हर एक फ्रेम को देखने की कोशिश करता है। यह बिल्कुल वैसा ही है जैसे किसी एक दृश्य में आसमान का रंग क्या था, इस सरल प्रश्न का उत्तर देने के लिए पूरी विश्वकोश (encyclopedia) को पढ़ने की कोशिश करना। इससे रोबोट धीमा हो जाता है, इसे चलाना महंगा हो जाता है, और यह बहुत अधिक जानकारी से घबरा जाता है।
यह शोध पत्र OmniFocus नामक एक नई विधि पेश करता है ताकि इस रोबोट को बिना फिर से प्रशिक्षित (retrain) किए तेज़ और स्मार्ट बनाया जा सके। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:
समस्या: "असंतुलित" मार्गदर्शक (The "Unbalanced" Guide)
पहले, शोधकर्ता इन रोबरों को वीडियो या ऑडियो के "उबाऊ" हिस्सों को अनदेखा करने के लिए कहकर उन्हें तेज़ बनाने की कोशिश करते थे। हालाँकि, वे आमतौर पर यह तय करने के लिए कि किसे अनदेखा करना है, एक इंद्रिय (sense) का उपयोग करते थे।
- दोष: कल्पना कीजिए कि आप एक कुकिंग शो देख रहे हैं। यदि आप केवल शेफ की आवाज़ को यह तय करने के लिए सुनते हैं कि वीडियो के कौन से हिस्से महत्वपूर्ण हैं, तो आप एक महत्वपूर्ण दृश्य चरण को मिस कर सकते हैं (जैसे "बर्तन उबल रहा है") क्योंकि शेफ ने अभी तक उसके बारे में नहीं बताया है। इसके विपरीत, यदि आप केवल वीडियो देखते हैं, तो आप एक सूक्ष्म ध्वनि (जैसे पैन में कुछ छनने की आवाज़) को मिस कर सकते हैं जो बताती है कि खाना जल रहा है।
- परिणाम: रोबोट ऑडियो संबंधी प्रश्नों के उत्तर देने में तो अच्छा हो जाता लेकिन विजुअल (दृश्य) संबंधी प्रश्नों में खराब हो जाता, या इसके विपरीत। यह उस इंद्रिय के प्रति "पक्षपाती" (biased) था जिसका उपयोग वह गाइड के रूप में कर रहा था।
समाधान: OmniFocus (द "क्वेरी डिटेक्टिव")
OmniFocus इसे एक डिटेक्टिव (जासूस) की तरह हल करता है जो किसी भी चीज़ को रखने का निर्णय लेने से पहले आपके विशिष्ट प्रश्न (क्वेरी) को सुनता है।
पहले प्रश्न को सुनना:
किसी चीज़ का अनुमान लगाने के बजाय, OmniFocus पहले आपके प्रश्न को देखता है। यदि आप पूछते हैं, "वक्ता ने बजट के बारे में क्या कहा?", तो डिटेक्टिव जानता है कि उसे ऑडियो पर ध्यान केंद्रित करना है। यदि आप पूछते हैं, "कार का रंग क्या था?", तो वह जानता है कि उसे वीडियो पर ध्यान केंद्रित करना है।दो अलग-अलग टीमें (Modality-Balanced):
यह विधि वीडियो और ऑडियो के साथ दो अलग-अलग टीमों की तरह व्यवहार करती है। यह टीम वीडियो से पूछती है: "इस वीडियो के कौन से हिस्से प्रश्न से मेल खाते हैं?" और टीम ऑडियो से पूछती है: "इस ऑडियो के कौन से हिस्से प्रश्न से मेल खाते हैं?"
- उपमा: कल्पना कीजिए कि आप यात्रा के लिए एक सूटकेस पैक कर रहे हैं। केवल "कपड़ों" के दराज (वीडियो) या "जूतों" के दराज (ऑडियो) से सब कुछ फेंकने के बजाय, आप अपने यात्रा कार्यक्रम (itinerary) को देखते हैं। आप केवल वही जूते पैक करते हैं जिनकी आपको हाइकिंग के लिए आवश्यकता है और वह जैकेट जिसे आपको बारिश के लिए चाहिए। आप पूरा दराज पैक नहीं करते; आप केवल वही पैक करते हैं जिसकी यात्रा के लिए आवश्यकता है।
- "डुअल-स्कोर" चयन (The "Dual-Score" Selection):
एक बार जब डिटेक्टिव जान लेता है कि समय के कौन से हिस्से (chunks) महत्वपूर्ण हैं, तो वह दो नियमों का उपयोग करके रखने के लिए विशिष्ट "टोकन" (डेटा के अंश) चुनता है:
- नियम A (हैंडशेक): उन हिस्सों को रखें जहाँ वीडियो और ऑडियो सहमत होते हैं या मेल खाते हैं (जैसे, दरवाज़ा बंद होने के दृश्य के साथ दरवाज़ा टकराने की आवाज़ का मेल खाना)।
- नियम B (स्टैंडआउट): उन हिस्सों को रखें जो अपनी ही श्रेणी के भीतर अद्वितीय या तेज़ (loud) हैं (जैसे, ऑडियो में एक बहुत ही विशिष्ट ध्वनि, या वीडियो में एक चमकता हुआ फ्लैश), भले ही दूसरी इंद्रिय के पास कोई मेल खाने वाला संकेत न हो।
परिणाम: तेज़ और स्मार्ट
शोधकर्ताओं ने इन "रोबोटों" (Qwen2.5-Omni फैमिली) पर परीक्षण किया।
- दक्षता (Efficiency): उन "उबाऊ" हिस्सों को हटाकर जो प्रश्न से मेल नहीं खाते, रोबोट 1.38 गुना तेज़ चलता है और कम मेमोरी का उपयोग करता है।
- सटीकता (Accuracy): भले ही उन्होंने 75% डेटा फेंक दिया (केवल 25% रखा), रोबोट ने पिछले तरीकों की तुलना में प्रश्नों के उत्तर बेहतर दिए। इसने अपना "कॉमन सेंस" नहीं खोया क्योंकि इसने वीडियो और ऑडियो दोनों से सबसे महत्वपूर्ण सुरागों को बनाए रखा।
सारांश में
OmniFocus एक स्मार्ट फ़िल्टर की तरह है जो रोबोट के सामने बैठता है। केवल एक इंद्रिय के आधार पर डेटा को अंधाधुंध हटाने के बजाय, यह आपके प्रश्न को सुनता है, वीडियो और ऑडियो दोनों की अलग-अलग जाँच करता है, और केवल सबसे प्रासंगिक "सुरागों" को रखता है। यह रोबोट को तेज़ बनाता है, इसे चलाना सस्ता बनाता है, और आश्चर्यजनक रूप से अधिक सटीक बनाता है क्योंकि यह अप्रासंगिक शोर से विचलित नहीं होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।