← नवीनतम पेपर
💻 computer science

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

OmniPack एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो प्री-LLM संरचनात्मक अतिरेक हटाने (structural redundancy removal) को पोस्ट-इंटरेक्शन सिमेंटिक रिफाइनमेंट के साथ जोड़कर ओम्नी-मोडल लार्ज लैंग्वेज मॉडल्स की दक्षता को बढ़ाता है, जिससे कई बेंचमार्क पर बेहतर प्रदर्शन-दक्षता ट्रेड-ऑफ प्राप्त होता है और कंप्यूटिंग लागत में महत्वपूर्ण कमी आती है।

मूल लेखक: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

प्रकाशित 2026-08-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। आप उसे सिर्फ एक किताब पढ़ने के लिए नहीं देते; आप उसे एक फिल्म दिखाते हैं और साथ में एक साउंडट्रैक भी बजाते हैं। यह "ओमनी-मोडल" (Omni-modal) AI की रोमांचक दुनिया है, जहाँ कंप्यूटर एक साथ देखना, सुनना और पढ़ना सीखता है। लेकिन यहाँ एक पेंच है: फिल्में और साउंडट्रैक बहुत विशाल होते हैं। वीडियो या ऑडियो का एक सेकंड भी हजारों छोटे डिजिटल "ईंटों" में तोड़ा जा सकता है जिन्हें "टोकन" कहा जाता है। यदि आप पूरे रोबोट को एक पूरी फिल्म खिलाने की कोशिश करते हैं, तो वह अभिभूत हो जाता है, जैसे कोई छात्र एक मिनट में पूरी लाइब्रेरी पढ़ने की कोशिश कर रहा हो। इसे प्रोसेस करने में बहुत समय लगता है, बिजली का भारी खर्च आता है, और अक्सर जानकारी की इस विशाल मात्रा के कारण वह भ्रमित हो जाता है। वैज्ञानिक इससे निपटने के लिए रोबोट के पढ़ने से पहले ही "बोरिंग" ईंटों को फेंक देने की कोशिश कर रहे हैं, इस उम्मीद में कि केवल महत्वपूर्ण चीज़ों को ही रखा जाए। हालाँकि, चीजों को फेंक देने के पुराने तरीके थोड़े अनाड़ी थे—वे कभी-कभी महत्वपूर्ण सुरागों को भी इसलिए फेंक देते थे क्योंकि वे अपने पड़ोसियों से अलग दिखते थे, या वे रोबोट को कहानी समझने का मौका दिए बिना ही यह अनुमान लगाने की कोशिश करते थे कि क्या महत्वपूर्ण है।

यहाँ OmniPack आता है, जो एक नई, चतुर रणनीति है जिसे इन सर्वद्रष्टा, सर्वश्रोता रोबोटों को बिना अपना मानसिक संतुलन खोए तेज़ी से काम करने में मदद करने के लिए डिज़ाइन किया गया है। OmniPack को एक अराजक मूवी स्क्रिप्ट के दो-चरणीय संपादन (editing) प्रक्रिया के रूप में समझें। सबसे पहले, इससे पहले कि रोबोट स्क्रिप्ट पढ़ता है, OmniPack एक सख्त संपादक की तरह कच्चे फुटेज को स्कैन करता है। यह केवल शांत हिस्सों को ही डिलीट नहीं करता; यह "तेज़" क्षणों (जैसे अचानक हुई टक्कर या तेज़ चमक) को भी देखता है और यह भी सुनिश्चित करता है कि वह समय के अंतराल में दूर स्थित शांत लेकिन महत्वपूर्ण पृष्ठभूमि के दृश्यों को न छोड़ दे। यह समान ईंटों को एक साथ समूहबद्ध करता है ताकि वे अतिरिक्त जगह न घेरें, जिससे एक "हाइलाइट रील" तैयार होती है जो कहानी की संरचना को बरकरार रखती है।

लेकिन असली जादू दूसरे चरण में होता है। एक बार जब रोबोट ने स्क्रिप्ट पढ़ना और खुद से बात करना शुरू कर दिया होता है, तब OmniPack फिर से हस्तक्षेप करता है। इस बार, वह रोबोट के सवालों को सुनता है। यदि रोबोट पूछ रहा है, "कार का रंग क्या था?", तो OmniPack जानता है कि कार और रंग से संबंधित टोकन को बनाए रखना है, भले ही वे शांत या छोटे क्यों न हों। यह जानकारी को परिष्कृत करने के लिए रोबोट की अपनी जिज्ञासा का उपयोग करता है, सबसे उपयोगी विवरणों को आपस में मिला देता है। इसका परिणाम यह है कि रोबोट को किए जाने वाले काम में भारी कमी आती है। Qwen2.5-Omni-7B नामक एक विशिष्ट मॉडल पर, OmniPack ने काम की मात्रा को मूल मात्रा के मात्र 16.7% तक सिकोड़ दिया, जबकि रोबोट की मूल बुद्धिमत्ता का 98.0% हिस्सा बरकरार रखा। यहाँ तक कि जब उन्होंने सीमाओं को पार करते हुए काम को घटाकर मात्र 6.8% कर दिया, तब भी रोबोट जो कुछ भी जानने वाला था, उसका 92.9% याद रख सका। यह एक विशाल विश्वकोश को एक छोटी पुस्तिका में सिकोड़ने जैसा है, लेकिन किसी तरह, उस पुस्तिका में वे सभी उत्तर मौजूद हैं जिनकी आपको आवश्यकता है।

शोधकर्ताओं ने पाया कि पुराने तरीके अक्सर विफल हो जाते थे क्योंकि वे या तो सब कुछ बहुत जल्दी या बहुत सरलता से कंप्रेस करने की कोशिश करते थे। उन्होंने तर्क दिया कि केवल "तेज़" या "समानता" के आधार पर टोकन को फेंक देने से अक्सर महत्वपूर्ण, बिखरे हुए सुराग छूट जाते थे। उन्होंने यह भी दिखाया कि रोबol को दोनों इंद्रियों को आपस में मिलाने का मौका दिए बिना ऑडियो का उपयोग वीडियो को कंप्रेस करने के लिए (या इसके विपरीत) करने से काम नहीं बनता। इसके बजाय, OmniPack एक "स्टेज-स्पेशलाइज्ड" (चरण-विशिष्ट) दृष्टिकोण का सुझाव देता है: पहले, विशिष्ट प्रकार के मीडिया (वीडियो या ऑडियो) के आधार पर संरचना को साफ करें, और फिर, जब रोबोट को दोनों को मिलाने का मौका मिल जाए, तो अंतिम, स्मार्ट कंप्रेशन के लिए विशिष्ट कार्य या प्रश्न का उपयोग करें।

पाँच अलग-अलग चुनौती सेटों में अपने परीक्षणों के दौरान, OmniPack ने उन सभी तरीकों को लगातार मात दी जिनसे इसकी तुलना की गई थी। चाहे वे छोटे क्लिप्स का परीक्षण कर रहे हों या लंबे वीडियो का, नया तरीका हमेशा गति और बुद्धिमत्ता के बीच सबसे अच्छा संतुलन प्रदान करता था। लेखक सुझाव देते हैं कि इन दो चरणों को समन्वित करके—पहले संरचनात्मक सफाई, फिर स्मार्ट, प्रश्न-जागरूक परिशोधन—वे इन शक्तिशाली AI मॉडलों को बिना उन्हें फिर से प्रशिक्षित किए बहुत अधिक कुशल बना सकते हैं। यह इन सुपर-स्मार्ट रोबोटों को चलाने के लिए तेज़ और सस्ता बनाने का एक तरीका है, जिससे वे तब भी पैने बने रहते हैं जब सूचनाओं का सैलाब उमड़ रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →