← नवीनतम पेपर
🤖 AI

PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding

पिक्सेलप्रून (PixelPrune) एक प्रशिक्षण-मुक्त, पिक्सेल-स्तरीय अनुकूली टोकन न्यूनीकरण विधि है जो विज़न ट्रांसफार्मर एनकोडर से पहले अनावश्यक इमेज पैच को हटाने के लिए प्रेडिक्टिव कोडिंग का लाभ उठाती है, जो दस्तावेज़ और GUI बेंचमार्क पर प्रतिस्पर्धी सटीकता बनाए रखते हुए विज़न-लैंग्वेज मॉडल्स के लिए प्रशिक्षण और अनुमान दोनों को महत्वपूर्ण रूप से तेज़ करती है।

मूल लेखक: Nan Wang, Zhiwei Jin, Chen Chen, Haonan Lu

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nan Wang, Zhiwei Jin, Chen Chen, Haonan Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन बहुत व्यस्त रोबोट सहायक को एक तस्वीर समझाने की कोशिश कर रहे हैं।

समस्या: "ज़रूरत से ज़्यादा समझाने वाला" रोबोट

वर्तमान AI मॉडल (जिन्हें विज़न-लैंग्वेज मॉडल कहा जाता है) उसी रोबोट की तरह हैं। वे अविश्वसनीय रूप से बुद्धिमान हैं, लेकिन उनमें एक बुरी आदत है: वे छवि के हर एक पिक्सेल का वर्णन करने की कोशिश करते हैं, यहाँ तक कि उबाऊ हिस्सों का भी।

एक दस्तावेज़ या कंप्यूटर स्क्रीन के बारे में सोचें।

  • उबाऊ हिस्से: विशाल सफेद मार्जिन, ठोस नीले टूलबार, खाली स्टेटस बार।
  • महत्वपूर्ण हिस्से: वास्तविक टेक्स्ट, एक छोटा बटन, एक चार्ट।

यदि आप इस रोबट को किसी वेबसाइट का 4K स्क्रीनशॉट देते हैं, तो यह छवि को 14,000 छोटे पहेली के टुकड़ों (टोकन) में काट सकता है। फिर यह हर एक टुकड़े का विश्लेषण करने की कोशिश करता है, यहाँ तक कि उन 10,000 टुकड़ों का भी जो केवल खाली सफेद स्थान हैं। यह ऐसा है जैसे किसी शेफ से यह सुनिश्चित करने के लिए सूप के हर दाने को चखने के लिए कहना कि सूप नमकीन है या नहीं। यह समय और ऊर्जा की भारी बर्बादी है।

समाधान: PixelPrune (एक "स्मार्ट एडिटर")

OPPO AI सेंटर के शोधकर्ताओं ने PixelPrune नामक एक टूल बनाया है। इसे एक सुपर-फास्ट, सुपर-स्मार्ट एडिटर के रूप में समझें जो रोबोट द्वारा छवि देखने से पहले ही खड़ा होता है।

यह कैसे काम करता है, इसके लिए एक सरल उपमा का उपयोग करें:

1. "कॉपी-पेस्ट" जासूस

कल्पना कीजिए कि आप एक समान सफेद टाइल्स की एक लंबी पंक्ति देख रहे हैं।

  • पुराना तरीका: आप पहली टाइल का वर्णन करते हैं, फिर दूसरी का, फिर तीसरी का... दस लाखवीं तक।
  • PixelPrune का तरीका: यह पहली टाइल को देखता है, फिर दूसरी को देखता है। यह कहता है, "अरे, यह दूसरी टाइल बिल्कुल पहली वाली के समान है। मुझे रोबोट को इसके बारे में बताने की ज़रूरत नहीं है। मैं बस रोबोट को बता दूँगा: 'इसे छोड़ दो, यह पिछले वाले की कॉपी है।'"

यह पूरी छवि के लिए ऐसा ही करता है। यदि स्क्रीन का एक पूरा हिस्सा केवल ठोस ग्रे बैकग्राउंड है, तो PixelPrune कहता है, "मैं जानता हूँ कि यह कैसा दिखता है। मैं इसका अनुमान लगा लूँगा। मैं इसे रोबोट को नहीं भेजूँगा।"

2. "प्रेडिक्टिव कोडिंग" का कमाल

यह तरीका प्रेडिक्टिव कोडिंग (वही गणित जिसका उपयोग PNG और JPEG फाइलों को छोटा बनाने के लिए किया जाता है) के एक पुराने विचार पर आधारित है।

  • उपमा: कल्पना कीजिए कि आप एक कहानी पढ़ रहे हैं जहाँ लेखक बार-बार एक ही वाक्य दोहराता है। एक स्मार्ट पाठक कहेगा, "मुझे पता है आगे क्या आने वाला है; यह पहले जैसा ही है," और उसे ज़ोर से पढ़ने से बच जाएगा।
  • जादू: PixelPrane एक पैच (टुकड़े) के पड़ोसियों (उसके बगल के हिस्से) को देखता है। यदि बाईं ओर का हिस्सा सफेद है, और ऊपर का हिस्सा सफेद है, तो वह अनुमान लगाता है कि वर्तमान हिस्सा भी सफेद होगा। यदि ऐसा है, तो वह उस टुकड़े को रोबोट को भेजी जाने वाली सूची से हटा (delete) देता है।

यह गेम-चेंजर क्यों है

1. यह भारी काम शुरू होने से पहले ही काम करता है
अन्य अधिकांश तरीके कोशिश करते हैं कि जब रोबोट ने पहले से ही सोचना शुरू कर दिया हो, उसके बाद काम कम किया जाए। यह कार के टकराने के बाद उसे रोकने की कोशिश करने जैसा है।
PixelPrune उन चीजों की सूची को इससे पहले काट देता है जिन्हें देखना है, इससे पहले कि रोबдно अपना इंजन शुरू करे।

  • परिणाम: रोबोट न केवल तेज़ी से काम करता है; बल्कि पूरी प्रक्रिया (छवि देखने से लेकर उत्तर देने तक) 4 गुना तेज़ हो जाती है।

2. यह "लॉसलेस" (गुणवत्ता में कोई गिरावट नहीं) है
क्योंकि PixelPrune अनुमान लगाने में इतना अच्छा है, इसलिए यह अक्सर छवि डेटा के 70% से 90% को बिना AI को पता चले हटा सकता है।

  • उपमा: कल्पना कीजिए कि आप अपने दोस्त को एक पत्र भेज रहे हैं। "आसमान नीला है, आसमान नीला है, आसमान नीला है" लिखने के बजाय, आप बस लिखते हैं "आसमान नीला है (x100)।" आपका दोस्त नोट पढ़ता है और उसे पूरी तरह समझ जाता है। जानकारी वही है; आपने बस कागज़ बर्बाद नहीं किया।

3. इसे ट्रेनिंग की आवश्यकता नहीं है
आमतौर पर, AI को तेज़ बनाने के लिए आपको हफ्तों तक उसे फिर से सिखाना पड़ता है। PixelPrune एक प्लग-एंड-प्ले फ़िल्टर की तरह है। आप इसे बस चालू करते हैं, और यह तुरंत समय बचाना शुरू कर देता है। इसे कुछ भी नया सीखने की ज़रूरत नहीं है; यह बस डुप्लिकेट्स को पहचानने के लिए गणित का उपयोग करता है।

वास्तविक दुनिया का प्रभाव

शोधकर्ताओं ने इसका परीक्षण किया:

  • दस्तावेज़: PDF, चार्ट और फॉर्म।
  • GUI: कंप्यूटर स्क्रीन और मोबाइल ऐप्स।

परिणाम:

  • गति: AI ने कार्यों को 4.2 गुना तेज़ी से पूरा किया।
  • मेमोरी: इसने 33% कम कंप्यूटर मेमोरी का उपयोग किया।
  • सटीकता: AI ने पहले की तरह ही सही उत्तर दिए, भले ही उसने बहुत कम पिक्सेल देखे हों।

सारांश

PixelPrune AI के लिए एक क्लब के बाउंसर की तरह है। 10,000 लोगों (पिक्सेल) को VIP रूम (AI मस्तिष्क) में जाने देने के बजाय, यह लिस्ट चेक करता है, देखता है कि 8,000 लोग पहले से अंदर मौजूद व्यक्ति के समान ही कपड़े पहने हुए हैं, और कहता है, "आप लोग बाहर इंतज़ार कर सकते हैं, हम जानते हैं कि आप कैसे दिखते हैं।"

AI को वही जानकारी मिलती है, लेकिन उसे भीड़ को प्रोसेस करने में ऊर्जा बर्बाद नहीं करनी पड़ती। यह तेज़ है, सस्ता है, और उतना ही स्मार्ट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →