← नवीनतम पेपर
💻 computer science

EarlyTom: Early Token Compression Completes Fast Video Understanding

यह शोध पत्र EarlyTom का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो विजन एनकोडर के भीतर प्रारंभिक-चरण के विजुअल टोकन संपीड़न (visual token compression) को निष्पादित करता है ताकि पूर्ण-टोकन बेसलाइन के समान सटीकता बनाए रखते हुए टाइम-टू-फर्स्ट-टोकन विलंबता और कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम किया जा सके।

मूल लेखक: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

प्रकाशित 2026-05-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक 30 मिनट की फिल्म का वर्णन करने की कोशिश कर रहे हैं अपने एक बहुत ही बुद्धिमान, लेकिन बहुत व्यस्त दोस्त (AI) को। आपके दोस्त को अपने सवालों के जवाब देने से पहले पूरी फिल्म देखनी होगी।

समस्या: "धीमी शुरुआत" (The "Slow Start")
वर्तमान में, जब AI किसी वीडियो को समझने की कोशिश करता है, तो वह एक ऐसे छात्र की तरह व्यवहार करता है जो एक भी सवाल का जवाब देने से पहले किताब का हर एक पन्ना पढ़ने पर अड़ा रहता है।

  • पुराना तरीका: AI वीडियो के हर एक फ्रेम को देखता है, उसे हजारों छोटे टुकड़ों (टोकन) में तोड़ता है, और फिर उस विशाल ढेर को अपने "दिमाग" (लार्ज लैंग्वेज मॉडल) को प्रोसेस करने के लिए सौंप देता है।
  • रुकावट (The Bottleneck): पेपर में यह पता चला है कि सबसे बड़ी देरी AI के सोचने के समय में नहीं है; बल्कि वीडियो को देखने और व्यवस्थित करने में लगने वाले समय में है। यह ताश की गड्डी खेलने से पहले उसे 40 मिनट तक छांटने जैसा है। भले ही अन्य तरीकों ने बाद में कुछ कार्ड्स फेंकने की कोशिश की, लेकिन शुरुआती छंटनी अभी भी धीमी थी।

समाधान: EarlyTom (द "स्मार्ट एडिटर")
लेखकों ने EarlyTom नामक एक नया तरीका बनाया है। EarlyTom को एक सुपर-एफिशिएंट फिल्म एडिटर के रूप में समझें जो वीडियो देखे जाने के दौरान ही हस्तक्षेप करता है, न कि उसके बाद।

वीडियो को पूरी तरह प्रोसेस होने के बाद यह तय करने के बजाय कि क्या रखना है, EarlyTom वीडियो को देखने की प्रक्रिया के दौरान ही एडिट करता है। यह दो मुख्य तरकीबों का उपयोग करता है:

1. "मर्ज" करने की तरकीब (समय का संपीड़न - Time Compression)
कल्पना कीजिए कि आप एक वीडियो देख रहे हैं जहाँ एक व्यक्ति 10 सेकंड तक स्थिर खड़ा होकर बात कर रहा है। उस वीडियो में उसी व्यक्ति के 300 फ्रेम्स हैं।

  • पुराना तरीका: AI उन सभी 300 फ्रेम्स को व्यक्तिगत रूप से प्रोसेस करता है।
  • EarlyTom: यह नोटिस करता है, "अरे, ये 300 फ्रेम्स लगभग एक जैसे हैं।" उन्हें सभी प्रोसेस करने के बजाय, यह उन्हें एक एकल, उच्च-गुणवत्ता वाले सारांश फ्रेम में मर्ज कर देता है। यह एक 10 मिनट के मोनोलॉग को आगे भेजने से पहले एक वाक्य में सारांशित करने जैसा है। यह काम विजन एनकोडर (कैमरा लेंस) के अंदर होता है, जिससे भारी काम बहुत तेज़ी से हो जाता है।

2. "स्पॉटलाइट" की तरकीब (स्थान का चयन - Space Selection)
अब कल्पना कीजिए कि AI को भीड़ में मौजूद लोगों को देखना है।

  • जाल (The Trap): पेपर में पाया गया कि AI में एक अजीब आदत होती है जिसे "अटेंशन सिंकिंग" (Attention Sinking) कहते हैं। यह एक स्पॉटलाइट की तरह है जो कुछ विशिष्ट स्थानों (जैसे एक खाली दीवार या लोगो) पर अटक जाती है और उन पर बहुत अधिक रोशनी डालती है, जिससे वह बाकी जगहों पर हो रही वास्तविक गतिविधि को अनदेखा कर देती है। यदि आप केवल "सबसे चमकीले" स्थानों को चुनते हैं, तो आप महत्वपूर्ण क्रिया को मिस कर सकते हैं।
  • EarlyTom का समाधान: यह भीड़ को दो समूहों में विभाजित करता है:
    • "मूविंग" (गतिशील) समूह: वीडियो के उन हिस्सों के लिए जहाँ चीजें बदल रही हैं (एक्शन), यह वैश्विक स्तर पर सबसे महत्वपूर्ण विवरण चुनता है।
    • "स्टिल" (स्थिर) समूह: उन हिस्सों के लिए जहाँ चीजें स्थिर हैं, यह एक स्थानीय "विंडो" दृष्टिकोण का उपयोग करता है ताकि यह सुनिश्चित हो सके कि वह अटकी हुई स्पॉटलाइट से विचलित न हो। यह सुनिश्चित करता है कि AI के पास एक संतुलित दृश्य हो और वह उन अटके हुए स्पॉट्स के प्रति पक्षपाती न हो।

परिणाम: बुद्धिमत्ता खोए बिना गति (Speed Without Losing Smarts)
प्रक्रिया के शुरुआत में ही यह एडिटिंग करने से, EarlyTom दो अद्भुत चीजें हासिल करता है:

  1. सुपर फास्ट स्टार्ट: यह पहले उत्तर तक पहुँचने के समय (Time-to-First-Token) को 2.65 गुना तक कम कर देता है। यदि पुराने तरीके में 900 मिलीसेकंड लगते, तो इसमें लगभग 336 मिलीसेकंड लगेंगे।
  2. कम काम: यह कुल कंप्यूटिंग पावर की आवश्यकता को 61% तक कम कर देता है।

निष्कर्ष (The Bottom Line)
पेपर का दावा है कि EarlyTom वीडियो AI को बिना दोबारा प्रशिक्षित किए या उसकी सटीकता खोए बिना अविश्वसनीय रूप से तेज़ और कुशल बनाता है। यह साबित करता है कि कहानी समझने के लिए आपको हर एक फ्रेम देखने की ज़रूरत नहीं है; आपको बस यह जानने की ज़रूरत है कि कब देखना बंद करना है और सोचना शुरू करना है।

संक्षेप में: EarlyTom एक ट्रेनिंग-फ्री टूल है जो वीडियो को देखते समय ही एडिट करता है, जिससे वीडियो AI तेजी से और कम खर्च में चलता है, जबकि उसके जवाब उतने ही स्मार्ट रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →