Small Vision-Language Models are Smart Compressors for Long Video Understanding
यह शोध पत्र टेंपो (Tempo) का प्रस्ताव करता है, जो एक क्वेरी-जागरूक फ्रेमवर्क है जो एक स्थानीय टेम्पोरल कंप्रेसर के रूप में एक स्मॉल विजन-लैंग्वेज मॉडल और एक अडैप्टिव टोकन एलोकेशन राउटर का लाभ उठाकर घंटों लंबे वीडियो को इरादा-अनुरूप (intent-aligned), संक्षिप्त निरूपणों में कुशलतापूर्वक संकुचित करता है, जिससे सख्त टोकन बजट के भीतर काम करते हुए लॉन्ग-फॉर्म वीडियो समझ के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।