OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
تقدم الورقة البحثية OTT-Vid، وهو إطار عمل لضغط الرموز الزمني لا يتطلب تدريباً لنماذج اللغة الكبيرة الخاصة بالفيديو، والذي يستفيد من النقل الأمثل مع كتلة رموز غير منتظمة وتكاليف مدركة للمحلية لتخصيص ميزانيات الضغط ديناميكياً بناءً على قابلية ضغط أزواج الإطارات، محققاً أداءً هو الأفضل في فئته مع الاحتفاظ بـ 10% فقط من الرموز المرئية.