FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding
يُعد FLoC إطار عمل لا يتطلب تدريباً ومستقلاً عن النماذج، حيث يستفيد من دالة تحديد الموقع (facility location function) وخوارزمية جشعة كسولة (lazy greedy algorithm) لاختيار مجموعة فرعية مدمجة ومتنوعة من الرموز المرئية (visual tokens) لفهم الفيديو الطويل بكفاءة، مما يقلل التكاليف الحسابية بشكل كبير مع الحفاظ على أداء يقارب المثالية عبر مختلف المعايكات.