← Últimos artículos
💬 NLP

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

El artículo propone AVOC, un marco de compresión de tokens inspirado en la recuperación que mejora la comprensión de audio y video a nivel de horas en los LLM omnimodales al replantear la selección de tokens como un problema de recuperación top-KK basado en relevancia, importancia y diversidad, logrando así un rendimiento de vanguardia en evaluaciones de larga duración mientras mantiene la robustez en contextos de una hora.

Autores originales: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

Publicado 2026-06-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca gigante de películas y grabaciones de reuniones que duran horas. Quieres hacerle una pregunta específica a un asistente de IA súper inteligente sobre lo que ocurrió en uno de esos videos largos, como: "¿Cuántas personas entraron al sótano después de esa línea de diálogo específica?".

El problema es que la "memoria" (ventana de memoria) de la IA es demasiado pequeña para contener todo el video a la vez. Si intentas alimentar a la IA con todo el video, se colapsa. Si intentas reducirlo simplemente eligiendo fotogramas al azar, podrías perderte el momento crucial. Si intentas mantener cada uno de los detalles, te quedas sin espacio.

Entra AVOC: El Bibliotecario Inteligente

Los autores de este artículo crearon un nuevo sistema llamado AVOC. Piensa en AVOC como un bibliotecario altamente capacitado que tiene que resumir una película de 1 hora en una pequeña hoja de trucos de 10 páginas para la IA, pero con un objetivo muy específico: la hoja de trucos debe contener solo la información necesaria para responder a tu pregunta.

Así es como funciona AVOC, utilizando tres reglas simples tomadas de cómo los motores de búsqueda encuentran los mejores resultados:

1. Relevancia: "¿Coincide esto con la pregunta?"

Imagina que preguntas al bibliotecario: "¿Quién entró al sótano?".

  • La forma antigua: El bibliotecario podría mostrarte una página sobre la cocina o el clima exterior porque esas escenas fueron ruidosas o coloridas.
  • La forma de AVOC: AVOC analiza tu pregunta primero. Escanea el video y el audio y dice: "Bien, necesito encontrar la parte donde la gente habla del sótano". Resalta los momentos específicos en el video y las palabras específicas en el audio que se relacionan directamente con tu pregunta. Esto se llama Puntuación Guiada por Texto (Text-Guided Scoring).

2. Importancia: "¿Es esto interesante incluso sin la pregunta?"

A veces, tu pregunta es vaga, o la respuesta depende de algo que el video muestra pero de lo que no habla explícitamente.

  • La analogía: Imagina que estás buscando a una persona específica en una multitud. Incluso si no sabes su nombre, podrías detectarla porque lleva un sombrero rojo brillante (una señal visual única) o porque es la única que está bailando (una señal auditiva única).
  • La forma de AVOC: AVOC comprueba si un momento es "importante" por sí mismo. Observa cómo el video y el audio se comunican entre sí. Si el rostro de una persona (video) coincide con un sonido específico (audio), ese momento recibe una puntuación de "importancia" alta, incluso si tu pregunta no lo mencionaba. Esto asegura que la IA no se pierda pistas ocultas.

3. Diversidad: "¡No me muestres lo mismo dos veces!"

Esta es la parte más difícil. Si tienes una escena donde un personaje entra en una habitación, luego sale y luego vuelve a entrar, un sistema tonto podría elegir esos tres momentos porque todos se ven similares. Esto desperdicia espacio.

  • La analogía: Imagina que estás empacando una maleta para un viaje. No necesitas empacar tres pares de calcetines rojos exactamente iguales. Necesitas un par rojo, uno azul y uno verde para cubrir diferentes necesidades.
  • La forma de AVOC: AVOC utiliza una regla especial llamada Diversidad con Conciencia Temporal (Temporal-Aware Diversity). Dice: "Si ya elegí un momento donde alguien entra en una habitación, no elegiré el siguiente segundo donde haga exactamente lo mismo". Sin embargo, si lo mismo sucede una hora después en la película, AVOC elegirá ese también, porque es un evento diferente en el tiempo. Esto mantiene el resumen fresco y cubre toda la línea de tiempo sin repetirse.

El Resultado: Un Resumen Superinteligente

Al combinar estas tres reglas, AVOC toma un flujo masivo de video y audio de una hora y lo comprime en una secuencia de "tokens" diminuta y super eficiente. Elimina las partes aburridas, repetitivas o irrelevantes y conserva solo los "tesoros" de información.

¿Qué descubrieron?

  • Funciona mejor que cualquier otro: Cuando se probó en videos largos (de hasta 90 minutos), AVOC respondió preguntas con mucha más precisión que otros modelos top. Superó al segundo mejor modelo por un margen significativo (aproximadamente 5 puntos más de media).
  • Encuentra "la aguja en el pajar": Probaron si la IA podía encontrar un número secreto específico escondido en algún lugar de un video de 1 hora. AVOC pudo encontrarlo casi perfectamente, incluso en videos que duraban una hora, mientras que otros modelos empezaron a fallar a medida que los videos se hacían más largos.
  • Es rápido: Aunque está realizando esta clasificación compleja, no ralentiza mucho a la IA. De hecho, debido a que elimina tanta información inútil, la IA puede procesar el video más rápido que antes.

En resumen, AVOC le enseña a la IA cómo ser un mejor lector: no se limita a leer cada palabra de un libro de 500 páginas; aprende a leer por encima, resaltar las partes importantes e ignorar el relleno, para poder responder a tu pregunta perfectamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →