← Últimos artículos
💻 computer science

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

El artículo propone CoRDS, un método basado en coreset para la comprensión de video en streaming que mejora el podado heurístico a nivel de token al seleccionar un subconjunto compacto, diverso y representativo de la memoria caché de claves-valores mediante un objetivo bicriterio y un criterio de diversidad impulsado por ortogonalidad, mejorando así el rendimiento en múltiples modelos y benchmarks de visión-lingüística bajo presupuestos de memoria fijos.

Autores originales: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

Publicado 2026-05-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo una película muy larga, pero solo tienes una pequeña nota adhesiva para anotar las partes más importantes, de modo que puedas responder preguntas sobre ella más tarde. Este es el desafío que enfrentan los modelos de inteligencia artificial modernos (llamados Modelos Visión-Lenguaje) cuando intentan comprender videos largos en tiempo real. No pueden recordar todo, por lo que deben "comprimir" el video en una memoria más pequeña.

El artículo presenta un nuevo método llamado CoRDS (Selección Representativa y Diversa basada en Coreset) para resolverlo. Así es como funciona, utilizando analogías sencillas:

El Problema: La Trampa de la "Recencia"

Actualmente, la mayoría de los modelos de IA utilizan una estrategia de "nota adhesiva" que se basa en reglas simples, como:

  • "Mantener lo más nuevo": Solo recordar los últimos segundos.
  • "Mantener lo más ruidoso": Solo recordar las partes que parecen más obvias o brillantes.

Los autores argumentan que esto es como intentar resumir una película completa recordando solo la última escena o la escena con la explosión más grande. Podrías perder las pistas silenciosas pero cruciales que ocurrieron hace 20 minutos, las cuales son necesarias para resolver un misterio más adelante.

La Solución: El Enfoque del "Curador"

CoRDS cambia el juego. En lugar de seleccionar tokens (pequeñas piezas de datos de video) uno por uno basándose en qué tan nuevos o ruidosos son, actúa como un curador de museo que intenta montar una pequeña exhibición que represente la colección completa.

Estos son los tres trucos principales que utiliza CoRDS:

1. La Vista de "Dos Manos" (Representación Conjunta KV)
Imagina que cada pieza de datos de video tiene dos caras:

  • La "Clave" (La Etiqueta): Esto le dice a la IA dónde mirar en el pasado. (Por ejemplo: "Esta es la escena con el coche rojo".)
  • El "Valor" (El Contenido): Esta es la información real. (Por ejemplo: "El coche rojo chocó contra un árbol".)

Los métodos antiguos a menudo miraban solo la etiqueta o solo el contenido. CoRDS mira ambos al mismo tiempo. Asegura que la IA pueda encontrar el recuerdo correcto y que ese recuerdo contenga realmente los detalles adecuados. Es como asegurarse de tener tanto el mapa (Clave) como la foto (Valor) del lugar, no solo uno u otro.

2. La Estrategia de "Cubrir la Sala" (Selección de Coreset)
En lugar de elegir el único elemento "mejor", CoRDS pregunta: "¿Qué pequeño grupo de elementos cubre la mayor parte del espacio en la sala?"
Si tienes una sala llena de muebles, no eliges solo la silla más cara. Eliges una silla, una mesa, una lámpara y una alfombra que, juntos, representen el estilo de toda la sala. CoRDS selecciona matemáticamente un pequeño grupo de cuadros de video que "cubre" la geometría de todo el historial del video, asegurando que no se deje fuera ningún estilo visual importante ni ningún tipo de escena.

3. La Regla del "Nuevo Ángulo" (Diversidad Ortogonal)
A veces, podrías elegir dos elementos muy similares (como dos sillas rojas idénticas). Esto desperdicia espacio. CoRDS tiene una regla para evitar esto: "No elijas algo que se parezca demasiado a lo que ya tenemos."
Busca elementos que ofrezcan un "nuevo ángulo" o una nueva dirección. Si la IA ya tiene un recuerdo de un coche rojo, no elegirá otro coche rojo a menos que sea la única forma de cubrir esa parte del video. Busca activamente los momentos únicos y diferentes para hacer que la memoria sea diversa.

Los Resultados: Memoria Más Inteligente, No Solo Más Memoria

El artículo probó esto en cuatro modelos de IA diferentes y cinco conjuntos de datos de video distintos (incluyendo películas largas y transmisiones en vivo).

  • Mejor que la competencia: CoRDS superó consistentemente a los métodos existentes (como InfiniPot-V y StreamMem) que utilizan las reglas de "recencia" o "ruidosidad".
  • Lo pequeño es hermoso: Incluso cuando la IA se vio obligada a usar una memoria muy pequeña (manteniendo solo 1/16 de los datos del video), CoRDS funcionó mejor que los modelos que tenían acceso a memorias mucho más grandes utilizando métodos antiguos.
  • Superando al modelo "Completo": En algunos casos, CoRDS funcionó mejor que el modelo de IA que intentaba recordar el video completo sin comprimir. Esto sugiere que, al eliminar las partes "redundantes" o "ruidosas" del video, la IA se enfoca realmente mejor en las pistas importantes (resolviendo el problema de la "aguja en un pajar").

Resumen

Piensa en CoRDS como un editor inteligente para un video. En lugar de simplemente cortar las partes aburridas o mantener solo los clips más recientes, selecciona cuidadosamente un puñado diverso y representativo de momentos que capturan toda la historia. Esto permite que la IA responda preguntas sobre un video de 1 hora tan bien como si hubiera visto todo el contenido, pero utilizando una fracción de la memoria de la computadora.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →