← Últimos artículos
💻 computer science

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop es un marco de poda de tokens por capas sin entrenamiento para LLMs omnimodales que utiliza consultas de texto y una puntuación de diversidad temporal para eliminar progresivamente tokens audiovisuales redundantes dentro de las capas decodificadoras, logrando reducciones significativas en la latencia y el uso de memoria mientras supera a las líneas base existentes en rendimiento.

Autores originales: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

Publicado 2026-05-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico súper inteligente (un "Omni-LLM") que puede ver videos y escuchar audio al mismo tiempo. Le haces una pregunta, como "¿Quién está cantando de fondo?" o "¿De qué color es el coche?".

El problema es que el video y el audio de alta calidad son como una inundación masiva de datos. Solo para un minuto de video, el robot tiene que procesar más de 10.000 trozos diminutos de información (llamados "tokens"). Intentar pensar en todos ellos a la vez es como intentar beber de una manguera de bomberos: es lento, consume mucha energía y hace que el robot se vuelva lento.

Para solucionar esto, los científicos suelen intentar descartar las partes "aburridas" del video y el audio antes de que el robot siquiera empiece a pensar. Asumen que si un sonido y una imagen ocurren al mismo tiempo, deben estar relacionados.

La Gran Idea del Artículo: "OmniDrop"
Los autores de este artículo dicen: "Espera un momento, esa suposición es incorrecta". Solo porque un sonido y una imagen ocurran juntos no significa que sean importantes para tu pregunta específica.

En lugar de tirar cosas inmediatamente, construyeron un nuevo sistema llamado OmniDrop. Así es como funciona, usando algunas analogías simples:

1. La Estrategia de "Inicio Lento" (Poda por Capas)

Imagina que el cerebro del robot es un edificio de varios pisos.

  • Método Antiguo: Te paras en la puerta principal (la entrada) y de inmediato echas a la mitad de las personas (datos) basándote en quién se parece a quién. Esto es arriesgado porque podrías echar a la única persona que realmente sabe la respuesta.
  • Método OmniDrop: Dejas entrar a todo el mundo al edificio. En los primeros pisos (capas tempranas), todos se mezclan y hablan entre sí. Esto permite que el audio y el video se mezclen y entiendan la escena juntos.
  • El Giro: A medida que el grupo sube a los pisos superiores (capas más profundas), el robot empieza a darse cuenta: "Oh, solo necesito hablar con estas personas específicas para responder la pregunta". Entonces empieza, primero suavemente y luego con más fuerza, pidiendo a las personas no importantes que se vayan. Esto asegura que el robot no pierda la "gran imagen" antes de saber qué está buscando.

2. La "Pregunta como una Linterna" (Guía por Consulta)

¿Cómo sabe el robot a quién mantener?

  • Método Antiguo: Mira el audio y el video e intenta adivinar cuáles coinciden entre sí.
  • Método OmniDrop: Enciende una linterna basada en tu pregunta de texto.
    • Si preguntas: "¿Qué sonido es ese?", la linterna resalta los tokens de audio y atenúa los de video.
    • Si preguntas: "¿De qué color es la camisa?", la linterna resalta los tokens de video.
    • El robot mantiene los tokens sobre los que brilla la "linterna" y descarta los que están en la oscuridad. Esto hace que la poda sea inteligente y específica para tu tarea.

3. La Regla de "No Saltarse el Medio" (Diversidad Temporal)

Existe un peligro: Si el robot solo mantiene los tokens que la linterna alcanza, podría olvidar todo lo demás, creando un "hueco" en la historia.

  • La Solución: OmniDrop añade una regla llamada Diversidad Temporal. Incluso si un momento específico no es el más importante, si está lejos en el tiempo del evento principal, el robot le da un pequeño "punto extra" para quedarse.
  • Analogía: Imagina leer un libro. Si solo guardas las frases donde habla el héroe, te pierdes el escenario. OmniDrop dice: "Mantén las líneas del héroe, pero también guarda algunas frases de las partes tranquilas intermedias para que la historia no se sienta rota".

Los Resultados

Los autores probaron esto en Qwen2.5-Omni (un modelo popular) usando varias pruebas de video y audio.

  • Velocidad: Hizo que el robot pensara un 40% más rápido (menos tiempo de espera).
  • Memoria: Usó un 14,7% menos de memoria.
  • Inteligencia: Sorprendentemente, al ser más inteligente sobre qué tirar, el robot en realidad se volvió mejor respondiendo preguntas (hasta 3,58 puntos más alto en las pruebas) en comparación con otros métodos que simplemente tiraban trozos aleatorios de datos.

En Resumen:
OmniDrop es como un editor inteligente para una película. En lugar de cortar la película a la mitad antes de que incluso la veas, te deja verla completa, descubre exactamente qué escenas importan para tu pregunta específica y luego corta el resto mientras la ves, asegurando que obtengas la respuesta rápidamente sin perder la trama.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →