← Últimos artículos
💻 computer science

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner es un marco de post-entrenamiento de uso de herramientas que permite a los LLM omnimodales razonar eficientemente sobre flujos de audio y video de larga duración al decidir dinámicamente cuándo invocar una herramienta de "zoom-in" para una inspección de alta fidelidad de evidencia dispersa, respaldado por un novedoso mecanismo TimeAnchor para la consistencia temporal y un Motor de Datos Aumentados Temporales para un entrenamiento escalable.

Autores originales: Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

Publicado 2026-07-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un misterio en una biblioteca que nunca termina. La biblioteca está llena de miles de libros, pero las pistas que necesitas para resolver el caso son diminutas: tal vez una sola palabra susurrada en la página 4.002, o un dibujo específico oculto en el margen de la página 12.500. Si intentas leer cada una de las páginas a la misma velocidad, tu cerebro se cansa y podrías pasar por alto los detalles minúsculos porque estuviste recorriéndolas demasiado rápido. Este es exactamente el problema que enfrentan las computadoras cuando intentan comprender videos y audios largos. Son modelos "omnimodales", lo que significa que pueden ver y oír, pero cuando un video dura una hora, la pista más importante podría ser un sonido de una fracción de segundo o una breve acción visual. Si la computadora intenta procesar toda la hora con alto detalle, se queda sin memoria. Si pasa de largo por todo, se pierde las pistas. Los científicos han estado tratando de enseñar a las computadoras a ser mejores detectives: cómo ojear la historia completa rápidamente, detectar la parte sospechosa y luego reducir la velocidad para mirar de cerca solo donde importa.

Entra OmniReasoner, un nuevo marco de "pensamiento" que enseña a estos detectives de IA a usar una herramienta especial: un botón de zoom. En lugar de mirar fijamente todo el video de una hora a la vez, OmniReasoner primero toma un "vistazo" rápido y de baja calidad a toda la línea de tiempo, algo así como hojear un libro para captar la idea general. Si cree que la respuesta está ahí mismo, da la respuesta. Pero si siente que una pista se esconde en un momento específico —como un personaje diciendo una frase particular o un pez apareciendo en una pecera—, hace una pausa y solicita un zoom. Solicita un clip de alta definición y alta velocidad de solo esos pocos segundos. La IA luego observa esta evidencia "ampliada" junto con su vistazo rápido original para resolver el rompecabezas.

El truco de magia aquí es cómo la IA sabe dónde hacer zoom. En el pasado, las computadoras tenían dificultades porque contaban "fotogramas" (como contar páginas), pero si aceleras o ralentizas el video, los números de página cambian. OmniReasoner utiliza un sistema ingenioso llamado TimeAnchor. Piensa en ello como una coordenada GPS basada en la hora del reloj (por ejemplo, "mirar en el minuto 2 y 49 segundos") en lugar de un número de página. De esta manera, ya sea que la IA esté mirando la versión borrosa y acelerada o la versión ampliada y cristalina, "2:49" siempre apunta al mismo momento exacto. Esto asegura que la IA no se pierda al cambiar entre la visión general y el primer plano.

Para enseñar esta habilidad a la IA, los investigadores no solo pidieron a los humanos que etiquetaran cada video; eso tomaría una eternidad. En su lugar, construyeron un Motor de Datos de Aumento Temporal (Temporal Augmented Data Engine). Imagina un editor de video que toma clips cortos, los une para formar una película larga y esconde secretamente una "pista" en una de las nuevas costuras. Luego, la IA es entrenada para encontrar esa pista oculta. A veces, se le dice a la IA que simplemente adivine a partir de toda la película, y otras veces se le obliga a usar la herramienta de zoom. A través de un proceso de ensayo y error (aprendizaje por refuerzo), la IA aprende que usar la herramienta de zoom conduce a mejores puntuaciones, pero solo cuando es realmente necesario.

Los resultados muestran que este enfoque funciona. Cuando fue probado en varios desafíos de video y audio, OmniReasoner mejoró significamente su capacidad para encontrar respuestas, especialmente en videos muy largos donde las pistas son raras. No solo se volvió más inteligente al responder; aprendió a ser eficiente, dedicando su "potencia cerebral" solo a los momentos que importaban. El artículo sugiere que, al enseñar a la IA a decidir cuándo mirar más de cerca, en lugar de obligarla a mirar todo por igual, podemos resolver misterios complejos en transmisiones de audio y video largas que antes eran demasiado difíciles de descifrar. Es un paso hacia una IA que no solo ve videos, sino que realmente piensa sobre ellos, sabiendo exactamente cuándo hacer una pausa y prestar atención.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →