← Últimos artículos
🤖 AI

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

Este artículo presenta ST-OmniQA, un benchmark audiovisual espacio-temporal a gran escala con 40K videos panorámicos y audio Ambisonics, y propone ST-Omni-R1, un modelo que supera significativamente a los modelos de referencia al integrar pistas de audio direccional con contexto visual mediante un currículo progresivo y aprendizaje por refuerzo para razonar sobre la identidad, ubicación y movimiento de las fuentes de sonido.

Autores originales: Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

Publicado 2026-08-11
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que caminas por una calle concurrida con los ojos cerrados. Escuchas a un perro ladrar, un coche tocar la bocina y a alguien reír. Tu cerebro no solo percibe "ruido"; instantáneamente identifica qué está produciendo el sonido, de dónde viene y hacia dónde se dirige. Sabe que el perro está corriendo hacia la izquierda, que el coche se aproxima desde la derecha y que la risa proviene de una persona que aún no puedes ver. Esta capacidad de mezclar la audición y la visión para rastrear objetos en movimiento es un superpoder que los humanos poseemos, pero es una pesadilla para las computadoras.

Durante mucho tiempo, los programas informáticos que comprenden el sonido (Modelos de Lenguaje de Audio) fueron como personas con los ojos cerrados: podían decirte que un perro ladraba, pero no podían decirte si el perro se movía hacia ti o se alejaba. Por otro lado, los programas que comprenden el video (Modelos de Lenguaje de Visión) fueron como personas con los oídos tapados: podían ver a un perro, pero no sabían si ese perro específico era el que estaba ladrando o si solo estaba allí parado en silencio. El gran desafío en la ciencia actual es construir un cerebro robótico que pueda hacer ambas cosas al mismo tiempo: escuchar el sonido, observar el video y descifrar exactamente cómo se mueve la fuente del sonido a través del espacio y el tiempo. Este artículo aborda precisamente ese problema, intentando enseñar a las máquinas a "escuchar, ver y rastrear" simultáneamente.


El Problema: Los Robots "Ciegos" y "Sordos"

Los autores de este artículo notaron una brecha en la forma en que las computadoras inteligentes piensan actualmente. Algunos modelos son excelentes para comprender el audio, pero tratan un clip de video completo como un único evento sonoro grande y borroso. Pierden los detalles de dónde proviene un sonido o cómo se mueve. Otros modelos son excelentes para observar videos, pero dependen de un audio simple que no tiene suficiente información "espacial" (como dirección o distancia) para saber dónde están las cosas.

Piensa en ello como intentar encontrar a un amigo en un parque concurrido. Si solo tienes una descripción de su voz (audio), podrías saber que está allí, pero no puedes señalarlo. Si solo tienes una foto (video), puedes verlo, pero no sabes si es él quien está hablando. Para entender realmente la escena, necesitas vincular la voz con la persona y rastrear su movimiento mientras camina detrás de un árbol o alrededor de una esquina. Los modelos existentes luchan con este problema de "vinculación": no pueden conectar fácilmente un sonido en movimiento con un objeto en movimiento en un video.

La Solión: Un Nuevo Patio de Juegos y un Nuevo Cerebro

Para solucionar esto, los investigadores crearon dos cosas: un nuevo examen gigante llamado ST-OmniQA y un nuevo modelo de IA llamado ST-Omni-R1.

1. El Examen: ST-OmniQA
Imagina un videojuego masivo donde la cámara gira 360 grados (video panorámico) y el sonido se graba con micrófonos especiales que saben exactamente de dónde vienen los sonidos (llamados Ambisonics de Primer Orden o FOA). Los investigadores construyeron un conjunto de datos con 40,000 de estos clips de video y 400,000 preguntas sobre ellos.

Las preguntas se vuelven más difíciles en cuatro niveles, como en un videojuego:

  • Nivel A (Lo Básico): "¿Qué sonido es este?" o "¿Qué tan lejos está?".
  • Nivel B (La Multitud): "Hay dos perros ladrando; ¿cuál está a la izquierda?".
  • Nivel C (La Persecución): "¿Qué fuente de sonido se mueve hacia la persona que está parada allí?".
  • Nivel D (El Misterio): "Se escuchó un sonido entre los 2 y 3 segundos, pero la fuente aún no era visible. Entró por la puerta izquierda entre los 3 y 5 segundos. ¿Quién fue?".

Este examen obliga a la IA no solo a adivinar, sino a razonar sobre el tiempo, el espacio y cómo encajan la visión y el oído.

2. El Cerebro: ST-Omni-R1
Los investigadores construyeron un nuevo modelo de IA para realizar este examen. En lugar de solo escuchar un archivo de sonido plano, este modelo utiliza un "traductor" especial (el codificador STA) que convierte los datos de sonido 3D en una lista de "tokens de trayectoria". Piensa en estos tokens como un rastro de migas de pan que le dice a la IA exactamente cómo se movió un sonido a lo largo del tiempo.

El modelo aprende por etapas, como un estudiante que recorre la escuela:

  • Etapa A: Aprende a identificar sonidos simples y dónde están.
  • Etapa B: Aprende a manejar múltiples sonidos a la vez.
  • Etapa C: Aprende a comparar cómo se mueven diferentes sonidos entre sí.
  • Etapa D: Aprende a vincular el sonido con el objeto específico en el video, incluso si el objeto desaparece detrás de una pared (oclusión) y luego reaparece.

Para hacer al modelo aún más inteligente, utilizaron una técnica llamada "Aprendizaje por Refuerzo de Árbol de Razonamiento". Imagina que la IA está resolviendo un rompecabezas. En lugar de solo darle la respuesta, el sistema verifica cada paso de su proceso de pensamiento. Si la IA dice: "El perro está a la izquierda", el sistema verifica si la IA identificó correctamente al perro, vio correctamente que estaba a la izquierda y vinculó correctamente el ladrido con el perro. Si los pasos no coinciden, la IA recibe una corrección con "lápiz rojo". Esto ayuda al modelo a aprender a ser consistente y lógico.

Los Resultados: Un Gran Salto Adelante

Cuando sometieron a ST-Omni-R1 al examen ST-OmniQA, tuvo un desempeño increíble.

  • Los mejores modelos existentes (como la IA de propósito general más inteligente disponible) solo obtuvieron aproximadamente el 37.28% de las respuestas correctas en promedio.
  • ST-Omni-R1, tras su entrenamiento especial, alcanzó una precisión del 77.83%.

Esto no es solo una pequeña mejora; es un salto masivo. El modelo demostró que podía manejar escenarios complejos, como rastrear una fuente de sonido que se esconde detrás de un objeto y luego reaparece, o distinguir entre dos sonidos similares que se mueven en direcciones diferentes.

Los investigadores también probaron su modelo en otros tres conjuntos de datos de audio del mundo real (TAU-NIGENS, L3DAS22 y STARSS23) que nunca había visto antes. Incluso sin haber sido entrenado específicamente en ellos, ST-Omni-R1 superó a los modelos anteriores más destacados. Esto sugiere que la forma en que el modelo aprendió a comprender el espacio y el movimiento es una habilidad que puede utilizar en muchas situaciones diferentes, no solo en el examen específico que construyeron.

Por Qué Esto Importa

Este artículo muestra que nos estamos acercando a dar a las computadoras la capacidad humana de "escuchar y ver" el mundo como una única historia en movimiento. Al enseñar a las máquinas a rastrear el viaje de una fuente de sonido —sabiendo dónde comenzó, hacia dónde fue y qué aspecto tenía incluso cuando estaba oculta—, estamos construyendo la base para robots y asistentes virtuales que realmente puedan comprender nuestro mundo dinámico, ruidoso y visual. Los autores sugieren que este enfoque de combinar el sonido 3D con video panorámico y enseñar a la IA a razonar paso a paso es la clave para desbloquear este siguiente nivel de inteligencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →