← Últimos artículos
💻 computer science

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

Este artículo presenta AV-JEPA, un marco de aprendizaje autodidacta audio-visual simplificado que extiende LeJEPA utilizando un Vision Transformer de fusión temprana y el abandono de modalidad (modality dropout) para lograr un rendimiento competitivo y capacidades de recuperación de cero disparos sin depender de decodificadores, profesores EMA o negativos contrastivos.

Autores originales: Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin

Publicado 2026-07-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras son como estudiantes entusiastas y de mente en blanco que quieren aprenderlo todo, pero están atrapadas en un salón de clases sin profesor y sin libros de texto. Este es el reino del aprendizaje autosupervisado, una rama de la inteligencia artificial donde las máquinas intentan enseñarse a sí mismas encontrando patrones en montañas de datos no etiquetados. Usualmente, para aprender a reconocer un gato o un coche, una computadora necesita que un humano señale una imagen y diga: "Eso es un gato". Pero, ¿qué pasaría si la computadora pudiera aprender simplemente mirando la imagen y adivinando qué es lo que falta? Esa es la magia del aprendizaje con enmascaramiento (masked learning): cubres una parte de una imagen o un sonido, y la computadora tiene que rellenar los huecos. Durante mucho tiempo, la mejor forma de hacer esto fue obligar a la computadora a reconstruir las piezas faltantes píxel por píxel, como un solucionador de rompecabezas tratando de reconstruir un jarrón destrozado. Pero hay una idea más nueva y abstracta llamada JEPA (Arquitectura Predictiva de Incrustación Conjunta). En lugar de intentar reconstruir el jarrón roto, JEPA le pide a la computadora que prediga la esencia o la "vibra" de la pieza faltante. Es como adivinar el sabor de una sopa oliendo el vapor, en lugar de intentar probar cada uno de los ingredientes. Este artículo plantea una gran pregunta: ¿Puede este método de "adivinar la vibra" funcionar cuando la computadora intenta comprender dos sentidos diferentes a la vez: la vista y el oído?

Los autores de este artículo, un equipo de Finlandia, dicen: "¡Sí!", e introducen un nuevo modelo llamado AV-JEPA. Piensa en AV-JEPA como un detective superinteligente que aprende a entender la escena de un crimen mirando el video y escuchando el audio, pero con un giro. En lugar de intentar reconstruir los fotogramas de video faltantes o las ondas de audio (lo cual es como intentar redibujar toda la escena del crimen de memoria), este detective aprende a predecir el sentimiento de la escena cuando un sentido falta.

Así es como lo hicieron. Imagina que estás viendo un video de un guitarrista. Usualmente, una computadora ve el video y escucha el audio juntos. AV-JEPA, sin embargo, juega al "escondite" con los sentidos. Toma un clip y crea dos versiones: una donde el video está completamente oscurecido (para que la computadora solo escuche la guitarra) y otra donde el audio ha sido silenciado (para que la computadora solo vea la guitarra). El trabajo del modelo es mirar la versión de "solo audio" y predecir cómo se sentiría la versión de "solo video", y viceversa. Lo hace sin que ningún humano le diga qué está pasando, y sin intentar reconstruir las partes faltantes. Simplemente aprende a alinear el "alma" del sonido con el "alma" de la imagen en un espacio mental compartido.

Los resultados son bastante impresionantes para un método que evita el trabajo pesado de reconstruir imágenes. Cuando probaron este modelo en un conjunto de datos llamado VGGSound (que contiene videos de sonidos), el modelo alcanzó una tasa de precisión del 57.1% en la identificación de lo que sucedía en el video. En otro conjunto de datos masivo llamado AudioSet, obtuvo un 32.7 mAP (una medida de qué tan bien identifica los sonidos). Aunque estos números son ligeramente inferiores a los de los modelos actuales que utilizan el viejo método de "reconstruir el rompecabezas" (que pueden alcanzar hasta el 67% en VGGSound), los autores señalan que AV-JEPA es mucho más simple. No necesita partes adicionales complejas para reconstruir imágenes, ni necesita un modelo "maestro" que lo guíe. Simplemente aprende por sí mismo.

Una de las cosas más geniales que encontró el artículo es que el modelo aprendió a prestar atención a las cosas correctas por su cuenta. Cuando observaron hacia dónde estaba "mirando" el modelo cuando escuchaba un sonido, este se enfocaba naturalmente en la fuente del ruido. Si escuchaba un pájaro gorjeando, miraba al pájaro. Si escuchaba una flauta, miraba la boca del músico. Lo hizo sin que nadie le enseñara nunca a encontrar la fuente del sonido; simplemente comprendió que el sonido y la fuente visual estaban conectados porque tenía que predecir uno a partir del otro.

El artículo también mostró que este modelo puede realizar recuperación "zero-shot", que es una forma elegante de decir que puede encontrar un video simplemente buscando por un sonido, o encontrar un sonido simplemente buscando por un video, sin haber sido entrenado explícitamente para esa tarea de búsqueda específica. Es como tener una biblioteca donde puedes encontrar un libro simplemente tarareando una melodía de él.

Sin embargo, los autores son honestos sobre las limitaciones. Encontraron que el modelo tiene un fuerte sesgo hacia el audio. Cuando lo probaron, las decisiones del modelo fueron impulsadas principalmente por lo que escuchaba, no por lo que veía. Es como si el detective fuera un genio escuchando pistas, pero estuviera un poco distraído por la evidencia visual. El artículo sugiere que, si bien esto es un gran paso adelante para una arquitectura "limpia" y simple, aún queda trabajo por hacer para que sea tan bueno viendo como lo es escuchando, especialmente en comparación con los modelos más complejos que pasan años reconstruyendo imágenes. Pero para un método que desecha el rompecabezas de la reconstrucción y solo se enfoca en la conexión entre los sentidos, AV-JEPA es una nueva y prometedora forma para que las computadoras aprendan cómo el mundo suena y se ve.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →