Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
El artículo presenta Audio-Visual Flamingo (AV-Flamingo), un modelo de lenguaje de gran escala totalmente abierto y de vanguardia diseñado para la comprensión y el razonamiento conjunto sobre videos del mundo real largos y complejos mediante el aprovechamiento de un nuevo y masivo conjunto de datos, un currículo de entrenamiento progresivo de tres etapas y un novedoso marco de cadena de pensamiento temporalmente intercalada.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás viendo una película. Ves los rostros de los actores, el escenario y la acción, pero también escuchas el diálogo, la música de fondo, el sonido de los pasos y el crujir de las hojas. Durante mucho tiempo, las computadoras fueron como personas que veían una película con los ojos pegados, solo escuchando la pista de audio, o viceversa. Eran excelentes reconociendo un gato en una imagen o transcribiendo un discurso, pero les costaba comprender la escena completa donde un gato maúlla mientras corre por la pantalla. Este campo de estudio se llama inteligencia "multimodal", donde las máquinas intentan combinar diferentes sentidos —como la vista y el oído— para entender el mundo de la misma manera que lo hacen los humanos. La gran pregunta que los investigadores se han estado haciendo es: ¿Podemos construir una IA que no solo vea un video o escuche un podcast, sino que realmente piense en cómo el sonido y la imagen trabajan juntos, especialmente cuando la historia es larga y complicada?
Presentamos Nemotron-Labs-Audio-Visual Flamingo (o AV-Flamingo para abreviar), un nuevo tipo de cerebro de IA diseñado por investigadores de NVIDIA y la Universidad de Maryland. Piensa en las IA de video anteriores como estudiantes que solo pueden leer una sola página de un libro de texto y responder una pregunta rápida sobre ella. Si les pidieras resumir una película entera o explicar una escena compleja que cambia a lo largo de 15 minutos, se perderían, olvidarían el principio o confundirían a los personajes. AV-Flamingo es diferente. Es como un estudiante súper atento que puede ver una película entera, escuchar la banda sonora y luego sentarse a escribir un ensayo detallado sobre cómo la música cambió el estado de ánimo, por qué un personaje reaccionó de cierta manera o exactamente cuándo ocurrió un sonido específico en relación con un evento visual.
Los investigadores descubrieron que, para lograr esto, no podían simplemente alimentar a la IA con más de los mismos datos de siempre. Tuvieron que enseñarle tres trucos nuevos. Primero, crearon una biblioteca masiva de aproximadamente 7 millones de ejemplos de videos del mundo real (incluyendo 4.8 millones de pares de pregunta-respuesta) diseñados específicamente para probar la capacidad de la IA para conectar el sonido y la vista a través del tiempo. Lo llamaron Audio-Visual-Skills (Habilidades Audiovisuales). Segundo, no lanzaron a la IA directamente a lo profundo; utilizaron un "currículo" que comenzaba con clips cortos para enseñar habilidades básicas, y luego pasaba lentamente a videos más largos y complejos para enseñarle cómo seguir el hilo de una historia a lo largo del tiempo. Tercero, y quizás de la manera más ingeniosa, le enseñaron a la IA a usar un "proceso de pensamiento" llamado Temporal Audio-Visual Interleaved Chain-of-Thought (Cadena de Pensamiento Intercalada Audio-Visual Temporal). Imagina que la IA ve un video y hace una pausa cada pocos segundos para decir: "Bien, en este segundo exacto, el tambor golpeó, y luego el personaje saltó". Esto ayuda a que los pensamientos de la IA se mantengan anclados en el tiempo, para que no se confunda sobre qué sucedió primero o al último.
Los resultados son bastante impresionantes. Cuando fue probada en más de 15 desafíos diferentes —que iban desde la comprensión de la música y el habla hasta el análisis de videos largos y la respuesta a preguntas complicadas—, AV-Flamingo superó a otros modelos de código abierto de tamaño similar por un margen claro. De hecho, incluso logró competir con, y a veces vencer a, modelos "cerrados" mucho más grandes y costosos (aquellos cuyo código no puedes ver) que son actualmente los mejores del mundo. El artículo sugiere que este modelo es particularmente bueno manejando videos largos y complejos del mundo real donde las pistas están dispersas a través del tiempo, demostrando que con los datos y los métodos de entrenamiento adecuados, la IA de código abierto puede alcanzar a los gigantes. Es un gran paso hacia el dar a las computadoras la capacidad de realmente "ver y escuchar" al mundo, en lugar de solo contemplarlo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.