← Últimos artículos
⚡ electrical engineering

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

El artículo presenta Audio Flamingo Next (AF-Next), un modelo de lenguaje-audio de última generación que supera a sus predecesores y a otros modelos existentes mediante el uso de un modelo base más robusto, datos a gran escala, soporte para entradas de hasta 30 minutos y una nueva estrategia de razonamiento temporal llamada "Cadena de Pensamiento de Audio Temporal", todo ello respaldado por un conjunto de recursos de código y datos de código abierto.

Autores originales: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Du
Publicado 2026-04-14
📖 4 min de lectura☕ Lectura para el café

Autores originales: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que el mundo del sonido (la voz humana, la música, los ruidos de la calle) es un océano gigante y misterioso. Durante años, los ordenadores solo podían "nadar" en pequeñas charcas: entendían una frase corta o reconocían una canción, pero se perdían si el audio era largo, ruidoso o complejo.

Hoy, NVIDIA y la Universidad de Maryland han lanzado Audio Flamingo Next (AF-Next). Para explicarlo de forma sencilla, vamos a usar algunas analogías creativas.

1. ¿Qué es AF-Next? El "Oído Superpoderoso"

Piensa en los modelos anteriores como un detective novato que solo puede escuchar un minuto de una conversación antes de olvidar quién dijo qué.

AF-Next es como un detective veterano con una memoria fotográfica y un oído de águila. Es un "cerebro" de inteligencia artificial que no solo escucha, sino que comprende y razona sobre el sonido. Puede escuchar una grabación de 30 minutos (como una película completa o una reunión de trabajo) y responder preguntas sobre lo que pasó hace 25 minutos, sin confundirse.

2. ¿Qué hace que sea tan especial? (Sus nuevos superpoderes)

El papel describe cuatro mejoras principales. Aquí tienes la traducción a lenguaje cotidiano:

  • El Entrenamiento en la "Escuela del Mundo Real":
    Los modelos anteriores se entrenaban con ejercicios de libro de texto (datos académicos perfectos). AF-Next, en cambio, ha sido entrenado con 1 millón de horas de audio real de internet.

    • La analogía: Es la diferencia entre un estudiante que solo ha estudiado en una biblioteca silenciosa y un estudiante que ha trabajado en una estación de tren ruidosa, en un concierto de rock y en una reunión de negocios. AF-Next sabe entender el sonido aunque haya ruido de fondo o varias personas hablando a la vez.
  • La "Cadena de Pensamiento Temporal" (El Mapa del Tesoro):
    Esta es la innovación más genial. Cuando AF-Next responde a una pregunta difícil sobre un audio largo, no adivina. Usa una técnica llamada Cadena de Pensamiento Temporal.

    • La analogía: Imagina que tienes que encontrar una aguja en un pajar gigante. Los modelos antiguos miraban todo el pajar de golpe y se mareaban. AF-Next, en cambio, pone etiquetas de tiempo en su pensamiento. Dice: "Primero, escucho el sonido del reloj a los 00:15. Luego, a los 05:30 escucho una risa. Finalmente, a los 12:00 escucho la respuesta".
      Esto le permite "aterrizar" sus ideas en momentos específicos de la grabación, evitando alucinaciones (inventar cosas que no pasaron).
  • El "Políglota Musical":
    No solo entiende el habla. Puede analizar música, identificar instrumentos, entender letras en diferentes idiomas y hasta describir qué está pasando en una escena de sonido (como un trueno o un coche frenando). Es como tener un crítico de música, un lingüista y un ingeniero de sonido en una sola caja.

  • La Capacidad de "Charla Continua":
    Ahora puede mantener conversaciones largas. Puedes preguntarle cosas, él responde, y luego puedes seguir hablando sobre lo que dijo, manteniendo el contexto de todo el audio original.

3. ¿Cómo lo hicieron? (La Receta de la Cocina)

Los autores no solo "comieron más datos". Cocinaron un plato especial en tres fases:

  1. Pre-entrenamiento: Le enseñaron a escuchar y reconocer sonidos básicos (como aprender el alfabeto).
  2. Entrenamiento Medio: Le enseñaron a entender contextos largos y a razonar (como aprender a escribir ensayos).
  3. Entrenamiento Final (Post-entrenamiento): Le enseñaron a seguir instrucciones, a ser seguro (no decir cosas malas) y a usar su "cadenas de pensamiento" para resolver problemas difíciles.

Además, usaron una técnica de computación muy avanzada (llamada Parallelism) que es como tener 128 cerebros trabajando juntos para procesar esa enorme cantidad de audio sin volverse locos.

4. ¿Por qué es importante para ti?

Hasta ahora, si querías que una IA entendiera una grabación de una reunión de 20 minutos o analizara una canción compleja, tenías que usar sistemas cerrados y caros (como los de Google o Apple) o no funcionaba bien.

AF-Next es "Open Source" (Código Abierto).

  • La analogía: Es como si alguien construyera un Ferrari de carreras, lo dejara en la plaza pública y te diera las llaves, el manual de reparación y los planos. Cualquiera puede usarlo, mejorarlo o crear nuevas aplicaciones con él.

En resumen

Audio Flamingo Next es el primer "super-oyente" abierto que puede escuchar una historia larga, recordar cada detalle, saber exactamente en qué segundo ocurrió algo, y explicártelo con lógica. Ha pasado de ser un "niño que escucha" a ser un "adulto que razona" sobre el sonido, y lo mejor de todo: es gratis para que la comunidad científica e innovadores lo usen.

¡Es un gran paso para que las máquinas entiendan el mundo tal como lo escuchamos nosotros!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →