← Últimos artículos
💬 NLP

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

El artículo presenta MIDI-LLM, un marco de entrenamiento de dos etapas que adapta los Modelos de Lenguaje Extensos para generar música MIDI multitrack y partituras de alta calidad controladas por texto, demostrando un rendimiento y una aceptación de usuario superiores sobre las líneas base existentes a través de extensos estudios de ablación y una evaluación ciega a gran escala en el mundo real.

Autores originales: Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

Publicado 2026-08-05
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde puedes hablar con una computadora y pedirle que escriba una canción para ti. En el ámbito de la inteligencia artificial, esto se llama "texto a música". Durante un tiempo, la mejor manera de hacer esto era pedirle a la computadora que generara ondas sonoras puras, como una grabación digital. Pero aquí está el truco: una vez que ese sonido se crea, es como una pintura en un lienzo. No puedes borrar fácilmente una sola pincelada o cambiar el tempo de solo el ritmo de la batería sin arruinar toda la imagen. Los músicos necesitan algo más flexible, algo que puedan editar nota por nota. Aquí es donde entra el "MIDI". Piensa en el MIDI no como sonido, sino como una partitura digital o un conjunto de instrucciones que le dicen a un piano virtual exactamente qué teclas presionar, con qué fuerza y durante cuánto tiempo. Es la diferencia entre una grabación terminada y un juego de LEGO; puedes desarmar el LEGO y construir algo nuevo.

Ahora, imagina tomar los modelos de lenguaje súper inteligentes (la IA que escribe ensayos y responde preguntas) y enseñarles a hablar este lenguaje musical. Esa es la gran idea detrás de esta nueva investigación. Los científicos querían ver si podían convertir a un experto en texto en un experto en música, permitiendo que las personas escriban cosas como "una canción de jazz triste con una batería rápida" y reciban a cambio una partitura musical perfectamente editable. No solo intentaban crear un ruido bonito; querían construir una herramienta que ayce a los creadores humanos a intercambiar ideas y colaborar con la IA de una manera que se sienta natural y controlable.


El artículo: MIDI-LLM

Los investigadores detrás de este artículo, un equipo de MIT, Hooktheory y la Universidad Carnegie Mellon, han cocinado una nueva receta llamada MIDI-LLM. Piensa en esto como una forma de actualizar un modelo de lenguaje grande (LLM) estándar —el tipo de IA que escribe historias y resuelve problemas matemáticos— para que también pueda escribir música.

Normalmente, estos modelos de IA son como chefs que solo saben cocinar con palabras. Entienden "manzana" y "pastel", pero no saben qué suena como un "Do sostenido" o cómo escribirlo. El primer movimiento del equipo fue darle a la IA un nuevo vocabulario. Expandieron el diccionario del modelo para incluir "tokens MIDI" especiales. En lugar de escribir una nota como una oración larga como "comenzar en 10 segundos, durar 0.5 segundos, tocar un Do alto", el modelo ahora la ve como un símbolo único y compacto, como un código secreto. Esto es como enseñarle a un chef a leer un nuevo idioma donde una sola palabra significa "añadir sal", haciendo que el proceso de cocina sea mucho más rápido y eficiente.

Pero el solo hecho de darle al modelo un nuevo diccionario no es suficiente; necesita aprender a usarlo. El equipo entrenó a la IA en dos etapas distintas, como un estudiante de música que primero aprende teoría y luego toca en una banda.

Etapa 1: La práctica en solitario (Preentrenamiento unimodal)
Primero, dejaron que la IA practicara por su cuenta. Les dieron dos tipos de datos:

  1. Texto relacionado con la música: Artículos, preguntas y respuestas sobre teoría musical (como "¿Qué es un acorde menor?").
  2. Archivos MIDI independientes: Miles de partituras musicales puras sin ninguna descripción de texto.
    Esta etapa consistió en enseñarle a la IA la "sintaxis" de la música. Aprendió cómo encajan las notas, cómo funcionan los ritmos y la estructura de una canción, todo sin necesidad de que un humano le dijera qué hacer. Es como un músico practicando escalas y leyendo partituras en una habitación silenciosa.

Etapa 2: El dúo (Ajuste fino supervisado multimodal)
A continuación, emparejaron a la IA con un compañero. Le dieron pares de texto y música: un prompt como "una canción pop alegre" seguido inmediatamente por la partitura MIDI correspondiente. Esto enseñó a la IA a traducir ideas humanas en instrucciones musicales. Si decías "jazz", aprendía a escribir notas de jazz. Si decías "triste", aprendía a escribir acordos menores lentos. Este es el momento en que la IA aprende a escuchar tu petición y realmente toca lo que pediste.

Lo que encontraron

Los resultados fueron bastante impresionantes. Cuando probaron su nuevo MIDI-LLM contra un competidor reciente llamado Text2midi, su modelo resultó superior en dos aspectos principales:

  1. Mejor calidad: La música que generaba sonaba más realista y seguía mejor las reglas de la música.
  2. Mejor control: Escuchaba más de cerca las instrucciones de texto. Si pedías un estado de ánimo o género específico, realmente lo entregaba.
  3. Velocidad: Debido a que utilizaron una arquitectura de IA estándar (basada en Llama 3.2), pudieron usar herramientas informáticas existentes y súper rápidas para ejecutar el modelo. Su modelo era de 7 a 13 veces más rápido que el competidor, a pesar de ser ligeramente más grande.

También probaron una función especial llamada "infilling" (relleno). Imagina que tienes una canción a medio terminar y quieres que la IA escriba la parte del medio. El equipo descubrió que la IA era muy buena en esto, pero había un equilibrio delicado. Si la IA se enfocaba demasiado en el texto que escribiste, podría ignorar la música que ya habías escrito. Si se enfocaba demasiado en la música existente, podría ignorar tus nuevas instrucciones de texto. Para solucionar esto, introdujeron una "perilla" (llamada Guía Libre de Clasificador o Classifier-Free Guidance) que permite a los usuarios ajustar cuánto debe la IA escuchar al texto frente a la música existente.

Pruebas en el mundo real: El estudio "In-the-Wild"

Para ver si esto realmente ayudaba a personas reales, el equipo no solo realizó pruebas computacionales; salieron al mundo real. Se asociaron con Hookpad, un sitio web donde los compositores crean música. Dejaron que 58 usuarios reales (que ya eran suscriptores) probaran su nuevo copiloto de IA.

Se les pidió a los usuarios que crearan canciones desde cero o que completaran partes faltantes de canciones. Podían elegir entre tres modelos de IA diferentes:

  • El modelo antiguo (que solo miraba la música, ignorando el texto).
  • Una versión del nuevo modelo que ignoraba el texto.
  • El nuevo MIDI-LLM completo (que escuchaba el texto).

Los resultados mostraron que cuando los usuarios comenzaban una canción desde cero ("zero-to-one"), el MIDI-LLM completo era el claro ganador. Tenía casi el doble de la tasa de aceptación de los otros modelos. Esto sugiere que cuando las personas están tratando de poner en marcha una nueva idea, poder escribir "haz que suene como una canción de rock de los 90" es increíblemente valioso.

Sin embargo, cuando los usuarios solo estaban llenando un pequeño vacío en una canción existente, los resultados fueron más mixtos. A veces, los usuarios preferían el modelo más antiguo que ignoraba el texto. Los investigadores sugieren que esto puede deberse a que, cuando ya estás inmerso en una canción, es posible que quieras que la IA simplemente "encaje" con lo que ya hay allí, en lugar de intentar forzar una nueva idea que pueda chocar con la melodía existente.

La conclusión

El artículo concluye que adaptar los Modelos de Lenguaje Grande para la música es una receta poderosa. Al enseñar a estos modelos a hablar tanto "texto" como "MIDI", crearon una herramienta que ayuda a los humanos y a la IA a colaborar de manera más efectiva. No se trata solo de generar ruido; se trata de dar a los creadores un compañero flexible, rápido e inteligente que puede convertir una simple oración en una partitura musical completa, lista para que ellos la ajusten y perfeccionen. El equipo ya está implementando esto para más usuarios, con la esperanza de ver cómo cambia la forma en que la gente escribe música en el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →