← Últimos artículos
💻 computer science

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

LeVo 2 es un marco híbrido de LLM-Difusión que logra la generación de canciones completas, estables, melódicas y controlables mediante el empleo de un enfoque de modelado jerárquico y un programa de postentrenamiento progresivo guiado por la estética para resolver el compromiso entre la planificación semántica global y el refinamiento acústico específico de la pista.

Autores originales: Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

Publicado 2026-06-30
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: Enseñando a un Robot a Escribir un Éxito Musical

Imagina que quieres enseñarle a un robot a escribir una canción de larga duración desde cero. El robot debe hacer tres cosas difíciles al mismo tiempo:

  1. Planificar la canción: Decidir la melodía, el ritmo y cómo encajan la voz y los instrumentos.
  2. Escribir los detalles: Asegurarse de que el cantante suene humano y la guitarra suene nítida, no robótica.
  3. Seguir instrucciones: Si pides una "canción folk triste sobre la lluvia", realmente debe sonar así, no como una canción de rock alegre.

Los modelos de IA anteriores tenían dificultades porque intentaban hacer todo esto en un solo paso gigante y desordenado. O bien acertaban con el plan pero la calidad del sonido era pobre, o el sonido era excelente pero la canción no tenía sentido.

LeVo 2 es un nuevo sistema que resuelve esto actuando como un director de orquesta maestro y un equipo de músicos especializados trabajando juntos.


1. La Arquitectura: El Director y los Músicos

En lugar de un solo cerebro intentando hacerlo todo, LeVo 2 divide el trabajo en dos capas, como un General y una Unidad de Fuerzas Especiales.

  • El General (LM Semántico Mixto): Esta parte mira el panorama general. No se preocupa por los detalles minúsculos de las cuerdas de la guitarra todavía. En su lugar, planifica el "esqueleto" de la canción: la melodía, el tempo y dónde va el estribillo. Crea un plan "mixto" que asegura que la voz y los instrumentos se lleven bien entre sí.
  • Las Fuerzas Especiales (LM Específico de Pista): Una vez que el General tiene el plan, este equipo toma el control. Observan el plan y rellenan los detalles de alta definición. Un grupo se enfoca puramente en hacer que la voz suene perfecta, mientras que otro grupo se enfoca en hacer que los instrumentos suenen perfectos. Trabajan en paralelo, para que no se estorben entre sí.
  • El Ingeniero de Sonido (Codec de Música): Finalmente, un tercer componente toma las notas del General y de las Fuerzas Especiales y las convierte en ondas de audio reales y de alta calidad que puedes escuchar.

La Analogía: Piensa en la construcción de una casa. El General dibuja los planos (donde van las paredes). Las Fuerzas Especiales son los pintores y electricistas que añaden los detalles finos (el color de la pintura, el cableado). El Ingeniero de Sonido es la cuadrilla de construcción que realmente construye la casa para que puedas vivir en ella.

2. El Entrenamiento: Una Escuela de Tres Etapas para Músicos

Los autores se dieron cuenta de que no puedes simplemente lanzar a un robot a un estudio de música y esperar que sea bueno de inmediato. Crearon una escuela de entrenamiento de tres etapas guiada por un "Juez de Música Automatizado".

  • Etapa 1: La Clase de Teoría Musical (Pre-entrenamiento)
    El robot escucha miles de canciones. Pero no cualquier canción, sino que utiliza un sistema automatizado para calificarlas. Aprende primero de las canciones del "Top 5%". Aprende las reglas de la música (melodía, ritmo) y tiene una idea de qué es lo que suena "bien". Esto es como enseñar a un estudiante mostrándole solo los grandes éxitos de todos los tiempos.

  • Etapa 2: El Simulacro de Disciplina (Post-entrenamiento Progresivo)
    Ahora el robot conoce la teoría musical, pero aún puede cometer errores, como cantar las palabras incorrectas o ignorar tus instrucciones.

    • Primero, practica el Ajuste Fino Supervisado (SFT): Solo practica con las mejores canciones para lograr una calidad alta.
    • Luego, realiza el DPO Offline: Esto es como un entrenador estricto. El robot genera muchas versiones de una canción, y el entrenador elige la que sigue mejor la letra y la que más se parece al prompt (instrucción). El robot aprende a dejar de "alucinar" (inventar palabras falsas) y a empezar a escuchar.
    • Finalmente, realiza un DPO Semi-Online: El robot comienza a generar sus propias canciones nuevas y aprende de sus propias mejoras, elevando su creatividad artística sin perder su disciplina.
  • Etapa 3: La Clase Magistral (Extensión Modular)
    El General (el planificador) ahora es perfecto y está congelado (no cambia). Las Fuerzas Especiales (el equipo de detalles) reciben un entrenamiento extra. Practican cómo tomar un boceto tosco y convertirlo en una grabación de alta fidelidad y claridad cristalina. Esto asegura que las voces y los instrumentos suenen ricos y detallados.

3. La "Guía Estética"

Una innovación clave en este artículo es el Marco de Evaluación Estética Musical Automatizada. Imagina un robot juez que escucha una canción y le da una puntuación de "Musicalidad".

  • Durante el entrenamiento, este juez etiqueta las canciones con "Niveles de Musicalidad" (por ejemplo, "Nivel Superior", "Promedio", "Bajo").
  • El robot aprende que cuando ve la etiqueta "Nivel Superior", debe intentar generar algo increíble.
  • Esto ayuda al robot a entender por qué algunas canciones son mejores que otras, en lugar de simplemente copiarlas a ciegas.

4. Los Resultados: ¿Qué tan bueno es?

Los autores probaron LeVo 2 contra otros modelos de código abierto e incluso contra algunos sistemas comerciales famosos (como Suno y Mureka).

  • Mejor que el código abierto: LeVo 2 superó a todos los demás modelos de código abierto en casi todas las categorías, incluyendo melodía, arreglo y calidad de sonido.
  • Rivalizando con los profesionales: Se acercó mucho al rendimiento de los mejores sistemas comerciales, que suelen mantener sus secretos ocultos.
  • Seguimiento de instrucciones: Fue muy bueno cantando la letra correcta y coincidiendo con el estado de ánimo (emoción) que pediste, reduciendo significamente las "alucinaciones" donde la IA inventa palabras sin sentido.

Resumen

LeVo 2 es una nueva forma de hacer música con IA. En lugar de un solo cerebro intentando hacerlo todo a la vez, utiliza un equipo jerárquico (un planificador y especialistas en detalles) y una escuela de entrenamiento paso a paso que enseña a la IA a primero entender la teoría musical, luego aprender a seguir reglas y, finalmente, pulir el sonido hasta la perfección. El resultado es un sistema que puede generar canciones completas, coherentes y de alta calidad que suenan sorprendentemente humanas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →