LongCat-Video-Avatar 1.5 Technical Report
LongCat-Video-Avatar 1.5 es un marco de código abierto mejorado que prioriza la preparación para producción y la ingeniería sistemática para ofrecer generación de videos largos de calidad comercial, estables y con consistencia de identidad, con inferencia acelerada, superando a los sistemas propietarios líderes en diversos escenarios.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que quieres crear un personaje digital que pueda hablar, cantar y actuar como un ser humano real, pero solo tienes una foto de ellos y una grabación de audio de su voz. Durante mucho tiempo, hacer que estos personajes parezcan "reales" por más de unos pocos segundos ha sido como intentar equilibrar una casa de naipes en una tormenta de viento: podrían verse bien por un momento, pero luego sus rostros se distorsionan, sus labios no coinciden con las palabras o sus cuerpos comienzan a moverse de forma extraña.
El artículo LongCat-Video-Avatar 1.5 del equipo Meituan LongCat es un informe técnico sobre una nueva "receta" de código abierto para construir estos personajes digitales. En lugar de inventar un tipo completamente nuevo de magia, se centraron en perfeccionar la ingeniería para hacer que el resultado sea lo suficientemente estable para su uso en el mundo real (como en películas, noticias o atención al cliente).
Así es como lo lograron, explicado con analogías sencillas:
1. La actualización del "oído": Whisper Large
En la versión anterior, el modelo utilizaba un "oído" estándar (un codificador de audio llamado Wav2Vec2) para escuchar la voz. Era aceptable, pero a veces perdía los matices sutiles del habla.
- La actualización: Sustituyeron esto por Whisper Large, un sistema de audio mucho más potente.
- La analogía: Piensa en el oído antiguo como alguien escuchando una canción en una habitación ruidosa con tapones para los oídos. El nuevo Whisper Large es como ponerse auriculares de alta gama con cancelación de ruido en un estudio silencioso. Escucha cada pequeño detalle de la voz, lo que permite que los labios del personaje se muevan con precisión perfecta, coincidiendo exactamente con el sonido, incluso en videos largos.
2. El "gimnasio" para datos: Curación del conjunto de entrenamiento
No puedes enseñar a un actor digital simplemente mostrándole videos aleatorios. Si le muestras un video con un rostro borroso, una persona sosteniendo un cartel o dos personas hablando a la vez, el modelo se confunde.
- La solución: Construyeron un riguroso "gimnasio de datos". No simplemente vertieron miles de videos en el sistema. Los clasificaron como un bibliotecario organizando una biblioteca:
- Datos silenciosos: Enseñaron al modelo qué hacer cuando nadie está hablando (parpadear, respirar, mirar alrededor) para que el personaje no se congele ni parezca extraño cuando el audio se detiene.
- Datos de emoción: Alimentaron específicamente al modelo con videos de personas mostrando diferentes emociones (reír, llorar, reaccionar) para que el personaje no parezca simplemente un robot leyendo un guion.
- Datos multigenerales: Enseñaron al modelo cómo manejar una escena con dos personas hablando. Utilizaron un truco especial (dando a los personajes de fondo una pista de audio "silenciosa") para que solo la persona que debe hablar mueva realmente la boca, mientras los demás permanecen quietos.
3. El "entrenador" (RLHF): Aprendiendo de la retroalimentación humana
Incluso con buenos datos, el modelo podría seguir cometiendo pequeños errores, como una mano que parece ligeramente torcida o un rostro que se mueve de forma antinatural.
- El método: Utilizaron una técnica llamada Optimización de Política Relativa por Grupos (GRPO).
- La analogía: Imagina a un instructor de baile observando a un estudiante. En lugar de simplemente decir "Buen trabajo" o "Mal trabajo", el instructor compara el baile del estudiante con un grupo de otros bailarines y dice: "El movimiento de tu brazo es un 10% mejor que el promedio, pero tu trabajo de pies es un 5% peor". El modelo aprende de estas comparaciones para ajustar sus movimientos fotograma a fotograma, asegurando que las manos parezcan reales y el cuerpo se mueva de forma natural.
4. El "modo turbo": Hacerlo rápido
Por lo general, la generación de video de alta calidad es lenta. Es como hornear un pastel donde tienes que revisar el horno cada 5 minutos durante una hora.
- La innovación: Utilizaron una técnica llamada Destilación para comprimir el proceso.
- La analogía: Enseñaron al modelo a hornear el pastel en 8 pasos en lugar de los habituales 50. Es como entrenar a un corredor para que corra toda la carrera en 8 zancadas gigantes en lugar de 50 pasos pequeños y lentos. El resultado es un video que se ve igual de bien pero que se genera mucho más rápido, haciéndolo práctico para su uso en tiempo real.
5. Los resultados: ¿Cómo se compara?
El equipo probó su nuevo modelo contra los mejores sistemas de "caja cerrada" (secretos y de pago) actualmente en el mercado, como HeyGen y Kling Avatar.
- El veredicto: En una prueba a ciegas con más de 500 escenarios diferentes (incluyendo cabezas parlantes, canto, estilos de anime e incluso animales), LongCat-Video-Avatar 1.5 fue a menudo calificado como mejor o igual a estos costosos sistemas comerciales.
- Victorias clave:
- Sincronización labial: Los movimientos de la boca coincidieron perfectamente con el audio.
- Estabilidad: El personaje no parpadeó ni cambió de rostro durante videos largos.
- Identidad: El personaje se vio como la misma persona desde el principio hasta el final.
- Complejidad: Manejó situaciones complicadas, como una persona sosteniendo una guitarra o dos personas hablando, sin que los personajes de fondo movieran accidentalmente los labios.
Resumen
LongCat-Video-Avatar 1.5 es esencialmente un kit de herramientas "listo para producción". Toma la naturaleza desordenada y experimental de la generación de video con IA y la pulimenta con mejores oídos (Whisper), mejores datos de entrenamiento (silenciosos/emocionales/multigenerales), un entrenador estricto (RLHF) y un impulso de velocidad (Destilación). El objetivo no fue solo crear una demostración genial, sino construir un sistema lo suficientemente confiable para ser utilizado en negocios reales, y demostraron que funciona tan bien como (o mejor que) las mejores herramientas de pago disponibles hoy en día.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.