← Últimos artículos
💻 computer science

TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness

Este artículo presenta el Entrenamiento Consciente del Arnés (HAT, por sus siglas en inglés), un marco de tres etapas que permite a los agentes de avatares digitales compactos adaptarse dinámicamente a arneses de comercio electrónico en evolución sin necesidad de reentrenamiento, logrando un rendimiento en tiempo real y una robustez superiores en comparación tanto con los modelos base como con los LLM generales más grandes.

Autores originales: TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el bullicioso mundo de las compras en línea, ha surgido un nuevo tipo de anfitrión: el avatar digital. Se trata de personas generadas por computadora que se sitúan frente a una cámara, hablando a miles de espectadores a la vez, respondiendo preguntas sobre productos e intentando realizar ventas. Para que esto funcione, la computadora detrás del avatar debe ser increíblemente rápida. Si tarda demasiado en pensar y hablar, la transmisión en vivo se siente interrumpida y los espectadores se van. Pero la velocidad es solo la mitad de la batalla. El avatar también debe ser lo suficientemente inteligente como para manejar cambios repentinos. Un comerciante podría decidir cambiar una regla de descuento, podría llegar un producto nuevo, o una regulación de seguridad podría cambiar la forma en que el anfitrión tiene permitido hablar. En el pasado, solucionar estos problemas requería detener el espectáculo, reescribir el cerebro de la computadora y empezar de nuevo. Este proceso lento significaba que el avatar a menudo se quedaba estancado con reglas desactualizadas, incapaz de adaptarse a las necesidades de un negocio de movimiento rápido.

Los investigadores de TaoLive han abordado este problema creando un sistema donde el "cerebro" del avatar y su "libro de reglas" están separados. Imagine al avatar como un actor experimentado. El libro de reglas contiene el guion, las instrucciones específicas sobre cómo manejar una venta y la lista de herramientas que puede usar, como verificar el inventario o buscar precios. El cerebro es el actor que lee el guion y actúa. En su nuevo enfoque, el equipo construyó un libro de reglas flexible que puede editarse instantáneamente sin tocar el cerebro del actor. Lo llaman el "Harness" (Arnés). Cuando un comerciante cambia un precio o una regla, el equipo simplemente actualiza el Harness. El actor entonces lee las nuevas instrucciones de inmediato. Sin embargo, esto creó un desafío complicado: si el actor fue entrenado solo en una versión específica del guion, se confundiría cuando el guion cambiara. Memorizaría las palabras antiguas en lugar de aprender cómo leer las nuevas. Para resolver esto, los investigadores desarrollaron un nuevo método de entrenamiento llamado Entrenamiento Consciente del Harness (Harness-Aware Training). En lugar de enseñar al actor a memorizar un solo guion, lo entrenaron en cientos de versiones diferentes del guion a la vez. Mezclaron las instrucciones, renombraron las herramientas y cambiaron el orden de las reglas durante el proceso de entrenamiento. Esto obligó al actor a aprender a comprender el significado de las instrucciones en lugar de solo memorizar las palabras específicas.

Los resultados de este enfoque son sorprendentes. El equipo probó su nuevo avatar en escenarios del mundo real que involucran comercio en vivo por streaming. Encontraron que el avatar entrenado con este nuevo método podía responder preguntas sobre productos y manejar interacciones complejas con una precisión promedio del 94.8 por ciento. Esta puntuación fue incluso superior a la de los modelos de IA de propósito general más potentes disponibles en ese momento, que puntuaron alrededor del 93.0 por ciento en las mismas tareas. Crucialmente, el nuevo avatar no perdió su capacidad de seguir instrucciones generales al aprender estas habilidades de venta específicas. Los métodos de entrenamiento anteriores a menudo causaban una caída en la inteligencia general, pero este nuevo método mantuvo al avatar agudo y adaptable. Cuando los investigadores probaron el avatar contra una versión del libro de reglas que nunca había visto, este todavía se desempeñó con una precisión del 94.6 por ciento, demostrando que realmente había aprendido a adaptarse en lugar de solo memorizar.

La velocidad fue otro gran obstáculo. Debido a que el avatar habla ante una audiencia en vivo, debe responder en tiempo real. Los investigadores implementaron su sistema en una sola tarjeta gráfica de alto rendimiento. Incluso con la compleja tarea de leer reglas cambiantes, verificar hechos y generar voz, el avatar respondió rápidamente. La mitad de las veces, tomó solo 3.4 segundos dar una respuesta completa. Incluso en los casos más lentos, el 95 por ciento de las respuestas estuvieron listas en 8.1 segundos. Esto cumple con las estrictas demandas de una transmisión en vivo, donde esperar demasiado rompe el flujo del espectáculo. El sistema también demostró ser robusto contra errores. Cuando los investigadores introdujeron errores intencionalmente en el libro de reglas o en las herramientas, el avatar fue capaz de recuperarse y continuar la conversación correctamente, mientras que los sistemas anteriores a menudo fallaban por completo.

El equipo también realizó una prueba en el mundo real en un entorno de compras en vivo, comparando su nuevo sistema contra el método estándar utilizado en la industria. Durante un período de siete días, el nuevo sistema ayudó a generar un 5.54 por ciento más de ingresos por ventas por usuario que el sistema antiguo. También condujo a un aumento pequeño pero mensurable en el número de pedidos completados. Estas mejoras se lograron sin realizar cambios en el hardware subyacente ni la necesidad de reentrenar el modelo cada vez que una regla cambiaba. El sistema simplemente se adaptaba a las nuevas instrucciones a medida que estas eran emitidas.

Este trabajo demuestra que es posible construir un agente de IA que sea tanto rápido como flexible. Al separar las reglas cambiantes del proceso de aprendizaje, y al entrenar al modelo para que espere esos cambios, los investigadores crearon un anfitrión digital que puede evolucionar junto con un negocio. El avatar ya no es un programa estático que necesita actualizaciones constantes de software para mantenerse relevante. En cambio, es un socio dinámico que puede leer un nuevo guion y representarlo correctamente, ya sea que el guion trate sobre una venta de verano, el lanzamiento de un nuevo producto o un cambio repentino en la política. Los hallazgos sugieren que para que la IA sea verdaderamente útil en entornos del mundo real de ritmo rápido, debe ser entrenada no solo para saber la respuesta, sino para entender cómo encontrar la respuesta en un mundo que cambia constantemente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →