TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness
Questo articolo introduce l'Harness-Aware Training (HAT), un framework in tre fasi che consente agli agenti avatar digitali compatti di adattarsi dinamicamente all'evoluzione degli harness dell'e-commerce senza necessità di riaddestramento, ottenendo prestazioni in tempo reale e robustezza superiori rispetto sia ai modelli base che ai più grandi LLM generalisti.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel frenetico mondo dello shopping online, è emerso un nuovo tipo di host: l'avatar digitale. Si tratta di persone generate al computer che stanno davanti a una telecamera, parlando a migliaia di spettatori contemporaneamente, rispondendo a domande sui prodotti e cercando di vendere. Affinché ciò funzioni, il computer dietro l'avatar deve essere incredibilmente veloce. Se impiega troppo tempo per pensare e parlare, la diretta streaming sembra interrotta e gli spettatori se ne vanno. Ma la velocità è solo metà della battaglia. L'avatar deve anche essere abbastanza intelligente da gestire i cambiamenti improvvisi. Un commerciante potrebbe decidere di cambiare una regola di sconto, potrebbe arrivare un nuovo prodotto o una normativa sulla sicurezza potrebbe cambiare il modo in cui l'host è autorizzato a parlare. In passato, risolvere questi problemi richiedeva di interrompere lo spettacolo, riscrivere il cervello del computer e ricominciare da capo. Questo processo lento significava che l'avatar era spesso bloccato con regole obsolete, incapace di adattarsi alle esigenze rapide di un business in tempo reale.
I ricercatori di TaoLive hanno affrontato questo problema creando un sistema in cui il "cervello" dell'avatar e il suo "libro delle regole" sono separati. Immaginate l'avatar come un attore esperto. Il libro delle regole contiene la sceneggiatura, le istruzioni specifiche su come gestire una vendita e l'elenco degli strumenti che può utilizzare, come controllare l'inventario o cercare i prezzi. Il cervello è l'attore che legge la sceneggiatura e recita. Nel loro nuovo approccio, il team ha costruito un libro delle regole flessibile che può essere modificato istantaneamente senza toccare il cervello dell'attore. Lo chiamano "Harness" (Imbracatura). Quando un commerciante cambia un prezzo o una regola, il team aggiorna semplicemente l'Harness. L'attore legge quindi le nuove istruzioni immediatamente. Tuttavia, questo ha creato una sfida complicata: se l'attore fosse stato addestrato solo su una versione specifica della sceneggiatura, si sarebbe confuso quando la sceneggiatura fosse cambiata. Avrebbe memorizzato le vecchie parole invece di imparare come leggere le nuove. Per risolvere questo problema, i ricercatori hanno sviluppato un nuovo metodo di addestramento chiamato Harness-Aware Training. Invece di insegnare all'attore a memorizzare una singola sceneggiatura, lo hanno addestrato su centinaia di versioni diverse della stessa contemporaneamente. Hanno rimescolato le istruzioni, rinominato gli strumenti e cambiato l'ordine delle regole durante il processo di addestramento. Questo ha costretto l'attore a imparare a comprendere il significato delle istruzioni piuttosto che limitarsi a memorizzare le parole specifiche.
I risultati di questo approccio sono sorprendenti. Il team ha testato il loro nuovo avatar in scenari reali riguardanti l'e-commerce in diretta streaming. Hanno scoperto che l'avatar addestrato con questo nuovo metodo poteva rispondere alle domande sui prodotti e gestire interazioni complesse con un'accuratezza media del 94,8 percento. Questo punteggio era superiore persino ai modelli IA generici più potenti disponibili all'epoca, che ottenevano circa il 93,0 percento negli stessi compiti. Fondamentalmente, il nuovo avatar non ha perso la capacità di seguire istruzioni generali imparando queste abilità di vendita specifiche. I vecchi metodi di addestramento causavano spesso un calo dell'intelligenza generale, ma questo nuovo metodo ha mantenuto l'avatar acuto e adattabile. Quando i ricercatori hanno testato l'avatar contro una versione del libro delle regole che non aveva mai visto prima, ha comunque ottenuto un'accuratezza del 94,6 percento, dimostrando di aver imparato davvero ad adattarsi piuttosto che a memorizzare.
Anche la velocità era un ostacolo importante. Poiché l'avatar parla a un pubblico dal vivo, deve rispondere in tempo reale. I ricercatori hanno implementato il loro sistema su una singola scheda grafica ad alte prestazioni. Anche con il compito complesso di leggere regole variabili, controllare i fatti e generare il parlato, l'avatar rispondeva rapidamente. La metà delle volte, impiegava solo 3,4 secondi per dare una risposta completa. Anche nei casi più lenti, il 95 percento delle risposte era pronto entro 8,1 secondi. Questo soddisfa le rigide richieste di una trasmissione dal vivo, dove aspettare troppo tempo interrompe il flusso dello spettacolo. Il sistema si è anche dimostrato robusto contro gli errori. Quando i ricercatori hanno intenzionalmente introdotto errori nel libro delle regole o negli strumenti, l'avatar è stato in grado di recuperare e continuare la conversazione correttamente, mentre i sistemi precedenti spesso fallivano completamente.
Il team ha anche condotto un test reale in un ambiente di shopping dal vivo, confrontando il loro nuovo sistema con il metodo standard utilizzato nel settore. In un periodo di sette giorni, il nuovo sistema ha aiutato a generare il 5,54 percento in più di entrate per utente rispetto al vecchio sistema. Ha inoltre portato a un piccolo ma misurabile aumento del numero di ordini completati. Questi miglioramenti sono arrivati senza alcuna modifica all'hardware sottostante o la necessità di riaddestrare il modello ogni volta che una regola cambiava. Il sistema si adattava semplicemente alle nuove istruzioni man mano che venivano emesse.
Questo lavoro dimostra che è possibile costruire un agente IA che sia sia veloce che flessibile. Separando le regole variabili dal processo di apprendimento, e addestrando il modello a prevedere tali cambiamenti, i ricercatori hanno creato un host digitale che può evolversi insieme a un business. L'avatar non è più un programma statico che necessita di continui aggiornamenti software per rimanere rilevante. Al contrario, è un partner dinamico che può leggere una nuova sceneggiatura ed eseguirla correttamente, che si tratti di una vendita estiva, del lancio di un nuovo prodotto o di un improvviso cambiamento di politica. I risultati suggeriscono che, affinché l'IA sia davvero utile in ambienti reali e frenetici, deve essere addestrata non solo a conoscere la risposta, ma a capire come trovare la risposta in un mondo che cambia costantemente.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.