TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness
Dit artikel introduceert Harness-Aware Training (HAT), een driestaps raamwerk dat compacte digitale avatar-agenten in staat stelt om zich dynamisch aan te passen aan evoluerende e-commerce harness zonder hertraining, waarbij het een superieure real-time prestatie en robuustheid bereikt vergeleken met zowel basismodellen als grotere algemene LLM's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de bruisende wereld van online winkelen is een nieuw soort gastheer opgekomen: de digitale avatar. Dit zijn door de computer gegenereerde mensen die voor een camera staan, tegelijkertijd tegen duizenden kijkers spreken, vragen over producten beantwoorden en proberen verkopen te realiseren. Om dit te laten werken, moet de computer achter de avatar ongelooflijk snel zijn. Als het te lang duurt om na te denken en te spreken, voelt de livestream gebroken aan en vertrekken de kijkers. Maar snelheid is slechts de helft van de strijd. De avatar moet ook slim genoeg zijn om plotselinge veranderingen op te vangen. Een handelaar kan besluiten een kortingsregel te wijzigen, een nieuw product kan arriveren, of een veiligheidsvoorschrift kan de manier waarop de gastheer mag spreken veranderen. In het verleden vereiste het oplossen van deze problemen het stoppen van de show, het herschrijven van de computerhersenen en het opnieuw opstarten. Dit trage proces betekende dat de avatar vaak vastzat aan verouderde regels, niet in staat om zich aan te passen aan de snel bewegende behoeften van een levendige onderneming.
Onderzoekers bij TaoLive hebben dit probleem aangepakt door een systeem te creëren waarbij het "brein" en het "regelboek" van de avatar gescheiden zijn. Stel je de avatar voor als een bekwame acteur. Het regelboek bevat het script, de specifieke instructies over hoe een verkoop af te handelen, en de lijst met hulpmiddelen die het kan gebruiken, zoals het controleren van de voorraad of het opzoeken van prijzen. Het brein is de acteur die het script leest en optreedt. In hun nieuwe aanpak bouwde het team een flexibel regelboek dat direct bewerkt kan worden zonder het brein van de acteur aan te raken. Ze noemen dit de "Harness". Wanneer een handelaar een prijs of een regel wijzigt, werkt het team simpelweg de Harness bij. De acteur leest dan onmiddellijk de nieuwe instructies. Dit creëerde echter een lastige uitdaging: als de acteur alleen getraind was op één specifieke versie van het script, zou hij in de war raken wanneer het script veranderde. Hij zou de oude woorden memoriseren in plaats van te leren hoe hij de nieuwe woorden moet lezen. Om dit op te lossen, ontwikkelden de onderzoekers een nieuwe trainingsmethode genaamd Harness-Aware Training. In plaats van de acteur te leren één specifelijk script te memoriseren, trainden ze hem op honderden verschillende versies van het script tegelijkertijd. Ze door elkaar gehusseld de instructies, hernoemden de hulpmiddelen en veranderden de volgorde van de regels tijdens het trainingsproces. Dit dwong de acteur om te leren de betekenis van de instructies te begrijpen in plaats van alleen de specifieke woorden te memoriseren.
De resultaten van deze aanpak zijn opmerkelijk. Het team testte hun nieuwe avatar in real-world scenario's betrokken bij live-streaming e-commerce. Ze ontdekten dat de avatar die met deze nieuwe methode getraind was, productvragen kon beantwoorden en complexe interacties kon afhandelen met een gemiddelde nauwkeurigheid van 94,8 procent. Deze score was zelfs hoger dan de meest krachtige, algemene AI-modellen die op dat moment beschikbaar waren, die op dezelfde taken rond de 93,0 procent scoorden. Cruciaal was dat de nieuwe avatar niet zijn vermogen verloor om algemene instructies op te volgen toen het deze specifieke verkoopvaardigheden leerde. Oudere trainingsmethoden veroorzaakten vaak een daling in algemene intelligentie, maar deze nieuwe methode hield de avatar scherp en aanpasbaar. Wanneer de onderzoekers de avatar testten tegen een versie van het regelboek die hij nog nooit eerder had gezien, presteerde hij nog steeds met een nauwkeurigheid van 94,6 procent, wat bewees dat hij echt heeft geleerd zich aan te passen in plaats van alleen te memoriseren.
Snelheid was een ander groot obstakel. Omdat de avatar spreekt tot een live publiek, moet hij in realtime reageren. De onderzoekers implementeerden hun systeem op een enkele hoogwaardige grafische kaart. Zelfs met de complexe taak van het lezen van veranderende regels, het controleren van feiten en het genereren van spraak, reageerde de avatar snel. De helft van de tijd duurde het slechts 3,4 seconden om een volledig antwoord te geven. Zelfs in de tragere gevallen was 95 procent van de reacties klaar binnen 8,1 seconden. Dit voldoet aan de strikte eisen van een live uitzending, waarbij te lang wachten de flow van de show onderbreekt. Het systeem bleek ook robuust tegen fouten. Wanneer de onderzoekers opzettelijk fouten introduceerden in het regelboek of de hulpmiddelen, was de avatar in staat om te herstellen en het gesprek correct voort te zetten, terwijl oudere systemen vaak volledig zouden falen.
Het team voerde ook een real-world test uit in een live winkelomgeving, waarbij hun nieuwe systeem werd vergeleken met de standaardmethode die in de industrie wordt gebruikt. Gedurende een periode van zeven dagen genereerde het nieuwe systeem 5,54 procent meer omzet per gebruiker dan het oude systeem. Het leidde ook tot een kleine maar meetbare toename van het aantal voltooide bestellingen. Deze verbeteringen kwamen zonder wijzigingen aan de onderliggende hardware of de noodzaak om het model telkens opnieuw te trainen wanneer een regel veranderde. Het systeem paste zich simpelweg aan de nieuwe instructies aan zodra deze werden uitgegeven.
Dit werk demonstreert dat het mogelijk is om een AI-agent te bouwen die zowel snel als flexibel is. Door de veranderende regels te scheiden van het leerproces, en door het model te trainen om die veranderingen te verwachten, hebben de onderzoekers een digitale gastheer gecreëerd die kan evolueren samen met een bedrijf. De avatar is niet langer een statisch programma dat constante software-updates nodig heeft om relevant te blijven. In plaats daarvan is het een dynamische partner die een nieuw script kan lezen en het correct kan uitvoeren, of het script nu gaat over een zomeruitverkoop, een nieuwe productlancering of een plotselinge beleidswijziging. De bevindingen suggereren dat voor AI om echt nuttig te zijn in snelle, real-world omgevingen, het niet alleen getraind moet worden om het antwoord te weten, maar om te begrijpen hoe het antwoord te vinden in een wereld die constant verandert.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.