Multi-Level Testing of Conversational AI Systems
Deze proefschrift stelt een nieuw meerlagig testframework voor conversational AI-systemen voor om de beperkingen van bestaande oplossingen aan te pakken door constituerende elementen te valideren over verschillende granulariteiten, van individuele AI-componenten tot complexe multi-agent implementaties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, pratende robotassistent hebt gebouwd. Het is de bedoeling dat de robot je vragen begrijpt, informatie opzoekt, afspraken boekt en misschien zelfs met andere robots praat om taken uit te voeren. Maar soms raakt deze robot in de war, herhaalt hij zichzelf, geeft hij de verkeerde weersverwachting door, of stelt hij zelfs voor om de wet te overtreden.
Dit artikel is een voorstel van een promovendus genaamd Elena Masserini om een betere "veiligheidsinspecteur" voor deze robots te bouwen. Ze betoogt dat de oude manieren van softwaretesten niet goed werken voor deze pratende AI-systemen, omdat menselijke taal rommelig, onvoorspelbaar en op een miljoen verschillende manieren te uiten is.
In plaats van alleen te controleren of de robot de juiste woorden zegt, stelt ze een drielaags inspectieplan voor, vergelijkbaar met het controleren van een auto in verschillende stadia van de assemblage:
Niveau 1: De "Vertaler en Gereedschapskist"-controle
De Analogie: Stel je voor dat de robot een brein heeft (de Taalcomponent) dat jou hoort, en een set gereedschappen (Services) die hij gebruikt om dingen te doen, zoals een agenda openen of een database controleren.
Het Probleem: Soms hoort het brein "Plan een vergadering", maar vergeet het de "Agenda-tool" te pakken, of het pakt de tool wel, maar gebruikt de verkeerde moersleutel.
De Oplossing: Het eerste niveau van testen richt zich op het waarborgen dat het brein en de tools correct met elkaar communiceren. De onderzoeker is van plan een slimme zoekmethode te gebruiken (zoals een detective die op zoek is naar aanwijzingen) om duizenden verschillende manieren te genereren om om hulp te vragen, om er zeker van te zijn dat de robot precies weet welke tool hij moet pakken en hoe hij die moet gebruiken.
Niveau 2: De "Solo Act"-controle
De Analogie: Stel je nu voor dat de robot een solovoorstelling op een podium geeft. Het gaat niet alleen om het gebruiken van tools; het gaat erom een samenhangend gesprek te voeren met een mens.
Het Probleem: Het is moeilijk om een regelboekje te schrijven voor elk mogelijk gesprek. Wat als de gebruiker een vreemde vraag stelt? Blijft de robot dan op koers?
De Oplossing: Omdat we niet voor elk scenario een perfect script kunnen schrijven, is de onderzoeker van plan een techniek genaamd "Metamorfe Testen" te gebruiken. Zie dit als een goocheltruc: als je de invoer licht verandert (zoals "Plan een vergadering" versus "Plan een praatje"), moet de output van de robot op een voorspelbare, logische manier veranderen. Als de robot in de war raakt door de kleine verandering, vangt de test de fout op.
Niveau 3: De "Orkest"-controle
De Analogie: Soms is één robot niet genoeg. Je hebt misschien een team van robots die samenwerken—de een regelt de facturatie, een ander de verzending en een derde de klantenvragen. Ze moeten briefjes aan elkaar doorgeven en coördineren als een orkest.
Het Problelem: Als de facturatie-robot met de verzendings-robot praat op het verkeerde moment, of als ze allebei dezelfde taak proberen uit te voeren, crasht het hele systeem.
De Oplossing: Dit niveau test het hele team. De onderzoeker is van plan om "AI-planning" te gebruiken om complexe scenario's te ontwerpen waarbij de robots moeten samenwerken om een probleem op te lossen. Ze zullen ook "nep"-robots (mocking agents) in de mix brengen om als dwarsliggers op te treden of om zeldzame, moeilijke situaties te simuleren om te zien of het team de chaos aankan.
Het Doel
Het uiteindelijke doel is om een toolkit te creëren die deze fouten vindt voordat de robot live gaat. De onderzoeker is al begonnen met het bouwen van een bibliotheek van verschillende robots om tegen te testen en ontwikkelt nieuwe manieren om te meten of de tests daadwerkelijk de fouten vinden die het meest belangrijk zijn voor ontwikkelaars.
Kortom, dit artikel gaat over het bewegen van eenvoudige "pass/fail" tests naar het bouwen van een geavanceerd, meerlagig veiligheidsnet om ervoor te zorgen dat onze conversatie-AI-assistenten betrouwbaar, slim en niet liegen tegen ons.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.