Assessing Task-based Chatbots: Snapshot and Curated Datasets for Dialogflow
Dit artikel introduceert TOFU-D en COD, twee datasets bestaande uit respectievelijk 1.788 en 185 Dialogflow-chatbots om het tekort aan gecureerde bronnen voor empirisch onderzoek aan te pakken, terwijl een voorlopige analyse aantoont dat er aanzienlijke hiaten zijn in de testdekking en frequente beveiligingskwetsbaarheden die de noodzaak voor systematische multi-platformstudies naar de kwaliteit en beveiliging van chatbots onderstrepen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van chatbots voor als een enorme, bruisende stad. Al een lange tijd proberen onderzoekers die bestuderen hoe ze betere, veiligere en betrouwbaardere chatbots kunnen bouwen, door deze stad te navigeren, maar ze hebben gewerkt met een zeer incomplete kaart. Ze hebben vooral gekeken naar een paar kleine, open-source wijken (zoals de "Rasa"-wijk), maar ze hebben het grote, commerciële stadscentrum waar de zware, zakelijke chatbots wonen, niet echt verkend.
Dit artikel is alsof een team van stadsplanners eindelijk heeft besloten om een snapshot te maken van dat hele commerciële stadscentrum. Dit is wat ze hebben gedaan, eenvoudig uitgelegd:
1. De Grote Snapshot (TOFU-D)
De onderzoekers gingen naar GitHub (een enorme online bibliotheek waar mensen hun code opslaan) en zochten naar alles wat gelabeld was als "Dialogflow". Dialogflow is een populaire, commerciële tool gemaakt door Google die bedrijven gebruiken om chatbots te bouwen.
- De Jacht: Ze begonnen met meer dan 12.000 potentiële "gebouwen" (repositories).
- De Filter: Ze realiseerden zich dat veel van deze slechts lege percelen of bouwplaatsen waren, geen echte chatbots. Ze filterden de ruis eruit en vonden 1.788 werkelijke, werkende chatbot-"gebouwen".
- Het Resultaat: Ze creëerden een dataset genaamd TOFU-D. Denk aan dit als een enorme, ongeëditeerde fotoalbum van elke chatbot die ze op een specifieke dag in dat specifieke district konden vinden. Het toont de rauwe werkelijkheid: sommige zijn klein, sommige zijn enorm, sommige zijn rommelig en sommige zijn briljant.
2. De Gecureerde Rondleiding (COD)
Het bekijken van 1.788 chatbots is overweldigend, en veel van hen zijn slechts "speelgoed"-voorbeelden of kapotte prototypes. Om dit nuttig te maken voor serieus onderzoek, heeft het team een tweede, kleinere dataset gemaakt genaamd COD.
- De Selectie: Ze traden op als een museumconservator. Ze kozen niet zomaar willekeurige chatbots; ze kozen de exemplaren die daadwerkelijk iets interessants deden. Ze zochten naar chatbots die:
- Een echt gesprek voerden (niet alleen een lijst met vooraf geschreven antwoorden).
- Verbinding maakten met externe diensten (zoals een restaurantbot die daadwerkelijk een menu-database controleert).
- In het Engels geschreven waren (zodat onderzoekers ze konden begrijpen).
- Populair genoeg waren om een "ster" op hun GitHub-pagina te hebben.
- Het Resultaat: Ze kwamen uit op 185 hoogwaardige chatbots. Dit is hun "Hall of Fame"-collectie, ontworpen om de perfecte proefpersonen te zijn voor het bestuderen van hoe deze bots werken en waar ze falen.
3. Wat ze vonden in de Stad
Toen de onderzoekers door deze chatbots liepen, merkten ze enkele interessante dingen op over de "architectuur" van deze stad:
- Taalmix: Hoewel de meeste chatbots Engels spreken, is de stad verrassend divers. De code achter hen is geschreven in veel verschillende talen (JavaScript, Python, Java, etc.), in tegenstelling tot de open-source wijk waar iedereen voornamelijk Python spreekt.
- Complexiteit: De gecureerde chatbots (COD) waren veel complexer. Ze zeiden niet alleen "Hallo" en "Dagzeg"; ze voerden daadwerkelijk taken uit, maakten verbinding met cloud-diensten en verwerkten echte gebruikersgegevens.
- De "Google"-verbinding: Veel van deze chatbots zijn gebouwd om naadloos samen te werken met Google's eigen tools, zoals de Google Assistant, een functie die je in de open-source wijk minder vaak ziet.
4. De Veiligheidsinspectie (De "Bandit" en "Botium" controles)
Om te zien of deze chatbots veilig en betrouwbaar waren, voerden de onderzoekers twee snelle tests uit, als een bouwinspecteur en een kwaliteitscontrolemanager:
- De Kwaliteitscontrole (Botium): Ze probeerden automatisch testgevallen te genereren (zoals een robot die probeert met de chatbot te praten om te zien of hij vastloopt). Ze ontdekten dat de tests vaak ontbraken. De chatbots waren geweldig in het beantwoorden van eenvoudige vragen, maar faalden vaak wanneer gebruikers "Hallo" zeiden, iets onverwachts probeerden te zeggen, of wanneer ze zich moesten herinneren wat er eerder was gezegd. Het was alsof je een auto vindt die geweldig rijdt op een recht stuk weg, maar stilvalt bij het eerste stoplicht.
- De Beveiligingscontrole (Bandit): Ze keken naar de code op beveiligingslekken. Ze ontdekten dat veel chatbots "open deuren" hadden. Bijvoorbeeld:
- Sommigen luisterden naar verbindingen van elk netwerk, en niet alleen van de netwerken die ze zouden moeten gebruiken.
- Sommigen lieten code draaien die niet gedraaid zou mogen worden.
- Ze vonden ook veelvoorkomende fouten, zoals het vergeten van tijdslimieten op verzoeken (wat het systeem kan laten bevriezen) of het gebruik van zwakke willekeurige getallengeneratoren.
De Kernboodschap
Het hoofdpunt van dit artikel is dat onderzoekers niet langer alleen eenvoudige chatbots kunnen bestuderen. De wereld van chatbots is enorm en gevarieerd. Door deze twee nieuwe datasets te leveren — de enorme snapshot (TOFU-D) en de hoogwaardige gecureerde lijst (COD) — geven de auteurs de onderzoekscommunity een veel betere kaart en een beter pakket aan proefsubjecten.
Ze zeggen niet dat deze chatbots perfect zijn; sterker nog, hun tests laten zien dat ze aanzienlijke tekortkomingen hebben in testen en beveiliging. Maar door het hebben van een duidelijke, grote en diverse collectie echte praktijkvoorbeelden, kunnen onderzoekers eindelijk beginnen met het systematisch oplossen van die gebreken, in plaats van te gissen op basis van een paar kleine voorbeelden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.