User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models
Dit artikel onderzoekt het potentieel van het gebruik van Large Language Models voor het analyseren van gebruikersbeoordelingen op bruikbaarheidseisen en toont aan, aan de hand van een gecodeerde dataset en prompt engineering, dat LLM's mensvergelijkbare prestaties kunnen behalen bij het identificeren van bruikbaarheidsproblemen, mits prompts zorgvuldig worden ontworpen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de chef bent van een drukke restaurant. Je wilt precies weten wat je klanten van je eten vinden, zodat je je menu kunt verbeteren. Je zou een team van professionele foodcritici kunnen inhuren om elk gerecht te proeven en gedetailleerde rapporten te schrijven, maar dat is duur en traag. Je zou ook gewoon de duizenden rommelige, emotionele en soms verwarrende recensies kunnen lezen die mensen op je website achterlaten.
Dit artikel gaat over het proberen om een superslimme computer (een Groot Taalmodel, of LLM) aan te leren die rommelige recensies te lezen en diegenen te vinden die echt gaan over bruikbaarheid—dat wil zeggen, hoe makkelijk of moeilijk de app is om te gebruiken.
Hier is het verhaal van hun experiment, simpel uitgelegd:
Het Probleem: Te Veel Ruis, Te Weinig Tijd
Softwarebedrijven verdrinken in gebruikersrecensies. Mensen schrijven dingen als: "Deze app is een nachtmerrie!" of "Ik heb drie keer geklikt en het werkt nog steeds niet!" of "Ik hou van de nieuwe functie, maar de knop is te klein."
- De Oude Manier: Om de bruikbare klachten te vinden, trainden onderzoekers vroeger computers met Machine Learning. Maar dit was als proberen een hond fetch te leren door duizenden stokken naar hem te gooien en hopen dat hij het leert. Het vereiste eerst een enorme hoeveelheid menselijke arbeid om de data te labelen.
- Het Nieuwe Idee: Wat als we gewoon een superintelligente computer (de LLM) vragen de recensies te lezen en ons te vertellen welke gaan over "bruikbaarheid"? Deze computers zijn al getraind op het hele internet, dus ze begrijpen de context misschien zonder dat we ze vanaf nul hoeven aan te leren.
Het Experiment: De "Smaaktest"
De onderzoekers uit Duitsland zetten een gecontroleerde test op om te zien of de computer het werk net zo goed kon doen als een menselijk expert.
De Ingrediënten: Ze verzamelden 300 echte gebruikersrecensies van drie heel verschillende soorten apps:
- Een verkeers/radar-app (voor bestuurders).
- Een supermarkt-app (voor shoppers).
- Een muziekmaak-app (voor muzikanten).
- Waarom deze drie? Om ervoor te zorgen dat de computer niet alleen goed was in één specifiek type taal.
De Menselijke Rechters: Twee menselijke experts lazen alle 300 recensies. Ze gebruikten een beroemde checklist (Nielsens 10 Bruikbaarheidsheuristieken) om te beslissen of een recensie ging over "bruikbaarheid" (Waar) of niet (Onwaar). Ze discussieerden over de lastige gevallen tot ze het eens waren. Dit creëerde het "Gouden Standaard" antwoordensleutel.
De Computerstudent: Ze gaven de LLM een set instructies (een Prompt genoemd). Denk aan deze prompt als een recept.
- Eerste poging: Het recept was vaag. De computer raakte in de war.
- Tweede en Derde poging: De onderzoekers verfijnden het recept, door meer specifieke stappen en voorbeelden toe te voegen (zoals de computer vertellen: "Als iemand zegt dat de app 'omstandig' is, telt dat als een bruikbaarheidsprobleem").
- De Eindtest: Ze gaven de computer het finale, gepolijste recept en vroegen hem om alle 300 recensies te beoordelen.
De Resultaten: Een Veelbelovende, Maar Onvolmaakte Student
De onderzoekers vergeleken de cijfers van de computer met het antwoordensleutel van de menselijke experts.
- Het Goede Nieuws: De computer was verrassend goed in het vinden van de "Waar"-recensies. Hij miste niet veel bruikbaarheidsklachten. Als een mens zei: "Dit is een bruikbaarheidsprobleem", stemde de computer meestal in.
- Het Slechte Nieuws: De computer was een beetje te enthousiast. Hij markeerde soms recensies als "bruikbaarheidsproblemen" terwijl de mensen dachten dat het gewoon algemene klachten of bugs waren.
- De Betrouwbaarheidstest: Toen ze maten hoe vaak de computer en de mensen het eens waren over het exacte zelfde antwoord, waren de resultaten gemengd.
- Voor de muziek-app waren ze het vrij goed eens.
- Voor de verkeers- en supermarkt-apps waren ze vaker het oneens.
- Cruciaal: de fouten van de computer gebeurden niet op dezelfde plekken waar de mensen onzeker waren. De computer maakte zijn eigen unieke fouten, wat betekent dat hij nog niet perfect "dacht" als een menselijk expert.
De Conclusie: Een Behulpzame Assistent, Geen Vervanging
Het artikel concludeert dat hoewel de computer nog niet klaar is om menselijke experts volledig te vervangen, het een zeer nuttig hulpmiddel is.
Denk aan de LLM als een supersnelle stagiair.
- Als je de stagiair vraagt 1.000 recensies te lezen, zal hij bijna elke enkele klacht over bruikbaarheid vinden.
- Hij kan ook een paar dingen markeren die eigenlijk geen bruikbaarheidsproblemen zijn (valse alarmen), maar de onderzoekers betogen dat het beter is om een paar extra recensies te hebben om te controleren dan een echt probleem te missen.
- De sleutel om de stagiair goed te laten werken, was de Prompt (de instructies). Een vage instructie leidde tot slechte resultaten; een gedetailleerde, zorgvuldig samengestelde instructie leidde tot goede resultaten.
Kortom: Je hoeft geen maanden te besteden aan het trainen van een computer om recensies te lezen. Je hoeft alleen een slimme computer een heel duidelijke set instructies te geven, en hij kan een uitstekende job doen om je te helpen vinden wat je gebruikers echt nodig hebben. Echter, je hebt nog steeds een mens nodig om het werk te controleren, vooral voor lastige gevallen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.