Integrating Multi-Label Classification and Generative AI for Scalable Analysis of User Feedback
Dit artikel presenteert technieken voor het efficiënt analyseren van grote volumes gebruikersfeedback door supervised multi-label classificatie voor topiccategorisatie te combineren met generatieve AI voor samenvatting, terwijl wordt aangetoond dat sentimentanalyse een onbetrouwbare proxy is voor algehele producttevredenheid, die expliciet gemeten moet worden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorm softwarebedrijf runt. Elke dag sturen duizenden klanten je brieven (gebruikersreacties) waarin ze vertellen wat ze geweldig vinden, wat ze haten en wat er kapot is. Als je elke brief met de hand zou proberen te lezen, zou je begraven zijn onder een berg papier voordat je je ontbijt hebt uitgespezen.
Dit artikel gaat over hoe het team bij SAP een "slimme assistent" heeft gebouwd om hen te helpen deze berg brieven te lezen, te sorteren en te begrijpen zonder dat ze door het stof heen gaan. Dit is hoe ze het deden, onderverdeeld in eenvoudige delen:
1. De Sorteerhoed (Multi-Label Classificatie)
Stel je een enorme stapel gemengde brieven voor. Sommige gaan over de lettergrootte, sommige over trage laadtijden en sommige over bugs.
- Het Probleem: Mensen kunnen niet snel genoeg duizenden brieven sorteren, en als ze dat wel proberen, raken ze vermoeid of maken ze fouten.
- De Oplossing: Het team trainde een computerprogramma (een AI) om te fungeren als een supersnelle bibliothecaris. Ze leerden het een specifieke set "planken" (categorieën) aan, zoals Gebruiksgemak, Fouten, Prestaties en Help.
- Hoe het werkt: De computer leest een brief en kan deze tegelijkertijd op meer dan één plank plaatsen. Een brief kan bijvoorbeeld zowel over een "trage laadtijd" (Prestaties) als over een "crash" (Fout) gaan.
- Het Resultaat: Ze bouwten een systeem dat deze brieven automatisch met een hoge nauwkeurigheid kan sorteren. Ze hebben zelfs een menselijk "kwaliteitscontrole"-team dat het werk van de AI af en toe controleert om te zorgen dat deze niet lui of verward wordt.
2. De Samenvatter (Generatieve AI)
Zodra de brieven zijn gesorteerd, willen de bazen (managers) nog steeds niet 5.000 individuele brieven lezen. Ze willen alleen weten wat de "kern" is van wat mensen zeggen.
- Het Probleem: Toen ze voor het eerst probeerden AI te gebruiken om samenvattingen te schrijven, was de AI een beetje een dramaqueen. De AI focuste te veel op de boze brieven, haalde de volgorde van onderwerpen door elkaar, of verzon soms dingen (hallucinaties) die niemand eigenlijk had gezegd.
- De Oplossing: Ze veranderden de regels. In plaats van de AI te vragen om "een verhaal te schrijven", zeiden ze: "Kijk naar deze specifie{%} specifieke stapels brieven. Schrijf voor elke stapel een korte samenvatting van wat mensen zeiden, en vermeld de exacte brieven die dit bewijzen."
- Het Resultaat: Nu produceert de AI een helder rapport dat zegt: "Dit is wat mensen vinden van Prestaties, en hier zijn drie werkelijke brieven die dit ondersteunen." Dit voorkomt dat de bazen beslissingen nemen op basis van verzonnen verhalen of alleen de luidste klachten.
3. De "Grummelige Klant" Valstrik (Sentimentanalyse)
Dit is het meest verrassende deel van het artikel. Het team wilde weten: Als een klant een boze brief schrijft, betekent dat dan dat ze ons product haten?
- De Veelvoorkomende Fout: Veel mensen gaan ervan uit dat als een brief boos klinkt (negatief sentiment), de klant het hele product haat. Het is alsof je ervan uitgaat dat omdat iemand een ober uitscheldt over een koude soep, hij het hele restaurant haat.
- De Reality Check: Het team keek naar twee verschillende enquêtes. Ze vergeleken de "toon" van de brieven met de werkelijke "tevredenheidsscores" die de klanten gaven (zoals een score van 1 tot 10).
- De Bevinding:
- Positieve brieven kwamen bijna altijd van tevreden klanten.
- Negatieve brieven kwamen echter vaak van zeer tevreden klanten die gewoon één specifiek probleem hadden.
- De Analogie: Stel je een fan voor die van een sportteam houdt, maar woedend is omdat de scheidsrechter een slechte beslissing heeft genomen. De fan kan een boze brief schrijven over de scheidsrechter, maar houdt nog steeds van het team.
- De Conclusie: Je kunt het "boosheidsniveau" van de brieven niet gebruiken om te raden hoe tevreden de klanten in het algemeen zijn. Een hoog aantal boze brieven betekent niet dat het product slecht is; het kan ook betekenen dat mensen genoeg om het product geven om specifieke bugs aan te wijzen.
De Belangrijkste Les
Om je klanten te begrijpen, heb je twee dingen nodig die samenwerken:
- De Cijfers: De tevredenheidsscores vertellen je hoe tevreden mensen in het algemeen zijn.
- De Brieven: De commentaren vertellen je waarom ze dat zo voelen en welke specifieke zaken er gerepareerd moeten worden.
Het artikel waarschuwt ons om niet in paniek te raken wanneer we boze brieven zien. In plaats daarvan moeten we slimme hulpmiddelen gebruiken om ze te sorteren, samen te vatten en te beseffen dat een boze brief vaak komt van een klant die eigenlijk van het product houdt, maar wil dat het nog beter wordt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.