Can we trust AI to detect healthy multilingual English speakers among the cognitively impaired cohort in the UK? An investigation using real-world conversational speech
Deze studie concludeert dat huidige AI-modellen voor het detecteren van cognitieve achteruitgang in het VK onbetrouwbaar zijn voor multilinguale sprekers en sprekers met een Zuid-Yorkshire accent, omdat ze deze groepen systematisch vaker ten onrechte als cognitief gehandicapt classificeren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Titel: Kan de AI de taal van de hersenen verstaan, of luistert hij alleen naar de 'juiste' accenten?
Stel je voor dat je een zeer slimme robot hebt die gespecialiseerd is in het detecteren van geheugenproblemen, zoals dementie. Deze robot luistert naar mensen die praten en probeert te raden: "Is deze persoon gezond, of heeft hij al tekenen van een verouderend brein?"
In het Verenigd Koninkrijk (UK) is dit een heel belangrijk onderwerp. De bevolking wordt steeds diverser; één op de vier mensen heeft een andere achtergrond dan de traditionele Britse. Maar wat gebeurt er als deze robot alleen is getraind op mensen met een 'standaard' Engels accent? Kan hij ook de mensen met een Somalische, Chinese of Zuid-Azische achtergrond (die vaak Engels als tweede taal spreken) eerlijk beoordelen?
Dit onderzoek van de Universiteit van Sheffield probeerde precies dat uit te vinden. Hier is wat ze ontdekten, vertaald in alledaagse taal:
1. De Proef: Een grote luisterpartij
De onderzoekers verzamelden meer dan 1.300 mensen.
- De 'Standaard' Groep: Mensen die Engels als moedertaal spreken, verspreid over het hele VK.
- De 'Meertalige' Groep: Mensen uit Sheffield en Bradford die Engels spreken, maar ook Somali, Chinees, Hindi, Urdu of andere talen. Ze hebben vaak een specifiek accent (bijvoorbeeld het Zuid-Yorkshire of West-Yorkshire accent).
Deze mensen moesten praten tegen een virtuele assistent (een soort chatbot) die vragen stelde over hun herinneringen, hun schooltijd en het nieuws. De AI moest dan oordelen: "Gezond" of "Problemen".
2. De Resultaten: De Robot is eerlijk in het 'luisteren', maar vooroordeelt in het 'denken'
Hier is waar het interessant wordt. De onderzoekers keken naar twee verschillende stappen van de AI:
Stap A: Het luisteren (De vertaler)
Eerst keken ze of de AI de woorden goed kon verstaan (zoals een vertaler).
- Het nieuws: De AI (specifiek systemen zoals Whisper en NeMo) deed het even goed voor zowel de standaard-Engelsen als de meertaligen.
- De metafoor: Stel je voor dat de AI een tolk is. Of je nu met een sterk accent spreekt of niet, de tolk verstaat de woorden perfect. Er is hier geen sprake van vooroordeel.
Stap B: Het oordelen (De dokter)
Vervolgens keken ze of de AI de gezondheid van de spreker kon beoordelen op basis van hoe ze spraken (woordkeuze, pauzes, zinsbouw).
- Het nieuws: Hier ging het mis. De AI had een groot vooroordeel.
- De metafoor: Stel je voor dat de AI een dokter is die een patiënt diagnoseert. Deze dokter is getraind op mensen met een 'standaard' accent. Als een patiënt met een Zuid-Yorkshire accent of een Somalische achtergrond binnenkomt, denkt de dokter: "Huh, die praat anders dan ik gewend ben. Dat klinkt alsof er iets mis is met zijn geheugen!"
- De realiteit: De AI classificeerde gezonde meertalige mensen veel vaker ten onrechte als mensen met dementie of geheugenproblemen. Vooral mensen met een Zuid-Yorkshire accent werden zwaarder beoordeeld.
3. Waarom gebeurt dit? (De 'Cultuur-Clash')
De onderzoekers keken dieper in wat de mensen precies zeiden.
- Gezonde mensen met een standaard accent noemden vaak bekende Britse figuren (zoals de Premier) of plaatsen in het VK als antwoord op vragen.
- Gezonde meertalige mensen noemden vaak hun geboorteland (bijv. Pakistan) of steden in hun thuisland.
De AI zag dit verschil en dacht: "Oh, ze noemen geen Britse premier, dus ze begrijpen de vraag niet goed, of ze hebben een probleem." Maar in werkelijkheid was het gewoon een cultureel verschil, geen hersenprobleem. De AI miste de nuance.
4. De Conclusie: Nog niet klaar voor de kliniek
De boodschap van dit onderzoek is helder:
Hoewel de AI technologie heel slim is en woorden goed kan verstaan, is hij nog niet betrouwbaar genoeg om diagnoses te stellen bij mensen met een andere achtergrond of accent.
Het is alsof je een alarmklok hebt die perfect werkt als je hem in het Engels aanzet, maar als je hem in het Frans aanzet, gaat hij continu piepen, zelfs als er geen brand is.
Wat betekent dit voor de toekomst?
De onderzoekers zeggen: "We moeten de AI niet direct gebruiken in ziekenhuizen voor deze groep mensen." Ze moeten eerst de AI 'hertrainen' zodat hij leert dat een ander accent of het noemen van een ander land niet betekent dat iemand dement is. Ze willen in de toekomst meer mensen met cognitieve problemen uit deze groepen werven om de AI eerlijker te maken.
Kort samengevat: De AI is een slimme luisteraar, maar nog een vooroordeelvolle rechter. Voordat we hem vertrouwen om diagnoses te stellen bij de diverse bevolking van het VK, moeten we hem eerst leren dat 'anders spreken' niet hetzelfde is als 'ziek zijn'.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.