← Nieuwste papers
💬 NLP

Prompting language influences diagnostic reasoning and accuracy of large language models

Deze studie toont aan dat het taalgebruik bij het formuleren van prompts de diagnostische redenering en nauwkeurigheid van de meeste grote taalmodellen in klinische settings significant beïnvloedt, waarbij het Engels over het algemeen beter presteert dan het Frans bij vier van de vijf geëvalueerde modellen, wat een kritieke barrière voor een rechtvaardige wereldwijde implementatie benadrukt.

Oorspronkelijke auteurs: Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

Gepubliceerd 2026-05-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team hebt van vijf briljante medische studenten. Ze zijn ongelooflijk slim, hebben miljoenen medische boeken gelezen en kunnen complexe puzzels oplossen. Er is echter een addertje onder het gras: ze zijn allemaal naar school gegaan in verschillende landen, en hun "moedertaal" voor denken is Engels.

Dit artikel is als een rapportkaart dat test hoe goed deze studenten presteren wanneer ze worden gevraagd medische gevallen op te lossen in het Engels versus het Frans. De onderzoekers wilden zien of de taal waarin de vraag wordt gesteld, de kwaliteit van het antwoord beïnvloedt.

Hier is de uiteenzetting van wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. De Opzet: De "Medische Puzzel"-toets

De onderzoekers creëerden 180 medische puzzels (zogenaamde vignettes). Dit waren niet zomaar meerkeuzevragen; het waren korte verhalen over patiënten met symptomen, vergelijkbaar met wat een arts in een echte kliniek ziet.

  • De Toets: Ze gaven deze puzzels aan vijf verschillende AI-modellen (de "studenten"): o3, DeepSeek-R1, GPT-4-Turbo, Llama-3.1 en BioMistral.
  • De Twist: Ze stelden dezelfde puzzels twee keer aan elke student: een keer in het Engels en een keer in het Frans.
  • De Beoordelaars: Twee echte artsen fungeerden als de leraren. Ze keken niet alleen na of het eindantwoord klopte; ze beoordeelden het hele denkproces (de redenering) op een schaal van 0 tot 18. Ze keken naar zaken als:
    • Heeft de student alle aanwijzingen opgemerkt?
    • Was de logica waterdicht?
    • Hebben ze andere mogelijkheden overwogen?
    • Was de uiteindelijke diagnose correct?

2. De Resultaten: Het "Engelse Voordeel"

Voor vier van de vijf studenten waren de resultaten duidelijk: Ze presteerden aanzienlijk beter wanneer ze Engels spraken.

  • De Kloof: Hoewel deze modellen vloeiend Frans kunnen spreken, werkte hun "brein" beter in het Engels. Het is alsof een muzikant een liedje in het Frans kan spelen, maar zijn vingers sneller bewegen en zijn ritme perfecter is wanneer hij in het Engels speelt.
  • De Score: Gemiddeld waren de Engelse antwoorden beter met een opmerkelijke marge (tussen 0,37 en 0,91 punten op de 18-puntenschaal).
  • Waar de Kloof Ontstaat: Het verschil ging niet alleen over het eindantwoord. De studenten maakten meer logische fouten, misten meer aanwijzingen en hadden een zwakkere redenering wanneer ze gedwongen werden in het Frans te denken.
    • Analogie: Stel je een detective voor die een mysterie oplost. In het Engels volgt hij de spoor van aanwijzingen perfect. In het Frans kan hij afgeleid raken, een aanwijzing missen of tot een conclusie springen die niet helemaal past bij het bewijsmateriaal, zelfs als hij uiteindelijk de juiste naam raadt.

3. De Uitzondering: De "Super-Student"

Eén model, o3, was de enige die geen verschil toonde tussen Engels en Frans.

  • Waarom? Het artikel suggereert dat dit model een speciale "superkracht" heeft genaamd geavanceerde redeneercapaciteiten. Het lijkt erop dat naarmate AI beter wordt in het stap-voor-stap doordenken van problemen (zoals het doen van complexe wiskunde in zijn hoofd), de taalbarrière begint te verdwijnen. Het is als een student die de logica van de puzzel zo goed heeft beheerst dat het niet uitmaakt in welke taal de instructies zijn geschreven.

4. Waarom Dit Belangrijk Is (Volgens Het Artikel)

Het artikel betoogt dat taal niet zomaar een omhulsel is voor de AI; het is onderdeel van hoe de AI denkt.

  • Het "Trainingsdieet"-probleem: De meeste van deze AIs zijn getraind op enorme stapels Engelse data (zoals een student die alleen Engelse leerboeken heeft gelezen). Zelfs als ze Frans kunnen vertalen, is hun "spiergeheugen" voor medisch redeneren gebouwd op Engelse patronen.
  • Het Risico: Als een arts in een Franstalig ziekenhuis deze tools gebruikt, kan de AI een iets minder nauwkeurige diagnose geven of een rommeligere uitleg dan voor een Engelstalige arts.
  • De Conclusie: Het artikel concludeert dat voor AI om overal echt eerlijk en nuttig te zijn, we niet alleen op Engels kunnen vertrouwen. We moeten ervoor zorgen dat deze modellen net zo scherp zijn in het Frans (en andere talen) als in het Engels.

Samenvatting

Beschouw deze AI-modellen als meertalige koks. Ze kunnen een geweldige maaltijd (diagnose) koken als je ze het recept in het Engels geeft. Als je ze hetzelfde recept in het Frans geeft, zullen vier van de vijf koks nog steeds een goede maaltijd koken, maar het kan iets minder gekruid zijn of de presentatie kan iets minder goed zijn. Slechts één kok (o3) kookt exact dezelfde perfecte maaltijd, ongeacht de taal van het recept.

Het artikel waarschuwt ons dat zolang we deze "taalkanttekening" niet oplossen, het vertrouwen op deze tools in niet-Engelse omgevingen kan betekenen dat je een iets mindere kwaliteit resultaat krijgt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →