Evaluation of Large Language Models for Post-Cystectomy Sexual Health Counseling in Women: A Pilot Study
Deze pilotstudie evalueerde drie grote taalmodellen voor het genereren van seksuele gezondheidsbegeleiding na een cystectomie, waarbij werd vastgesteld dat ChatGPT de meest richtlijnconforme antwoorden produceerde, terwijl alle modellen inhoud genereerden met een excessieve leescomplexiteit, waarbij de naleving sterk werd beïnvloed door de structuur van de prompt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Stel je voor dat je drie verschillende "digitale bibliothecarissen" hebt (ChatGPT, Gemini en Perplexity) en je vraagt hen om een gids te schrijven voor vrouwen die een grote blaasoperatie ondergaan, genaamd een cystectomie. Specifiek wil je dat ze uitleggen wat er met hun seksuele gezondheid en relaties zal gebeuren na de operatie.
Deze studie is als een rapportcijfer voor deze bibliothecarissen. De onderzoekers wilden twee dingen weten:
- Hielden ze zich aan het regelboekje? (Hielden ze alle belangrijke adviezen in die artsen zouden moeten geven?)
- Was de taal te moeilijk om te begrijpen? (Schreven ze als een professor of als een vriendelijke buurman?)
Dit is wat ze vonden, hieronder eenvoudig uitgelegd:
1. De "Regelboekje"-test (Naleving van richtlijnen)
De onderzoekers gaven de bibliothecarissen een checklist gebaseerd op officiële medische richtlijnen. Ze vroegen de bibliothecarissen om zes verschillende vragen te beantwoorden over het leven na de operatie.
- De Winnaar: ChatGPT was de beste leerling. Het volgde het regelboekje het nauwst en haalde ongeveer 77% van de vereiste punten.
- De Runners-up: Gemini en Perplexity scoorden veel lager en haalden slechts ongeveer 50% en 46% van de punten. Ze misten veel van de cruciale adviezen.
- De "Simpele Vraag"-truc: De onderzoekers merkten iets interessants op. Wanneer ze de bibliothecarissen vragen stelden in eenvoudige, alledaagse taal (zoals een patiënt dat zou doen), waren de antwoorden beter en volgden ze de regels vaker. Wanneer ze complexe, medische jargon gebruikten (zoals een arts dat zou doen), werden de bibliothecarissen juist slechter in het volgen van de regels. Het is alsof de bibliothecarissen in de war raakten door de chique woorden en de basiszaken vergaten.
2. De "Leesniveau"-test (Begrijpelijkheid)
Zelfs als de bibliothecarissen de feiten goed hadden, maakt het niet uit als de patiënt de tekst niet kan lezen. De onderzoekers controleerden hoe moeilijk de tekst te begrijpen was.
- Het Probleem: Alle drie de bibliothecarissen schreven in een taal die te moeilijk was. Ze schreven op een niveau dat geschikt is voor universitair geschoofenen of zelfs mensen met gevorderde graden.
- De Realiteit: De meeste mensen lezen op een 6e-klas niveau (ongeveer 12-jarige niveau). Als je een folder met een leesniveau van de 12e of 16e klas aan een patiënt geeft die al gestrest is over een kankeroperatie, begrijpen ze het misschien helemaal niet.
- De Vergelijking: Perplexity schreef de meest moeilijke, "postacademische" proza. Gemini was iets makkelijker maar nog steeds te complex. ChatGPT was het makkelijkst te lezen van de drie, maar zelfs dat was nog steeds te moeilijk voor de gemiddelde persoon.
3. De "Eén Groot Idee"-ontdekking
De onderzoekers gebruikten een speciale wiskundige tool (genaamd Principal Component Analysis) om naar de verschillende manieren te kijken waarop ze "moeilijkheidsgraad" maten. Ze ontdekten dat alle verschillende tests voor moeilijkheid eigenlijk precies hetzelfde maten. Het is als het hebben van vijf verschillende linialen die allemaal zeggen dat de tafel 6 voet lang is; het zijn niet vijf verschillende metingen, het zijn gewoon vijf manieren om hetzelfde te zeggen. Dit bevestigde dat de tekst over de hele linie consistent te complex was.
De Kern van het Verhaal
Beschouw deze AI-tools als zeer deskundige maar ietwat onhandige assistenten.
- ChatGPT is de meest betrouwbare assistent als het gaat om het onthouden van de belangrijke regels, maar zelfs ChatGPT spreekt een taal die te chique is voor een patiënt om gemakkelijk te kunnen verteren.
- Gemini en Perplexity zijn minder betrouwbaar met de regels en spreken een nog complexere taal.
- De Prompt Matters: Als je deze assistenten in simpel, algemeen Engels vraagt, doen ze het eigenlijk beter bij het volgen van de regels dan wanneer je probeert te klinken als een dokter.
De Conclusie: Hoewel deze AI-tools nuttig kunnen zijn, produceren ze momenteel informatie die te complex is voor patiënten om te begrijpen en variëren ze enorm in hoeveel belangrijke medische adviezen ze bevatten. Ze zijn niet klaar om een gesprek met een arts te vervangen, vooral niet voor gevoelige onderwerpen zoals seksuele gezondheid na een kankeroperatie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.