← Nieuwste papers
💬 NLP

Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks

Deze studie evalueert drie state-of-the-art LLM's bij klinische besluitvormingstaken en stelt vast dat hoewel prompt engineering de prestaties op specifieke zwakke punten, zoals diagnostische tests, aanzienlijk verbetert, het geen universele oplossing is en contraproductief kan zijn voor andere taken, wat de noodzaak voor op maat gemaakte, contextbewuste integratiestrategieën benadrukt.

Oorspronkelijke auteurs: Mengdi Chai, Ali R. Zomorrodi

Gepubliceerd 2026-08-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mengdi Chai, Ali R. Zomorrodi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers elk medisch tekstboek ooit geschreven kunnen lezen en elke feit perfect kunnen onthouden. Dat is de belofte van Large Language Models (LLM's), de superintelligente AI-hersenen achter chatbots die beginnen te klinken als artsen. Maar het kennen van een feit is iets heel anders dan het gebruiken ervan om een rommelige, echte puzzel op te lossen. Denk aan het verschil tussen een student die het hele regelboek van voetbal kan opzeggen versus een speler die daadwerkelijk langs verdedigers kan dribbelen, naar de juiste teamgenoot kan passen en een doelpunt kan scoren wanneer de klok aftikt. In het hoogst inzetvolle spel van de gezondheidszorg moeten artsen niet alleen de regels kennen; ze moeten een reeks moeilijke beslissingen nemen in een specifieke volgorde: Wat is er aan de hand? Wat moeten we nu controleren? Welke tests hebben we nodig? En tot slot, hoe lossen we het op? Dit is waar het ingewikkeld wordt. Wetenschappers proberen deze AI-"studenten" beter te leren hoe ze het spel moeten spelen door ze speciale instructies te geven, genaamd "prompt engineering". Het is alsof je de AI een geheim tactisch plan of een stapsgewijs draaiboek geeft om het de AI te helpen helderder na te denken. De grote vraag die iedereen zich stelt is: helpt dit draaiboek de AI om het spel te winnen, of raakt het de arme boel alleen maar in de war?

Deze studie besloot uit te zoeken hoe het zit door drie van de slimste AI-modellen aan de test te onderwerpen: ChatGPT-4o, Gemini 2.5 Flash en Llama 3.3 70B. De onderzoekers vroegen hen niet alleen naar trivia, maar gaven hen 36 echte medische verhalen (klinische casussen) en vroegen hen om het volledige besluitvormingsproces, stap voor stap, te doorlopen. Ze wilden zien of het gebruik van chique "prompt engineering"-technieken — specifiek een methode genaamd MedPrompt, die probeert de AI te dwingen stap voor stap te denken en naar vergelijkbare voorbeelden uit het verleden te kijken — de AI beter zou maken in het oplossen van deze medische mysteries.

Hier komt de wending: het antwoord is een luidruchtig "dat hangt ervan af". De studie toonde aan dat prompt engineering geen toverstaf is die alles oplost. Sterker nog, het is meer als een noise-cancelling koptelefoon die geweldig werkt in een bibliotheek, maar ervoor zorgt dat je de bus mist op een drukke straat.

Wanneer de AI-modellen aan hun lot werden overgelaten (met basisprompts), waren ze verrassend goed in sommige dingen en verschrikkelijk in andere. Ze waren bijna perfect in het vaststellen van de "uiteindelijke diagnose" zodra ze alle aanwijzingen hadden, maar ze hadden de meeste moeite met het beslissen welke "relevante diagnostische tests" ze moesten aanvragen. Het is alsof ze gemakkelijk de schurk aan het einde van de film kunnen benoemen, maar het moeilijk vinden om te bepalen welke aanwijzingen ze in het midden van het plot moeten zoeken.

Toen probeerden de onderzoekers het "MedPrompt"-draaiboek. Voor de taak waar de AI het zwakst in was — het kiezen van de juiste diagnostische tests — deed het draaiboek wonderen. Het was alsoan een verwarde wandelaar een gedetailleerde kaart geven; de prestaties van de AI sprongen aanzienlijk omhoog. Bijvoorbeeld, de nauwkeurigheid van één model op deze lastige taak steeg van ongeveer 31% naar 51%. Dat is een enorme verbetering!

Echter, het verhaal neemt een wending wanneer de AI datzelfde draaiboek probeert te gebruiken voor andere taken. Wanneer de AI werd gevraagd om mogelijke ziekten (differentiaaldiagnose) op te sommen of behandelingen voor te stellen, maakten de chique prompts de AI juist slechter. Het is alsof de AI zo druk was met het volgen van de strikte regels van het draaiboek, dat het vergat zijn eigen brein te gebruiken. Het vermogen van één model om mogelijke ziekten op te sommen, daalde van 71% naar 56% simpelweg omdat het te hard probeerde de "stap-voor-stap denk"-instructies te volgen.

De onderzoekers testten ook of het veranderen van de "temperatuur" van de AI — die bepaalt hoe creatief of willekeurig de antwoorden zijn — een verschil maakte. Ze ontdekten dat dit, verrassend genoeg, niet veel uitmaakte voor de nauwkeurigheid. Of de AI nu werd ingesteld om super-conservatief te zijn of een beetje creatiever, het kreeg ongeveer evenveel antwoorden goed. Dit suggereert dat het brein van de AI voor deze specifieke taken vrij stabiel is, hoewel de onderzoekers opmerken dat consistentie nog steeds belangrijk is voor de veiligheid in echte ziekenhuizen.

De belangrijkste les van deze studie is dat er geen "one-size-fits-all" oplossing is. Je kunt niet zomaar een chique prompt op een AI plakken en verwachten dat het een briljante arts wordt. Soms helpt de extra structuur, en soms werkt het als een dwangbuis die de AI ervan weerhoudt natuurlijk na te denken. De auteurs suggereren dat we in de echte wereld niet moeten vertrouwen op AI om deze beslissingen alleen te nemen. In plaats daarvan moeten we ze gebruiken als behulpzame assistenten die een menselijke arts nodig hebben om hun werk te controleren, vooral wanneer de AI probeert de moeilijkste delen van de puzzel op te lossen. De weg vooruit gaat niet over het vinden van de perfecte prompt; het gaat over het matchen van het juiste gereedschap aan de juiste taak en het houden van een mens in de loop om ervoor te zorgen dat iedereen veilig blijft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →