Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions
Deze studie evalueert drie LLM-chatbots op het gebied van medische vraagbeantwoording en stelt vast dat de prestaties op het gebied van retrieval significant variëren per model en gebruikersrol, waarbij ChatGPT de anderen overtreft en alle modellen een bias vertonen naar het citeren van grotere klinische studies.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je op zoek bent naar het beste recept voor een specifiek gerecht, maar in plaats van een chef te vragen, vraag je het aan een super slimme robot die bijna elk kookboek ooit geschreven heeft gelezen. Deze robot is een "Large Language Model" (LLM), een type AI-chatbot dat kan chatten, schrijven en vragen kan beantwoorden door het volgende woord in een zin te voorspellen. In de wereld van de geneeskunde worden deze bots populair omdat ze complexe gezondheidskwesties snel kunnen samenvatten en je kunnen wijzen op de studies die hun advies onderbouwen. Maar hier zit de adder onder het gras: soms verzinnen deze robots dingen, of "hallucineren" ze, waarbij ze studies citeren die niet bestaan. Erger nog: ze kunnen de belangrijkste studies volledig over het hoofd zien. Dit artikel stelt een eenvoudige maar cruciale vraag: als een menselijke expert (zoals een medisch onderzoeker) al het harde werk heeft gedaan om de perfecte lijst met studies voor een specifieke medische vraag te vinden, hoe goed kunnen deze AI-robots diezelfde lijst vinden? Gedragen ze zich als een nieuwsgierige patiënt, een drukke arts of een serieuze onderzoeker? En doet de omvang van de studie er toe voor de robot?
De auteurs van deze studie besloten drie van de nieuwste, krachtigste AI-chatbots op de proef te stellen. Ze behandelden de chatbots als studenten die een zeer specifieke examen maken. De "examenvragen" waren 20 echte medische onderwerpen afkomstig uit de Cochrane Database of Systematic Reviews van 2026, wat de gouden standaardbibliotheek is waar expertteams al de beste bewijzen voor specifieke gezondheidsproblemen hebben verzameld en gecontroleerd. Voor elk van deze 20 onderwerpen vroegen de onderzoekers de chatbots om de originele onderzoeksstudies (de "primaire bronnen") te vinden die de antwoorden ondersteunen. Om te zien of de persoonlijkheid van de robot uitmaakte, stelden ze dezelfde vragen op drie verschillende manieren: één keer alsof een patiënt de vraag stelde, één keer alsof een clinicus (arts) de vraag stelde, en één keer alsof een onderzoeker in evidentie-synthese (een wetenschapper die gespecialiseerd is in het vinden van data) de vraag stelde. Ze voerden dit hele experiment vier keer uit voor elke combinatie om ervoor te zorgen dat de resultaten geen toevalstreffer waren, wat resulteerde in 720 totale antwoorden om te analyseren.
De resultaten waren een mix van "niet slecht" en "verrassend bevooroordeeld". Gemiddeld slaagde een enkele chatbotreactie erin om ongeveer 39,2% van de studies te vinden die de menselijke experts al hadden geïdentificeerd als de "correcte" lijst. Dat betekent dat als de experts 10 perfecte studies vonden, de robot er meestal slechts zo'n 4 vond. Echter, het type robot maakte veel uit. ChatGPT was de duidelijke winnaar en vond 63,1% van de expertstudies. Claude zat in het midden met 37,0%, en Gemini had het meest te verduren en vond slechts 17,3%. Interessant genoeg speelde de "persoonlijkheid" van de gebruiker ook een kleine rol: wanneer de prompt werd geschreven vanuit het perspectief van een onderzoeker, vonden de bots meer studies (42,8%) dan wanneer deze werd geschreven als een patiënt (36,1%) of een clinicus (38,6%).
Maar de meest fascinerende ontdekking ging over welke studies de bots kozen om te vinden. De onderzoekers keken naar de kenmerken van de studies die de bots succesvol ophaalden versus de studies die ze misten. Ze ontdekten dat de bots een enorme voorkeur hadden voor studies met grotere steekproeven (wat betekent dat studies die de behandeling op meer mensen testten). Zelfs toen ze controleerden voor hoe nieuw een studie was, hoe vaak deze door anderen werd geciteerd, of of deze gratis te lezen was, was de omvang van de studie het enige dat betrouwbaar voorspelde of de bot de studie zou vinden. Voor elke eenheid toename in de logaritme van de steekproefomvang, nam de kans dat de bot de studie zou vinden met 1,80 keer toe. Het is alsof de chatbots een ingebouwde bias hebben die denkt: "Als een studie een enorme menigte deelnemers heeft, dan moet het wel de belangrijkste zijn," waarbij ze kleinere maar even geldige studies negeren.
De studie controleerde ook of de bots nepstudies verzonnen of details fout hadden. Ze bedachten niet veel nepstudies (een goed teken dankzij hun geavanceerde redeneervermogen), maar ze maakten wel ongeveer 3% van de tijd "metadata-fouten". Dit betekent dat ze wel een echte studie kunnen citeren, maar de naam van de auteur, het jaar of de naam van het tijdschrift fout hebben. Claude maakte deze fouten het vaakst (5,9% van de tijd), terwijl Gemini het meest accuraat was (0,2%).
Uiteindelijk suggereert het artikel dat hoewel deze AI-chatbots steeds beter worden in het vinden van medisch bewijs, ze nog geen perfecte vervanging zijn voor menselijke experts. Ze zijn incompleet, ze veranderen hun antwoorden afhankelijk van wie je uitdoet, en ze hebben een sterke bias naar grote, beroemde studies. Als je een chatbot gebruikt om medisch onderzoek te vinden, krijg je misschien een lijst met de "grote hits", maar je kunt gemakkelijk de kleinere, stillere studies missen die experts net zo belangrijk vinden. De auteurs concluderen dat deze tools gezien moeten worden als nuttige assistenten die je in de juiste richting kunnen wijzen, maar niet als de uiteindelijke autoriteit over wat het medische bewijs daadwerkelijk zegt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.