Large Language Models Lack Temporal Awareness of Medical Knowledge
Dit artikel introduceert TempoMed-Bench, de eerste benchmark voor het evalueren van het temporele bewustzijn van grote taalmodellen in de geneeskunde, en onthult dat huidige modellen moeite hebben met historische kennis, een geleidelijke prestatiedaling vertonen in plaats van scherpe afknelpunten, en zelfs bij uitbreiding met zoektools geen temporele consistentie handhaven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Het "Tijdsreizen"-Probleem
Stel je voor dat je een briljante medische student inhuurt om gezondheidsvragen te beantwoorden. Deze student heeft elke medische tekst die ooit is geschreven gelezen. Er is echter een addertje onder het gras: ze weten niet wat voor jaar het is.
Als je hen vraagt: "Wat is het beste medicijn voor obesitas?", kunnen ze je het antwoord uit een leerboek van 2018 geven, zelfs als er in 2024 een gloednieuw, beter medicijn is goedgekeurd. Of, als je hen vraagt om een behandelplan uit 2015 uit te leggen, kunnen ze per ongeluk het huidige plan van 2024 vertellen, omdat ze zijn vergeten hoe de regels vroeger waren.
Dit paper stelt dat huidige Large Language Models (LLM's) net als die student zijn. Ze zijn geweldig in het kennen van feiten, maar ze zijn verschrikkelijk in het weten wanneer die feiten waar waren.
Het Hulpmiddel: "TempoMed-Bench" (Het Tijdsreizen-examen)
Om dit te bewijzen, bouwden de onderzoekers een speciale test genaamd TempoMed-Bench.
Stel je medische richtlijnen (de officiële regels die artsen volgen) voor als een videospel dat elke paar jaar wordt bijgewerkt.
- Versie 1 (2018): Het spel zegt: "Gebruik een rood zwaard om de baas te bevechten."
- Versie 2 (2022): Het spel wordt bijgewerkt en zegt: "Het rood zwaard is kapot; gebruik nu een blauw schild."
- Versie 3 (2024): Het spel wordt opnieuw bijgewerkt: "Het blauwe schild is te zwaar; gebruik een laserpistool."
De onderzoekers namen duizenden van deze "spelupdates" van echte medische organisaties. Ze maakten een quiz waarbij ze de AI vroegen:
- "Wat zegt de 2024-regel?" (Testen of ze het nieuwe materiaal kennen).
- "Wat zei de 2018-regel?" (Testen of ze het oude materiaal onthouden).
- "Wat zei de regel in 2020?" (Testen of ze correct kunnen schakelen tussen versies).
De Bevindingen: Wat de AI Fout deed
De onderzoekers testten meer dan 10 verschillende AI-modellen op dit examen. Hier is wat ze vonden, met eenvoudige analogieën:
1. Het "Vervagend Geheugen"-effect (Geen harde afkapdatum)
De Mythe: Mensen dachten dat AI-modellen een "kennisafkapdatum" hebben. Stel je een bibliotheek voor die stopt met het toevoegen van boeken na een specifieke datum. Je zou denken dat de AI alles tot die datum perfect kent, en daarna niets.
De Realiteit: De AI heeft geen harde stop. In plaats daarvan vervaagt haar geheugen aan nieuwe medische feiten langzaam naarmate je verder terug in de tijd gaat.
- Analogie: Het is niet als een lichtschakelaar die uitgaat. Het is meer als een radiosignaal dat steeds zwakker wordt naarmate je verder van de toren af rijdt. De AI wordt geleidelijk slechter in het kennen van het allernieuwste nieuws, niet plotseling.
2. De "Amnesie" voor Oude Regels
De Bevinding: De AI is geweldig in het kennen van de huidige regels, maar ze is verschrikkelijk in het onthouden hoe de regels vroeger waren.
- Analogie: Stel je een modeontwerper voor die precies weet wat nu trendy is. Maar als je hen vraagt: "Wat droegen mensen in 2015?", kunnen ze per ongeluk vertellen wat mensen vandaag dragen.
- De Statistieken: Bij vragen over historische medische kennis was de AI slechts 25% tot 50% zo accuraat als bij vragen over huidige kennis. Het lijkt erop dat ze de oude versies van de regels tijdens hun training zijn "vergeten".
3. De "Verwarde Tijdsreiziger" (Inconsistentie)
De Bevinding: De antwoorden van de AI zijn overal verspreid als je vragen stelt over verschillende jaren.
- Analogie: Stel je een tijdsreiziger voor die, als je hen vraagt over het jaar 2020, zegt: "Ja, dat is gebeurd." Maar als je vraagt over 2021, zeggen ze: "Nee, dat is niet gebeurd", zelfs als de gebeurtenissen logisch met elkaar verbonden zijn.
- Het Resultaat: De AI heeft geen soepele, logische tijdlijn in haar hoofd. Ze springt heen en weer, soms akkoord gaand met oude regels en soms met nieuwe regels, ongeacht het jaar waarover je vraagt. Ze mist een samenhangend "verhaal" van hoe de geneeskunde is veranderd.
4. De "Zoekmachine" Hielp Niet Veel
De Bevinding: De onderzoekers probeerden dit op te lossen door de AI een "zoekmachine" te geven (genaamd Agentic RAG) zodat ze de regels in real-time kon opzoeken in plaats van te vertrouwen op haar geheugen.
- Het Resultaat: Het hielp een klein beetje, maar niet genoeg.
- Analogie: Stel je voor dat je die verwarde medische student een bibliotheekpas geeft. Ze kunnen het boek van 2024 vinden, maar ze vinden ook het boek van 2018 en het boek van 2022 allemaal tegelijk. Omdat de student zo verward is over welk boek ze moeten vertrouwen, raken ze overweldigd en geven ze toch het verkeerde antwoord. De zoektools introduceerden eigenlijk te veel tegenstrijdige informatie, waardoor de AI in sommige gevallen zelfs iets slechter werd.
De Conclusie
Het paper concludeert dat Large Language Models nog niet klaar zijn om vertrouwd te worden met medische beslissingen die tijdgevoelig zijn.
Ze zijn als een briljante arts die elk boek heeft gelezen maar geen concept heeft van een kalender. Ze kunnen je het juiste antwoord voor vandaag geven, maar ze kunnen je ook een gevaarlijk antwoord van vijf jaar geleden geven, of ze kunnen verward raken over wat vorig jaar waar was. Totdat we hen leren tijd net zo duidelijk te begrijpen als feiten, kunnen ze niet volledig worden vertrouwd voor medisch advies dat in de loop van de tijd verandert.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.