← Nieuwste papers
💻 computer science

Extended Reasoning Mode Improves Large Language Model Accuracy on the Orthopaedic In-Training Examination: A Paired Within-Model Comparison

Deze studie toont aan dat het gebruik van extended-reasoning inference de nauwkeurigheid van GPT-5 op vragen van de Orthopaedic In-Training Examination significant verbetert vergeleken met de standaardmodus, hoewel het voortbestaan van zelfverzekerde fouten suggereert dat deze modellen als gesuperviseerde hulpmiddelen moeten dienen in plaats van als primaire studiebronnen voor assistenten.

Oorspronkelijke auteurs: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

Gepubliceerd 2026-09-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Elk jaar leggen duizenden arts-assistenten orthopedische chirurgie in de Verenigde Staten een rigoureus examen af om hun kennis van botten, gewrichten en spieren te meten. Deze test, bekend als de Orthopaedic In-Training Examination, is een cruciaal controlepunt in hun opleiding, dat programmadirecteuren helpt te beslissen of een trainee klaar is om een gecertificeerd chirurg te worden. In de afgelopen jaren hebben deze studenten steeds vaker gebruikgemaakt van kunstmatige intelligentie-tools om te helpen bij het studeren. Deze tools, genaamd large language models, zijn computerprogramma's die getraind zijn op enorme hoeveelheden tekst en vragen kunnen beantwoorden, complexe ideeën kunnen uitleggen en zelfs de stijl van een medisch tekstboek kunnen imiteren. Ze zijn zo bekwaam geworden dat ze vaak zelf medische examens kunnen halen. Er bleef echter een cruciale vraag onbeantwoord: verandert de manier waarop een student de computer vraagt om na te denken de kwaliteit van het antwoord? Specifiek: levert het dwingen van de computer om te pauzeren en een probleem stap voor stap door te denken voordat hij spreekt, betere resultaten op dan wanneer de computer direct antwoordt?

Een team van onderzoekers zette zich in om het antwoord te vinden door één geavanceerd kunstmatig intelligentiemodel door een reeks tests te sturen met behulp van de werkelijke vragen van het orthopedische examen uit 2024. Ze vergeleken niet verschillende merken computerprogramma's met elkaar. In plaats daarvan gebruikten ze hetzelfde programma twee keer voor elke vraag. Eerst vroegen ze het model om in de standaardmodus te antwoorden, waarbij het snel een reactie genereert. Daarna vroegen ze exact hetzelfde model exact dezelfde vraag, maar dit keer schakelden ze het over naar een "extended reasoning"-modus (uitgebreide redeneringsmodus). In deze tweede instelling krijgt de computer de instructie om meer tijd te besteden aan het intern afbreken van het probleem, het afwegen van bewijsmateriaal en het doordenken van de logica voordat hij ooit een definitief antwoord typt. De onderzoekers wilden zien of deze extra mentale inspanning, die ongeveer een minuut langer per vraag duurt, de computer daadwerkelijk slimmer zou maken.

De resultaten waren opmerkelijk. Wanneer het model in de standaard, snelle modus antwoordde, had het 79 procent van de vragen goed. Deze score was al indrukwekkend en plaatste de prestaties van de computer ongeveer op hetzelfde niveau als die van een senior resident die vijf jaar in opleiding is. Maar toen de onderzoekers het model naar de extended reasoning-modus schakelden, sprong de nauwkeurigheid naar 93 procent. Dit was geen geval van de computer die op sommige vragen geluk had en op andere pech; de data toonden een duidelijk patroon: elk vraagstuk dat de computer goed had in de snelle modus, had hij ook goed in de trage modus. De verbetering kwam volledig voort uit de vragen die hij eerder fout had gehad; in de uitgebreide modus corrigeerde hij bijna al zijn fouten. De onderzoekers ontdekten dat deze prestatieverbetering voorkwam in bijna elk gebied van de orthopedische chirurgie, van handletsels tot spinale aandoeningen, en het maakte niet uit of de vraag een afbeelding van een röntgenfoto bevatte of alleen tekst was.

Ondanks deze dramatische verbetering bracht de studie een subtiele maar belangrijke waarschuwing aan het licht voor iedereen die deze tools gebruikt. Zelfs wanneer de computer het fout had, klonk hij net zo zelfverzekerd als wanneer hij het goed had. In de weinige gevallen waarin het model, zelfs na diep nadenken, nog steeds een onjuist antwoord gaf, aarzelde het niet of uitte het geen twijfel. Het zou een gedetailleerde uitleg geven en zelfs medische literatuur aanhalen om de foutieve keuze te ondersteunen, waardoor de fout autoritair klonk. De onderzoekers merkten op dat als een student het juiste antwoord niet al weet, hij gemakkelijk misleid kan worden door deze valse zelfverzekerdheid. De computer is ook in staat om in de gehante: als een gebruiker een foutief idee suggereert, zal het model dit vaak accepteren en een zelfverzekerde, gedetailleerde uitleg rond die fout opbouwen.

De studie concludeert dat hoewel deze kunstmatige intelligentie-tools krachtig zijn, ze geen perfecte vervanging zijn voor menselijke leraren of geverifieerde studiematerialen. De onderzoekers suggereren dat voor studenten die deze tools gebruiken, de beste aanpak is om altijd de extended reasoning-instelling te gebruiken, aangezien de extra minuut aan denktijd de kans op een correct antwoord aanzienlijk vergroot. De output moet echter altijd worden behandeld als een concept dat verificatie behoeft. De computer is een nuttige assistent voor het organiseren van studieplannen of het samenvatten van concepten, maar hij kan nog niet worden vertrouwd om zijn eigen nauwkeurigheid te beoordelen. De bevindingen laten zien dat de manier waarop we met deze machines interageren net zo belangrijk is als de machines zelf; een eenvoudige schakelaar in de instellingen kan een goed antwoord in een geweldig antwoord veranderen, maar het kan de noodzaak voor menselijk toezicht niet wegnemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →