← Nieuwste papers
💬 NLP

Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs

Dit artikel onderzoekt of LLaMA 2 en Flan-T5 werkelijke transitieve redenering vertonen of vertrouwen op oppervlakkige aanwijzingen door te controleren op woordoverlappen, vooraf getrainde kennis en benoemde entiteiten, waarbij wordt onthuld dat hoewel beide modellen gebruikmaken van lexicale overlappen, Flan-T5 een grotere veerkracht vertoont tegen kennisgebaseerde manipulaties, wat wijst op een potentiële rol voor fijnafstemming bij het ontwikkelen van logisch begrip.

Oorspronkelijke auteurs: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

Gepubliceerd 2026-09-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het snel evoluerende veld van kunstmatige intelligentie heeft een specifiek type computerprogramma, bekend als een Large Language Model, de wereldwijde aandacht getrokken. Deze systemen, getraind op enorme hoeveelheden tekst van het internet, kunnen verhalen schrijven, talen vertalen en complexe vragen beantwoorden. Een centrale vraag voor wetenschappers die deze machines bestuderen, is of ze werkelijk logica begrijpen of dat ze simpelweg de patronen nabootsen die ze eerder hebben gezien. Om dit te testen, kijken onderzoekers naar een fundamentele vaardigheid genaamd transitieve redenering. In alledaagse termen is dit het vermogen om twee afzonderlijke stukjes informatie met elkaar te verbinden om tot een nieuwe conclusie te komen. Bijvoorbeeld, als iemand weet dat een kat een type dier is, en dat alle dieren voedsel nodig hebben, kan diegene logischerwijs afleiden dat een kat voedsel nodig heeft zonder dat die specifieke feit expliciet is verteld. Dit proces vereist meer dan alleen geheugen; het vereist het vermogen om feiten aan elkaar te weven. De vraag die de recente research drijft, is of deze krachtige computerprogramma's daadwerkelijk dit mentale weven uitvoeren, of dat ze een kortere weg nemen door bekende woorden te herkennen en het antwoord te raden.

Een team van onderzoekers van de Heriot-Watt University en de University of Edinburgh zette zich af om dit specifieke probleem te onderzoeken. Ze richtten zich op twee verschillende soorten taalmodellen, één genaamd LLaMA 2 en een andere genaamd Flan-T5, om te zien hoe zij omgingen met vragen die het verbinden van twee feiten vereisten. De wetenschappers gebruikten twee bestaande collecties vragen die ontworpen zijn om dit soort denken te testen. Eén collectie, bekend als QASC, presenteert meerkeuzevragen over wetenschap die vereisen dat twee stellingen worden gecombineerd om het juiste antwoord te vinden. De andere collectie, genaamd Bamboogle, bevat vragen die lastig genoeg zijn dat een standaard zoekmachine op het internet ze fout zou kunnen hebben, waardoor het model gedwongen wordt te vertrouwen op zijn eigen verwerking. De onderzoekers wilden weten of de modellen werkelijk door de stappen redeneerden of dat ze zich slechts vastklampden aan specifieke woorden, zoals datums of namen, die zowel in de vraag als in het antwoord voorkwamen.

Om de waarheid te achterhalen, ontwierp het team een reeks slimme experimenten waarbij ze de gegeven informatie systematisch aanpasten. Ze begonnen door te controleren of de modellen de problemen konden oplossen wanneer ze de feiten en een duidelijk voorbeeld kregen van hoe ze deze moesten verbinden. Beide modellen presteerden goed onder deze omstandigheden, maar de onderzoekers vermoedden dat dit te makkelijk was. Vervolgens verwijderden ze het voorbeeld van hoe de feiten verbonden moesten worden, waardoor de modellen het zelf moesten uitzoeken. De resultaten waren onthullend. Het Flan-T5-model, dat specifiek was getraind op vergelijkbare redeneertaken, bleef zeer goed presteren, zelfs zonder het voorbeeld. Het LLaMA 2-model had echter aanzienlijk moeite zonder die begeleiding, wat suggereerde dat het zwaar leunde op het zien van het patroon van redeneren voordat het het kon volgen.

De onderzoekers namen vervolgens een drastischerere aanpak om te zien of de modellen de betekenis van de woorden werkelijk begrepen. Ze door elkaar gehusseld de volgorde van de woorden binnen de feiten, waardoor duidelijke zinnen veranderden in verwarrende, betekenisloze reeksen tekst. Als de modellen werkelijk zouden redeneren over de betekenis, zou deze chaos de antwoorden onmogelijk hebben gemaakt. Verrassend genoeg daalde de prestatie van de modellen nauwelijks. Ze waren nog steeds in staat het juiste antwoord te kiezen, zelfs wanneer de zinnen geen grammaticaal correct zin maakten. Dit suggereerde dat de modellen de zinnen niet lazen als samenhangende gedachten. In plaats daarvan waren ze waarschijnlijk op zoek naar specifieke trefwoorden die overeenkwamen met de antwoordopties. Wanneer de onderzoekers die overeenkomende trefwoorden volledig verwijderden, stortte de nauwkeurigheid van de modellen in, wat bevestigde dat ze vaak slechts woorden matchten in plaats van logica af te leiden.

Om de mogelijkheid uit te sluiten dat de modellen simpelweg de antwoorden uit hun trainingsdata hadden onthouden, wendde het team zich tot de Bamboogle-dataset, die vragen bevatte die de modellen nog nooit eerder hadden gezien. Hier introduceerden ze een laatste, rigoureuze test. Ze namen de namen van mensen, plaatsen en datums — de specifieke entiteiten die vaak in de antwoorden voorkomen — en vervingen deze door onzinwoorden. Ze husselden ook de volgorde van de woorden in de feiten door elkaar. Wanneer de modellen werden geconfronteerd met deze versies vol onzin, faalde het LLaMA 2-model bijna volledig. Het kon het antwoord niet vinden zonder de bekende namen en datums om het te leiden. Het Flan-T5-model vertoonde echter een ander soort veerkracht. Hoewel de prestatie daalde, bleef het aanzienlijk beter presteren dan het andere model. Dit suggereert dat, omdat Flan-T5 expliciet getraind was op redeneertaken, het een robuustere capaciteit had ontwikkeld om de logische keten te volgen, zelfs wanneer de bekende aanwijzingen werden weggenomen.

De studie concludeert dat hoewel grote taalmodellen kunnen lijken te redeneren, hun succes vaak afhangt van de specifieke manier waarop ze zijn getraind en de aanwijzingen die in de tekst beschikbaar zijn. Voor modellen die niet specifiek zijn bijgesteld (fine-tuned) op redeneertaken, lijkt het vermogen om complexe vragen te beantwoorden sterk te rusten op het herkennen van bekende woorden en patronen in plaats van op werkelijke logische deductie. Zelfs wanneer ze lijken te denken in stappen, kunnen ze simpelweg de juiste trefwoorden opsporen. Echter, de research suggereert dat wanneer een model zorgvuldig wordt getraind op datasets die bedoeld zijn om het te leren hoe het feiten moet verbinden, het een meer authentieke capaciteit voor transitieve redenering kan ontwikkelen. Deze capaciteit stelt het in staat om vragen te behandelen zelfs wanneer de gebruikelijke afkortingen, zoals herkenbare namen of datums, worden verwijderd. De bevindingen dienen als een herinnering dat hoge scores op redeneertests niet altijd bewijzen dat een machine logica begrijpt; soms is het gewoon heel goed in het vinden van de juiste woorden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →