← Nieuwste papers
🤖 AI

FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

Dit artikel introduceert FALSIFYBENCH, een benchmark geïnspireerd door de Wason 2-4-6 taak om het inductieve redeneren van LLM's voor wetenschappelijke ontdekkingen te evalueren, waarbij wordt onthuld dat reasoning-modellen beter presteren dan instructie-afgestemde modellen voornamelijk vanwege hun capaciteit voor negatieve testen en dat falen voortkomt uit identificeerbare patronen in hypothese-navigatie.

Oorspronkelijke auteurs: Leonardo Bertolazzi, Katya Tentori, Raffaella Bernardi

Gepubliceerd 2026-06-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Leonardo Bertolazzi, Katya Tentori, Raffaella Bernardi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een raadspel speelt met een vriend die een geheime regel kent, maar jij niet. Je vriend geeft je drie voorbeelden die aan de regel voldoen, zoals "2, 4, 6." Jouw taak is om de geheime regel te achterhalen door je eigen reeksen getallen voor te stellen en te vragen: "Past dit?"

Dit is de klassieke "Wason 2-4-6 taak", een beroemd puzzelstuk dat wordt gebruikt om te onderzoeken hoe mensen denken. Het artikel waar je naar vraagt, FALSIFYBENCH, neemt deze game en geeft deze aan Artificial Intelligence (AI) modellen, maar in plaats van getallen gebruiken ze woorden en categorieën (zoals "dieren" of "gereedschap").

Hier is de uitsplitsing van wat de onderzoekers hebben gedaan en gevonden, met behulp van eenvoudige analogieën.

Het Spel: "Vind de Verborgen Categorie"

Beschouw de AI als een detective die een mysterie probeert op te lossen.

  • De Opzet: De AI krijgt drie items te zien, bijvoorbeeld een "vleermuis", een "skimmer" en een "tarsier".
  • Het Doel: De AI moet de verborgen categorie raden waartoe deze behoren (bijv. "Dieren").
  • De Addertje onder het gras: De AI kent het antwoord niet. Het moet een regel raden, deze testen en feedback krijgen.
    • Als de AI "Vliegende dingen" raadt en een "vleermuis" test, zegt het systeem: "Ja, dat past."
    • Als de AI een "vis" test en het systeem zegt: "Nee, dat past niet," leert de AI dat zijn regel te breed is.
    • Als de AI een "walvis" test en het systeem zegt: "Ja, dat past," terwijl de AI dacht aan "Vliegende dingen", leert de AI dat zijn regel te nauw is.

Het Grote Probleem: De "Ja-knikker" Valstrik

De onderzoekers ontdekten dat de meeste AI-modellen (en mensen) lijden aan een specifieke denkfout genaamd Bevestigingsvooroordeel (Confirmation Bias).

Stel je voor dat je een detective bent die ervan overtuigd is dat de dader "De Butler" is.

  • De "Ja-knikker" Strategie (Bevestiging): Je stelt alleen vragen die bewijzen dat de Butler het heeft gedaan. "Had de Butler een motief?" "Ja." "Was de Butler in de kamer?" "Ja." Je voelt je zelfverzekerd, maar je controleert nooit of de Butler onschuldig is. Je bent alleen maar op zoek naar "Ja"-antwoorden.
  • De "Advocaat van de Duivel" Strategie (Falsificatie): Je probeert actief te bewijzen dat de Butler niet de dader is. Je vraagt: "Was de Butler op dat moment op het strand?" Als het antwoord "Ja" is, wordt je theorie vernietigd en moet je een nieuwe verdachte zoeken.

De Hoofdvinding van het Papier:
De AI-modellen die optraden als "Advocaten van de Duivel" (die probeerden hun eigen theorieën te breken) waren veel beter in het oplossen van de puzzel. De modellen die optraden als "Ja-knikkers" (die alleen op zoek waren naar bewijs dat ze gelijk hadden) liepen vast. Ze bleven smalle regels raden (zoals "vliegende zoogdieren") en realiseerden zich nooit dat de echte regel breder was ("alle dieren").

De Resultaten: Wie Speelde het Best?

Het team testte 12 verschillende AI-modellen. Dit is wat ze vonden:

  1. De "Redeneer"-Modellen Wonnen: De nieuwere AI-modellen die ontworpen zijn om na te "denken" voordat ze spreken (vaak "reasoning models" genoemd), waren betere detectives dan de standaardmodellen. Ze waren eerder geneigd om hun eigen theorieën te proberen te breken.
  2. Niemand is Perfect: Zelfs de beste AI-modellen losten het spel niet perfect op. Ze maakten nog steeds fouten, wat aantoont dat AI nog geen meester is in wetenschappelijke ontdekking.
  3. Het Gaat Niet Om Slimheid, Maar Om Strategie: De onderzoekers controleerden of de AI faalde omdat het de definities van woorden niet kende (zoals niet weten wat een "vleermuis" is). Ze vonden dat dit niet het probleem was. De AI kende de woorden; het had gewoon een slechte strategie. Het was te bang om ideeën te testen die fout zouden kunnen zijn.

De "Beurt-voor-Beurt" Analyse

De onderzoekers keken niet alleen naar wie er won; ze volgden elke enkele zet van de AI. Ze vonden twee belangrijke manieren waarop de AI faalde:

  1. Verdwalen in het Bos: In plaats van langzaam te bewegen van een specifieke gok naar een algemene gok (zoals van "vleermuizen" naar "zoogdieren" naar "dieren"), zou de AI soms compleet ongerelateerde gokken doen (zoals "dingen die met de letter B beginnen").
  2. Focus op de Verkeerde Details: Soms, in plaats van de betekenis van de woorden te raden, raadde de AI gebaseerd op hoe de woorden eruit zagen. Bijvoorbeeld, het zou kunnen gokken: "De regel is dat alle woorden drie letters hebben," of "Ze beginnen allemaal met een klinker." Dit is alsof een detective de plaats delict negeert en zich focust op de kleur van de schoenen van de verdachte.

De Kern van de Zaak

Dit papier introduceert een nieuwe test (FALSIFYBENCH) om te zien of AI echt wetenschappelijk kan denken. De conclusie is dat hoewel AI beter wordt in "denken", het nog steeds worstelt met het belangrijkste deel van wetenschap: de moed om ongelijk te hebben.

Om een goede wetenschapper (of een goede detective) te zijn, moet je actief proberen je eigen ideeën te weerleggen. De AI-modellen die leerden dit te doen, waren de winnaars, maar zelfs zij hebben een lange weg te gaan voordat ze menselijke wetenschappers kunnen vervangen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →