← Nieuwste papers
🤖 AI

Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming

Het artikel introduceert "Reason Popper-ly", een neurosymbolisch framework dat de Chain-of-Thought-redenering in grote taalmodellen verbetert door middel van inductieve logische programmering om relationele regels te leren, tussenstappen te verifiëren en logische fouten automatisch te corrigeren, waardoor de nauwkeurigheid bij multi-hop redeneertaken aanzienlijk wordt verbeterd.

Oorspronkelijke auteurs: Zirong Chen, Meiyi Ma

Gepubliceerd 2026-07-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zirong Chen, Meiyi Ma

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, zeer pratende robot probeert te leren hoe hij een mysterie moet oplossen. Je vraagt de robot niet alleen om het antwoord; je vraagt hem om zijn werk te laten zien, stap voor stap, zoals een detective die aanwijzingen opschrijft in een notitieblok. Deze methode, genaamd "Chain-of-Thought", heeft gigantische taalmodellen veel beter gemaakt in het oplossen van puzzels die een opeenvolgend denkproces vereisen. Echter, er is een addertje onder het gras: alleen omdat de robot een lang, zelfverzekerd verhaal schrijft, betekent niet dat elke zin in dat verhaal ook daadwerkelijk waar is. Soms gaat de logica van de robot halverwege de weg fout, zelfs als hij aan het einde het juiste antwoord raadt. Het is als een student die een prachtig essay schrijft maar halverwege per ongeluk twee plus twee bij drie doet om vijf te krijgen, om vervolgens aan het eind van de rit magisch te corrigeren. Wetenschappers maken zich zorgen omdat als we de stappen niet kunnen vertrouwen, we de redenering van de robot in serieuze situaties ook niet kunnen vertrouwen. De grote vraag is: hoe fixen we de fouten van de robot terwijl hij nadenkt, zonder zijn hele notitieblok weg te gooien en opnieuw te beginnen?

Maak kennis met "Reason Popper-ly", een nieuwe methode die fungeert als een uiterst attente redacteur voor het denkproces van de robot. In plaats van de robot zijn hele verhaal te laten schrijven en op het beste te hopen, of de robot volledig te vervangen door een rigide rekenmachine, gebruikt deze aanpak een slimme mix van leren en controleren. Eerst bestudeert het systeem duizenden voorbeelden van hoe relaties werken (zoals hoe een "vader" en een "zus" samen een "tante" vormen) om een klein, perfect regelboek op te bouwen. Wanneer de robot vervolgens een nieuwe puzzel probeert op te lossen, fungeert dit regelboek als een realtime scheidsrechter. Terwijl de robot elke zin schrijft, controleert de scheidsrechter of de logica standhoudt tegenover het regelboek. Als de robot een fout maakt—bijvoorbeeld als hij beweert dat een "broer" en een "moeder" een "neef of nicht" vormen in plaats van een "zus"—verwijdert het systeem niet de hele pagina. In plaats daarvan geeft het de robot een zachte tik: "Hé, die stap is fout; hier is de juiste logica," en vraagt de robot om precies dat deel en de rest van het verhaal vanaf dat punt opnieuw te schrijven.

De onderzoekers testten dit idee op een benchmark genaamd CLUTRR, wat in feftelijk een enorme familieboom-puzzel is waarbij je moet uitzoeken hoe twee mensen met elkaar verwant zijn door de punten te verbinden door verschillende generaties heen. Ze probeerden dit op vijf verschillende taalmodellen, variërend van kleinere, lokale computers tot de krachtigste "frontier"-modellen die vandaag de dag beschikbaar zijn. De resultaten waren zeer veelbelovend. Voor de kleinere modellen verhoogde deze "patching"-methode hun nauwkeurigheid met een enorme hoeveelheid—tot wel 48 procentpunten op de moeilijkste, langste puzzels. Zelfs de superintelligente frontier-modellen, die al behoorlijk goed waren, werden aanzienlijk beter, met een verbetering van tot wel 15 punten op de langste ketens. De studie sugggeert dat naarmate de puzzels langer en ingewikkelder worden, het eigen brein van de robot vaker struikelt, en dat het hebben van deze symbolische "vangrail" om specifieke logische fouten op te vangen en te herstellen een enorm verschil maakt.

Wat deze aanpak bijzonder maakt, is hoe het fouten afhandelt. Het systeem zegt niet alleen "fout" of "goed"; het diagnosticeert waarom de robot het fout had. Het kan bepalen of de robot de juiste ingrediënten maar het verkeerde recept gebruikte, of dat hij een relatie verkeerd omdraaide (zoals het verwarren van "moeder" en "dochter"), of dat hij een feit verzonnen dat niet in het verhaal stond. Interessant genoeg vond de studie dat voor de grootste, slimste modellen de meest voorkomende fout niet het fout maken van de logica was, maar het verwarren van de richting van relaties. Door deze specifieke, kleine fouten te herstellen en de robot vanaf het gecorrigeerde punt te laten doorgaan, behoudt het systeem de eigen creativiteit en basis van de robot terwijl de logica wel sluitend blijft. Dit suggereert dat we AI niet hoeven te vervangen door rigide wiskunde om het betrouwbaar te maken; we hebben alleen een slimme, lichtgewicht manier nodig om het huiswerk tussendoor te controleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →