Knowledge-Constrained Reasoner: Attempting to Enable LLMs to Parse Knowledge for Question Answering
Dit artikel introduceert de Knowledge-Constrained Reasoner, een nieuwe aanpak die een enkele alignment-fase gebruikt om essentiële redeneervaardigheden te internaliseren in Large Language Models, waardoor het strikte en correcte gebruik van externe kennis voor vraagbeantwoording wordt gewaarborgd en de betrouwbaarheid van traditionele expertsystemen wordt verbonden met de flexibiliteit van niet-parametrisch continu leren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante, supersnelle robot probeert te leren hoe hij een mysterie moet oplossen. Je hebt twee hoofdwegen om dit te doen. De eerste manier is alsof je de robot een enorme, zware encyclopedie geeft die in zijn eigen brein geschreven staat. Dit is hoe vroege "expertsystemen" werkten: ze waren ongelooflijk strikt en volgden regels perfect, maar ze waren ook rigide. Als je ze iets vroeg dat niet in hun boek stond, bevroren ze. Als je de regels wilde bijwerken, moest je het hele boek herschrijven, wat traag en duur was.
De tweede manier is wat we tegenwoordig gebruiken met moderne AI, zoals de chatbots waar je mee kunt praten. Deze modellen zijn als superlezers die het hele internet hebben opgeslokt. Ze zijn flexibel, grappig en goed in conversatie. Maar ze hebben een lastige fout: ze vergeten soms dingen die ze net geleerd hebben, of ze raken in de war wanneer je ze een nieuwe regel geeft en vraagt om die strikt te volgen. Ze kunnen het antwoord raden op basis van wat ze denken dat waar is, in plaats van wat de nieuwe regel daadwerkelijk zegt. Dit is een groot probleem als je nodig hebt dat de robot handelt als een arts, een piloot of een veiligheidsinspecteur, waar het strikt volgen van de regel een kwestie van leven of dood is.
Dit brengt ons bij een nieuw idee genaamd "Retrieval-Augmented Generation" (RAG). Denk aan dit als het geven van een bibliotheekpas aan de robot. Wanneer je een vraag stelt, pakt de robot snel de relevante pagina uit de bibliotheek en leest deze voordat hij antwoord geeft. Het is beter dan gokken, maar de robot moet nog steeds beslissen hoe hij die pagina leest. Soms negeert hij de kleine lettertjes, soms mist hij een stap, en soms probeert hij te slim te zijn en verzint hij een regel die er niet is. De grote vraag waar wetenschappers zich mee bezighouden is: Kunnen we de robot leren om niet alleen de bibliotheek te lezen, maar om een meesterlogicaster te worden die de regels elke keer perfect volgt, zonder dat hij zijn eigen brein hoeft te herschrijven?
De Knowledge-Constrained Reasoner: AI leren een regelvolger te zijn
In dit artikel probeert een onderzoeker genaamd Zhiqiang Gan dat antwoord te vinden door iets te bouwen dat een "Knowledge-Constrained Reasoner" wordt genoemd. Het doel is om een standaard Large Language Model (LLM) te veranderen in een strikte, logische detective die een verse set regels (zoals een nieuw medisch protocol of een militaire richtlijn) kan nemen en deze tot op de letter kan volgen, zonder in de war te raken of dingen te verzinnen.
Het artikel suggereert dat we, in plaats van te proberen nieuwe feiten in het geheugen van de AI te proppen (wat ervoor zorgt dat het oude dingen vergeet), de AI een reeks "meta-vaardigheden" of "superkrachten" moeten aanleren in één enkele trainingssessie. Denk aan het trainen van een hond. Je leert een hond niet elke specifieke opdracht voor elke mogelijke situatie in de wereld. In plaats daarvan leer je het concept van luisteren, het concept van zoeken naar een traktatie en het concept van wachten op een signaal. Zodra de hond deze concepten kent, kun je hem een nieuwe opdracht geven en zal hij begrijpen hoe hij die moet opvolgen, zelfs als hij die specifie specifieke opdracht nog nooit heeft gehoord.
De Vijf Superkrachten
Om de AI een goede regelvolger te maken, heeft de onderzoeker de AI getraind op vier specifieke logische "zetten" (plus één extra) met behulp van een dataset van 1.000 verzonnen scenario's met nepdokters, soldaten en fabrieksarbeiders. Dit zijn deze zetten, eenvoudig uitgelegd:
Situational Contextualization (De "Is dit over mij?" check):
Voordat de AI handelt, moet hij controleren of de regel wel echt van toepassing is op de huidige situatie.- De Analogie: Stel je een uitsmijter bij een club voor. Als de regel zegt "Geen schoenen toegestaan" en je loopt binnen met sokken, moet de uitsmijter beslissen: "Tellen sokken als schoenen?"
- Wat het artikel vond: De AI werd getraind om te controleren of de situatie van de gebruiker exact overeenkomt met de voorwaarden van de regel. Het leerde "Nee" te zeggen als de regel over "ernstige" crashes ging maar de gebruiker een "lichte" crash had, om te voorkomen dat de verkeerde regel werd toegepast. Het leerde ook toe te geven wanneer het het antwoord niet wist, in plaats van een nepmedicijn voor een patiënt te verzinnen.
Forward Causal Deduction (De "Als dit, dan dat" keten):
Dit is de klassieke logica: Als A gebeurt, dan moet B gebeuren.- De Analogie: Zoals een domino-effect. Als je de eerste domino duwt (de patiënt heeft koorts), valt de volgende (geef medicijnen).
- Wat het artikel vond: De AI leerde naar een situatie te kijken, de bijbehorende regel te vinden en onmiddellijk naar de juiste actie te springen.
Backward Causal Tracing (De "Waarom is dit gebeurd?" detectivewerk):
Soms zie je het resultaat en moet je de oorzaak vinden.- De Analogie: Je loopt een kamer binnen en ziet een gebroken vaas op de grond. Je moet kijken naar de huisregels om te achterhalen: "Wie mocht hier zijn, en wat waren ze aan het doen?"
- Wat het artikel vond: De AI kon naar een uitkomst kijken (zoals "stroom werd afgesloten naar de robotarm") en dit herleiden naar de regel die zei: "Als de reactor te heet wordt, schakel dan de stroom uit." Het begreep succesvol dat de oorzaak het oververhitten was.
Logical Composition (De "Doe alles" lijst):
Het echte leven is rommelig. Soms activeert één situatie meerdere regels tegelijkertijd.- De Analogie: Stel je een videogame-personage voor dat, wanneer het geraakt wordt, zowel levenspunten moet verliezen ALS een muntje moet laten vallen. Als het spel het personage alleen een muntje laat vallen, zou dat een bug zijn.
- Wat het artikel vond: De AI leerde complexe regels aan te kunnen waarbij één situatie een diagnose, een isolatiestap EN een rapportage aan de autoriteiten vereiste. Het stopte met het overslaan van stappen en begon de volledige checklist af te werken.
Filtering (De "Alleen de feiten" filter):
Soms heeft een regel een lange lijst met stappen, maar heb je alleen de eerste nodig.- De Analogie: Een recept zegt: "Verwarm de oven voor, snijd de uien, bak het spek, en serveer dan." Als je vraagt: "Wat moet ik eerst doen?", moet de AI niet het hele recept op je dumpen. Het moet gewoon zeggen: "Verwarm de oven voor."
- Wat het artikel vond: De AI leerde de extra ruis te negeren en alleen de specifieke stap te geven waar de gebruiker om vroeg.
De Resultaten: Werkte het?
De onderzoeker testte deze nieuwe "Reasoner" tegen de standaard manier van AI gebruiken (gewoon vragen stellen zonder speciale training).
- De Standaard Manier: Wanneer gevraagd werd om complexe regels te volgen, had de gewone AI ongeveer 75% van de antwoorden goed. Het werd vaak in de war gebracht, sloeg stappen over of gaf simpelweg op.
- De Nieuwe Manier: Na de enkele trainingssessie behaalde de "Knowledge-Constrained Reasoner" ongeveer 88% van de antwoorden goed.
Het artikel suggereert dat deze verbetering echt en significant is. De AI werd veel beter in het strikt volgen van de regels die eraan werden gegeven, zelfs wanneer de regels over verzonnen onderwerpen gingen zoals "Titan Mechs" of "Fictionele Financiën".
Wat het niet deed (En waar het struikelde)
Het is belangrijk om op te merken wat dit artikel niet heeft gedaan. Het heeft niet bewezen dat de AI nu perfect is. Het artikel wijst er expliciet op dat de AI nog steeds fouten maakt in ongeveer 12% van de gevallen.
- De Verwarring: Soms haalde de AI het resultaat van een regel door elkaar met de actie die ondernomen moest worden. Bijvoorbeeld, als een regel zei "Als de hacker inbreekt, zal de markt crashen," en de gebruiker vroeg "Wat moeten we doen?", zei de AI soms alleen "De markt zal crashen" in plaats van "We moeten de deuren vergrendelen."
- De Precisiekloof: De AI miste soms kleine details, zoals het verwarren van een "licht" probleem met een "ernstig" probleem, wat leidde tot het gebruik van het verkeerde noodplan.
Het artikel betoogt dat de huidige methode van het simpelweg geven van een paar voorbeelden (genaamd "prompting") niet voldoende is om deze diepe logische fouten te herstellen. De AI moet "fine-tuned" worden—eigenlijk moet het deze logische zetten oefenen totdat ze een gewoonte worden, in plaats van alleen te gokken op basis van een paar hints.
Het Grotere Plaatje
De belangrijkste conclusie van dit onderzoek is dat we AI kunnen bouien die zowel flexibel is (zoals een mens) als betrouwbaar (zoals een computerprogramma) door het de AI te leren hoe het met regels moet denken, in plaats van alleen de regels te laten memoriseren. De onderzoeker suggereert dat als we een AI kunnen leren om zijn logica te "verankeren" aan externe informatie, het nieuwe dingen direct kan leren zonder oude dingen te vergeten.
Het artikel is echter voorzichtig en stelt dat dit slechts een "initiële poging" en "voorlopig bewijs" is. Het is een veelbelovende stap richting het overbruggen van de kloof tussen de rigide, veilige wereld van de oude expertsystemen en de flexibele, creatieve wereld van moderne AI. Het laat zien dat AI, met de juiste training, een veel betere regelvolger kan worden, maar het is nog niet klaar om menselijke experts te vervangen in situaties met hoge inzet. De reis naar een werkelijk betrouwbare, niet-vergetende AI is nog steeds gaande, maar deze nieuwe "Reasoner" biedt een frisse kaart voor het pad dat voor ons ligt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.