Are you Talking Logic to Me? Assessing Language Models Syllogistic Reasoning Capabilities
Dit artikel onderzoekt hoe verschillende formele kennisrepresentatie-notaties en een nieuwe syllogistische categorisatiemethode (SEF) de syllogistische redeneercapaciteiten van Small Language Models verbeteren, waarbij een competitief en sneller alternatief wordt geboden voor natuurlijke taalinputs via het open-source Common Logic Grammar Construction (CLGC) framework.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij moet denken. Je zou kunnen aannemen dat als je de robot maar genoeg boeken laat lezen, hij uiteindelijk wel zal uitzoeken hoe hij een logische puzzel moet oplossen, zoals een raadsel of een wiskundig probleem. Maar hier komt de crux: robots (of "Taalmodellen", zoals wetenschappers ze noemen) zijn als super-snelle papegaaien. Ze zijn verbazingwekkend goed in het nabootsen van menselijke spraak en het schrijven van verhalen, maar wanneer je hen vraagt om strikte logische regels te volgen, raken ze vaak in de war. Ze kunnen het antwoord raden op basis van hoe de zin klinkt in plaats van wat de zin daadwerkelijk betekent. Dit is een groot probleem, want we willen dat deze AI-tools betrouwbare helpers zijn, en niet alleen maar praatgrage vrienden die feiten verzinnen. Om dit op te lossen, proberen onderzoekers deze robots te leren "spreken" in verschillende talen. Sommige talen lijken op onze alledaagse woorden (Natuurlijke Taal), terwijl andere lijken op strikte wiskundige formules of code (Formele Notaties). De grote vraag is: helpt het de robot om beter na te denken als hij spreekt in een strikte, logische code dan wanneer hij gewoon Engels spreekt?
Dit artikel, getiteld "Are you Talking Logic to Me?", duikt direct in die vraag. De auteurs, een team van onderzoekers uit Frankrijk, besloten te testen of het veranderen van de "taal" die de robot gebruikt om logische puzzels op te lossen, hem slimmer kon maken. Ze richtten zich op een specifief type puzzel genaamd een "syllogisme". Denk aan een syllogisme als een logische keten van drie delen: "Alle katten zijn harig. Fluffy is een kat. Daarom is Fluffy harig." Als de robot dit niet goed kan krijgen, kan hij niet vertrouwd worden bij complexere taken. De onderzoekers namen bestaande datasets van deze puzzels en vertaalden deze naar verschillende "formele" talen, variërend van standaard computertalen (zoals FOL) tot meer abstracte, symboolrijke codes (zoals TFLPLUS) en zelfs enkele nieuwe, vereenvoudigde versies die zij zelf bedachten, genaamd "MINIFOL". Ze testten deze puzzels vervolgens op "Small Language Models" (SLM's)—die de lichte, energiezuinige versies zijn van de enorme AI-modellen waar we in het nieuws over horen.
Het team gooide de puzzels niet zomaar naar de robots; ze probeerden twee verschillende onderwijsmethoden uit. Eerst gebruikten ze "Supervised Fine-Tuning" (SFT), wat lijkt op een crashcourse waarbij ze de robot de puzzels en de juiste antwoorden keer op keer laten zien totdat hij het patroon leert. Ten tweede gebruikten ze "Zero-Shot" (ZS) testen, waarbij ze de robot simpelweg een nieuwe puzzel en een set instructies gaven, met de vraag om het ter plekke uit te zoeken zonder voorafgaande oefening. Ze probeerden ook "referentiebladen" toe te voegen aan de instructies, waarbij ze de robot een definitie van het type puzzel gaven (zoals "Dit is een Disjunctief syllogisme") om te zien of die extra context hielp.
Wat kwamen ze tegen? Het blijkt dat de "taal" die de robot spreekt er veel toe doet, maar dat hangt af van hoeveel de robot heeft gestudeerd. Wanneer de robots een crashcourse kregen (SFT), waren de resultaten verrassend. Bij kleinere datasets werkten de meest abstracte, symboolrijke talen (zoals TFLPLUS) zelfs beter dan normaal Engels, ook al hadden de robots tijdens hun initiële training veel meer Engels gezien. De onderzoekers suggereren dat dit komt doordat de symbolen in deze abstracte talen eenvoudiger en minder verwarrend zijn voor de robot om te verwerken. Echter, wanneer de dataset groter werd, gaven de robots de voorkeur aan een mix van Engels en een compacte code (CLIF). Deze combinatie leek de robots voorzichtiger te maken en minder geneigd om fouten te raden, vooral wanneer het antwoord "Onbekend" was.
In de "Zero-Shot" tests, waarbij de robots moesten vertrouwen op wat ze al wisten, waren de resultaten wat gemengder. De beste taal hing volledig af van welk specifiek robotmodel werd getest. Sommige modellen, die getraind waren op veel data over wiskunde en logica, presteerden beter met de abstracte codes. Andere, die voornamelijk op tekst waren getraind, deden het beter met Engels-achtige formaten. Interessant genoeg hielpen die "referentieblad"-definities in de instructies sommige modellen wel, maar werkten ze bij anderen averechts, wat suggereert dat er geen enkele "magische oplossing" in de vorm van een taal is voor alle robots.
Een van de coolste ontdekkingen ging over snelheid. De robots losten de puzzels veel sneller op wanneer ze de compacte, op symbolen gebaseerde talen gebruikten in vergelijking met normaal Engels. Het is als het verschil tussen het lezen van een lang, kronkelend verhaal om een specifieke feit te vinden versus het opzoeken van een getal in een korte, overzichtelijke tabel. De abstracte talen waren niet alleen sneller te verwerken, maar leidden soms ook tot nauwkeuriger redeneren. De auteurs concluderen dat hoewel we niet één perfecte taal voor alle AI kunnen kiezen, het gebruik van een mix van natuurlijke taal en formele codes de sleutel kan zijn tot het bouwen van intelligentere, betrouwbaardere redeneersystemen. Ze hebben zelfs een gratis tool genaamd "CLGC" uitgebracht waarmee iedereen deze logische puzzels automatisch naar verschillende formaten kan vertalen, in de hoop dat andere onderzoekers dit "taal van de logica" verder kunnen verkennen. Uiteindelijk suggereert het artikel dat het aanleren van logisch denken aan AI niet alleen gaat over het voeren van meer data; het gaat over het leren spreken van de juiste taal voor de klus.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.