← Nieuwste papers
💬 NLP

UFAL-CUNI at SemEval-2026 Task 11: An Efficient Modular Neuro-symbolic Method for Syllogistic Reasoning

Het UFAL-CUNI-team presenteert een efficiënt modulair neuro-symbolisch systeem voor SemEval-2026 Taak 11 dat een kleine LLM-parser met 4 miljard parameters combineert met een symbolisch stellingbewijzer om concurrerende nauwkeurigheid in syllogistisch redeneren te bereiken en tegelijkertijd zero-shot-baselines te overtreffen, hoewel het beperkingen in de meertalige capaciteiten van kleinere modellen benadrukt.

Oorspronkelijke auteurs: Ivan Kartáč, Kristýna Onderková, Jan Bronec, Zdeněk Kasner, Mateusz Lango, Ondřej Dušek

Gepubliceerd 2026-05-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ivan Kartáč, Kristýna Onderková, Jan Bronec, Zdeněk Kasner, Mateusz Lango, Ondřej Dušek

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer slimme, maar licht afgeleide student (een Groot Taalmodel) te leren hoe hij logische raadsels moet oplossen die syllogismen heten. Dit zijn raadsels zoals:

  • Premisse 1: Alle katten zijn dieren.
  • Premisse 2: Sommige dieren zijn pluizig.
  • Conclusie: Daarom zijn sommige katten pluizig.

Het probleem is dat deze student een slechte gewoonte heeft: ze laten hun kennis van de echte wereld in de weg zitten. Als het raadsel zegt: "Alle katten zijn pluizig", kan de student "Waar" zeggen, gewoon omdat ze weten dat katten pluizig zijn, zelfs als de logica van het raadsel die conclusie niet echt ondersteunt. Dit wordt het "content-effect" genoemd. De student is bevooroordeeld door wat ze denken dat waar is, in plaats van door wat de regels van het raadsel zeggen.

De auteurs van dit artikel hebben een speciaal "tutorsysteem" gebouwd om dit op te lossen. Hier is hoe hun systeem werkt, eenvoudig uitgelegd:

1. De Vertaler (De tweetalige tolk)

Eerst, als het raadsel in een vreemde taal is (zoals Portugees of Russisch), gebruikt het systeem een groot taalmodel om het naar het Engels te vertalen. Denk hierbij aan een tolk die ervoor zorgt dat iedereen dezelfde taal spreekt voordat het logische spel begint.

2. De Notatie-expert (De LaTeX-schrijver)

Dit is de slimme truc van het systeem. In plaats van de student te vragen het raadsel direct op te lossen, vraagt het systeem hen om de zinnen te herschrijven in een specifieke "code" genaamd Eerste-orde logica (FOL), geschreven in een formaat genaamd LaTeX (dat eruitziet als wiskundige formules).

  • Waarom LaTeX? De auteurs beseften dat de student vragen om direct in de "moedertaal" van de computer te schrijven (Prover9-syntaxis), hetzelfde was als een mens vragen om in binaire code te spreken. Dit veroorzaakte te veel fouten.
  • De Analogie: Het is alsof je een student vraagt een wiskundig probleem op een whiteboard te schrijven met standaard symbolen (\forall, \exists, \rightarrow) eerst, in plaats van te proberen het direct in te typen op een rekenmachine die alleen een rare, specifieke code begrijpt. De student is veel beter in het schrijven van de "whiteboard"-versie, omdat ze dit hebben gezien in hun trainingsdata.

3. De Vertaler (De code-convertor)

Zodra de student de logica in het "whiteboard"- (LaTeX-) formaat heeft geschreven, fungeert een eenvoudig computerscript (een "transpiler") als een strenge redacteur. Het converteert die schone LaTeX-code direct naar de specifieke, rigide code die de computer nodig heeft om het bewijs te draaien (Prover9-syntaxis). Deze stap is puur mechanisch en houdt geen rekening met de "afgeleide" student, dus maakt het zelden fouten.

4. De Rechter (De geautomatiseerde bewijzer)

Ten slotte geeft het systeem de rigide code aan een Theorema-bewijzer (een stuk software genaamd Prover9). Dit is een robotrechter die geen emoties heeft en geen kennis van de echte wereld. Het geeft er niets om of katten pluizig zijn of of de maan van kaas gemaakt is. Het controleert alleen: Volgt de conclusie wiskundig uit de premissen? Als de wiskunde klopt, zegt het "Geldig". Zo niet, "Ongeldig".

5. De Detective (Het vinden van de belangrijke aanwijzingen)

Voor moeilijkere raadsels waarbij er extra, nutteloze zinnen door elkaar gemengd zijn, gebruikt het systeem een "gier-algoritme". Het handelt als een detective die probeert één aanwijzing per keer te verwijderen. Als het raadsel nog steeds zinvol is zonder een specifieke aanwijzing, is die aanwijzing irrelevant. Als het raadsel uit elkaar valt, was die aanwijzing noodzakelijk. Dit zorgt ervoor dat het systeem zich alleen richt op de feiten die echt belangrijk zijn.

Wat hebben ze gevonden?

  • Klein is mooi: Ze gebruikten een relatief klein AI-model (4 miljard parameters) voor het "student"-gedeelte. Hoewel kleine modellen meestal worstelen met complexe logica, maakte dit systeem ze zeer goed daarin door het daadwerkelijke redeneren uit te besteden aan de robotrechter.
  • De vooroordelen verslaan: Door de AI te dwingen eerst naar logica te vertalen en vervolgens een robot het resultaat te laten beoordelen, slaagden ze erin de AI te stoppen met bevooroordeeld te worden door feiten uit de echte wereld. Het "content-effect" daalde aanzienlijk.
  • Het metriek-probleem: Het artikel wijst ook op een gebrek in hoe de competitie werd gescoord. Het scoresysteem was zo gevoelig dat zelfs een kleine, willekeurige fout het scoren van een team kon verpesten, waardoor het moeilijk was om te zeggen of een systeem echt "goed" was of gewoon "gelukkig".

De conclusie

Het artikel toont aan dat je geen gigantische, superintelligente AI nodig hebt om logische raadsels op te lossen. In plaats daarvan kun je een kleine AI gebruiken als vertaler om menselijke taal om te zetten in wiskunde, en vervolgens een domme maar perfecte robot het daadwerkelijke denken laten doen. Deze combinatie voorkomt dat de AI wordt afgeleid door wat het "weet" over de wereld en dwingt het zich strikt te houden aan de regels van de logica.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →