FregeLogic at SemEval 2026 Task 11: A Hybrid Neuro-Symbolic Architecture for Content-Robust Syllogistic Validity Prediction
Dit paper introduceert FregeLogic, een hybride neuro-symbolisch systeem voor SemEval-2026 dat syllogismes geldigheid voorspelt door een ensemble van LLM's te combineren met een Z3-formele logische verificatie, wat resulteert in een verbeterde nauwkeurigheid en een aanzienlijke reductie van content-bias.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De Grote Uitdaging: De "Geloofwaardigheidsval"
Stel je voor dat je een groep slimme detectives (de AI-modellen) vraagt om te bepalen of een redenering logisch klopt.
Deze detectives zijn erg goed, maar ze hebben een menselijke zwakheid: ze laten zich beïnvloeden door wat ze weten over de echte wereld.
- Voorbeeld: Als een detective hoort: "Alle mensen zijn sterfelijk. Socrates is een mens. Dus Socrates is sterfelijk." Dan denkt hij: "Ja, dat klopt, dat weet ik wel."
- Het probleem: Als de zin is: "Alle mensen zijn gemaakt van glas. Socrates is een mens. Dus Socrates is gemaakt van glas." Dan denkt de detective: "Wacht, mensen zijn niet van glas! Dat is onzin!" En hij zegt dat de redenering fout is.
- De realiteit: Logisch gezien is de tweede redenering perfect correct. Als de premisse (de eerste zin) waar is, dan is de conclusie ook waar. Maar omdat het onwaarschijnlijk klinkt, laten de AI's zich verwarren. Dit noemen de auteurs "content effects" (inhoudseffecten).
De uitdaging van de wedstrijd (SemEval 2026) was: hoe maak je een AI die puur naar de logica kijkt, en niet naar of het verhaal geloofwaardig klinkt?
De Oplossing: FregeLogic (Het Team met een Scheidsrechter)
De auteurs hebben een slim systeem bedacht dat twee krachten combineert: een team van AI-detectives en een strikt wiskundig scheidsrechter.
1. Het Team van Detectives (De LLM-Ensemble)
Ze hebben niet één AI gebruikt, maar een team van vijf verschillende AI's (zoals Llama en Qwen). Ze hebben ze elk een beetje anders getraind (met verschillende instructies).
- Hoe het werkt: Ze kijken allemaal naar dezelfde redenering en stemmen: "Logisch" of "Niet logisch".
- Het probleem: Soms zijn ze het oneens. Vaak is dat omdat sommige detectives in de valkuil van "geloofwaardigheid" zijn getrapt, terwijl anderen dat niet zijn.
2. De Scheidsrechter (De Z3 Solver)
Hier komt de magie. Ze hebben een speciale, heel strenge wiskundige computer (een "SMT-solver" genaamd Z3) ingezet.
- Deze computer is niet menselijk. Hij snapt geen verhalen, geen glas, geen mensen. Hij ziet alleen symbolen en regels. Voor hem is "Alle mensen zijn van glas" net zo logisch als "Alle bloemen zijn rood". Hij wordt nooit verward door wat hij "weet".
- De strategie: De AI's mogen zelf beslissen als ze het eens zijn. Maar als het team het niet eens is (bijvoorbeeld 3 tegen 2 stemmen), dan roepen ze de scheidsrechter.
- De scheidsrechter kijkt alleen naar de structuur van de zin, haalt alle inhoud weg, en zegt: "Ja, dit klopt logisch" of "Nee, dit klopt niet".
Waarom werkt dit zo goed?
De auteurs ontdekten iets heel belangrijks: Wanneer de AI's het oneens zijn, is dat vaak het moment waarop ze door de inhoud zijn verleid.
- Als alle 5 AI's het eens zijn, is de logica meestal duidelijk.
- Als het 3 tegen 2 is, is het vaak een lastige casus waar de "menselijke" kant van de AI's in de war raakt.
- Door in die specifieke gevallen de "onmenselijke" scheidsrechter te laten beslissen, halen ze de fouten eruit.
De Resultaten in Eenvoud
Stel je voor dat je een examen doet waarbij je punten krijgt voor:
- Hoe vaak je het goed hebt (Nauwkeurigheid).
- Hoe weinig je verward wordt door gekke verhalen (Lage "inhouds-effecten").
- Alleen het AI-team: Haalde een score van ongeveer 39. Ze maakten nogal wat fouten door de verhalen.
- Het hybride systeem (Team + Scheidsrechter): Haalde een score van 42.
- Ze maakten iets minder fouten (nauwkeurigheid ging omhoog).
- Ze werden veel minder verward door de inhoud (de "inhouds-effecten" daalden met 16%).
Het systeem slaagde erin om de AI's te dwingen om in twijfelgevallen te stoppen met "gissen" en te vertrouwen op de harde logica.
De "Truc" die ze gebruikten
Een groot probleem was dat de AI's soms de structuur van de zin niet goed konden uitlezen voor de scheidsrechter (bijvoorbeeld: "Is dit een 'alle' of een 'sommige'?" of "Wat is het onderwerp?").
De auteurs losten dit op door de AI's te dwingen om hun antwoord in een strakke, gestructureerde lijst (JSON) te geven, net als een formulier invullen. Hierdoor faalde de vertaalslag bijna nooit meer.
Conclusie
FregeLogic is als een slimme werkgroep die weet wanneer ze zelf niet verder komen. Ze zeggen: "Oké, we zijn het oneens, en dat betekent waarschijnlijk dat we door het verhaal in de war zijn geraakt. Laten we de robot-scheidsrechter erbij halen die alleen naar de regels kijkt."
Dit bewijst dat je AI's slimmer kunt maken door ze niet alleen op hun eigen "intuïtie" te laten vertrouwen, maar ze op de juiste momenten te laten samenwerken met een onfeilbare, logische machine.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.