HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization
Het HABIB_TAZ-systeem behaalde toprangschikkingen in SemEval-2026 Taak 11 door mDeBERTa-v3-modellen te gebruiken die getraind zijn op synthetische syllogistische data met multi-objective optimalisatie om formele logica effectief te ontwarren van inhoudelijke bias over meerdere talen heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot leert hoe hij logische puzzels moet oplossen. Je geeft hem een regel: "Als alle vogels kunnen vliegen, en een pinguïn is een vogel, dan kan een pinguïn vliegen." Een mens zou kunnen pauzeren en zeggen: "Wacht, pinguïns kunnen niet vliegen! Die regel is fout in de echte wereld." Maar een robot die te veel vertrouwt op zijn "gezond verstand", zou in de war kunnen raken. Hij zou kunnen denken: "Oh, pinguïns zijn vogels, en vogels vliegen, dus de conclusie moet waar zijn," ook al is de logica zelf gebrekkig omdat de startregel onjuist was. Dit is het lastige probleem waar wetenschappers proberen een oplossing voor te vinden met Large Language Models (LLMs). Dit zijn de krachtige AI-hersenen achter chatbots en zoekmachines. Ze zijn geweldig in het schrijven van verhalen en het beantwoorden van vragen, maar ze hebben vaak moeite met het onderscheid tussen wat logisch waar is en wat geloofwaardig klinkt. Ze worden gefopt door "content effects", waarbij de werkelijke betekenis van de woorden hen afleidt van de feitelijke structuur van het argument. Het doel van dit onderzoek is om een AI te bous die werkt als een strikte logicus: één die controleert of de wiskunde van het argument klopt, ongeacht of het verhaal onzin of zinvol klinkt.
Het team achter dit project, HABIB_TAZ, nam deel aan een wedstrijd genaamd SemEval-2026 Task 11 om precies dit vermogen te testen. Hun missie was om een systeem te creëren dat syllogismen (een type logisch argument met twee premissen en een conclusie) in 12 verschillende talen kon analyseren en kon beslissen of de conclusie de regels volgde, zelfs als de premissen onzin waren of als er extra, afleidende zinnen tussen werden gegooid.
Om dit op te lossen, hebben de onderzoekers hun AI niet simpelweg gevoerd met meer real-world data. In plaats daarvan bouwden ze een "synthetische" trainingsgrond. Stel je voor dat ze een enorme fabriek creëerden die miljoenen logische puzzels genereert met behulp van strikte, verzonnen regels en wartaal, in plaats van echte dieren of objecten. Dit was om te voorkomen dat de AI shortcuts zou leren op basis van echte wereldkennis. Vervolgens trainden ze hun AI-model, dat gebaseerd is op een krachtige taalengine genaamd mDeBERTa-v3, met een speciaal driespelig trainingsrecept. Eerst gebruikten ze een techniek om ervoor te zorgen dat het model de moeilijkere, lastigere voorbeelden niet negeerde. Ten tweede voegden ze een "bias penalty" toe, wat is als een leraar die de leerling zachtjes berispt telkens wanneer deze wordt afgeleid door hoe "aannemelijk" een verhaal klinkt, waardoor de focus op alleen de logica wordt gelegd. Ten derde gebruikten ze een consistentiecheck om te waarborgen dat het model begreep dat een complexe zin hetzelfde logische betekende als een eenvoudige zin.
De resultaten waren een mix van perfecte scores en interessante uitdagingen. Bij de eenvoudigere taken—Engelse puzzels alleen, Engelse puzzels met afleidingen, en puzzels in 12 talen zonder afleidingen—behaalde hun systeem een perfecte score van 100,0. Het negeerde de "echte wereld"-trucs volledig en kreeg de logica elke keer goed, met nul bias. Echter, de moeilijkste uitdaging was de "Noisy Multilingual" taak, waarbij de AI te maken kreeg met 12 talen én afleidende zinnen. Hier behaalde het systeem een 6e plaats. Het kreeg 89,06% van de antwoorden goed, maar vertoonde nog steeds een kleine hoeveelheid bias (2,89%).
De onderzoekers ontdekten dat hun speciale trainingsrecept wonderen deed voor de makkelijkere taken, wat bewees dat je een AI een pure logicus kunt leren als je traint op synthetische, regelgebaseerde data in plaats van rommelige real-world tekst. Voor de moeilijkste taak merkten ze op dat het model meer moeite had met de oorspronkelijke meertalige data dan met Engelse vertalingen, wat suggereert dat de manier waarop het model verschillende talen verwerkt, nog steeds wat wankel is. Ze ontdekten ook dat het toevoegen van een specifieke "consistentie"-check (met behulp van KL-Divergence) hielp om het model stabiel te houden over verschillende talen, hoewel dit veel rekenkracht vereiste. Uiteindelijk suggereert het paper dat hoewel we AI's kunnen bouwen die ongelooflijk goed zijn in pure logica, het robuust maken ervan voor elke taal en elke vorm van ruis nog steeds een werk in uitvoering is. Het team heeft hun code en datageneratietools publiek gemaakt, in de hoop dat anderen ze zullen gebruiken om nog betere, meer logische AI te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.