← Nieuwste papers
🤖 AI

ForEx: A Formal Verification Framework for Explainable Reasoning in Logical Fallacy Detection and Annotation

Dit artikel introduceert ForEx, een framework voor formele verificatie dat door LLM gegenereerde verklaringen vertaalt naar Lean4 om de afleidbaarheid van redeneerketens te verifiëren, wat een aanzienlijk gat onthult tussen hoge formele verificatiepercentages en een lage overeenstemming van labels met menselijke annotaties bij het detecteren van logische drogredenen.

Oorspronkelijke auteurs: Pei-Cing Huang, Chienyu Liu, Chan Hsu, Ci-Siang Chen, Pei-Ju Lee, Yihuang Kang

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pei-Cing Huang, Chienyu Liu, Chan Hsu, Ci-Siang Chen, Pei-Ju Lee, Yihuang Kang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: "Goed Antwoord, Foute Redenering"

Stel je voor dat je een wiskundetoets maakt. Je schrijft het juiste eindantwoord op, maar je stappen zijn een complete chaos, of je hebt het antwoord geraden door geluk te hebben. Bij een normale toets krijg je volledige punten. Maar in de wereld van Kunstmatige Intelligentie (AI), specif kindelijk gezien bij Large Language Models (LLMs), is dit een enorm probleem.

Huidige tests voor AI controleren alleen of het eindlabel (het antwoord) juist is. Ze controleren niet of de redenering (de stappen) het antwoord ook daadwerkelijk ondersteunt. Een AI kan zeggen: "Deze zin bevat een drogreden," en gelijk hebben, maar de uitleg kan onzin zijn. Of de AI kan het fout hebben, maar de uitleg klinkt heel overtuigend.

De Oplossing: ForEx (De "Logica-Vertaler")

De auteurs hebben een tool gemaakt genaamd ForEx. Zie ForEx als een strikte vertaler en een scheidsrechter die samenwerken.

  1. De Vertaler (Lean4): Wanneer een AI een uitleg geeft, vertaalt ForEx die rommelige menselijke taal naar Lean4, wat een soort zeer strikte, computerleesbare taal is voor wiskunde en logica. Het is alsof je een informeel gesprek vertaalt naar een juridisch contract waarin elk woord uiterst precies moet zijn.
  2. De Scheidsrechter (De Compiler): Zodra de uitleg in Lean4 staat, probeert een computerprogramma deze te "draaien". Als de logica klopt, zegt de computer: "Pass!" (Geslaagd!). Als de logica gebrekkig is, zegt de computer: "Fail!" (Gezakt!).

Cruciaal onderscheid: Het paper verduidelijkt dat het slagen voor deze test niet betekent dat de AI de volledige menselijke zin perfect heeft begrepen. Het betekent alleen: "Gegeven de specifieke regels die wij hebben opgeschreven, volgt de conclusie van de AI logischerwijs uit de eigen uitleg."

De Nieuwe Scorekaart: De Verificatiematrix

In plaats van alleen "Correct" of "Incorrect" te zeggen, hebben de auteurs een nieuwe scorekaart uitgevonden genaamd de LLM Argument Verification Matrix. Deze verdeelt de resultaten in vier vakken, zoals een boterkaas-en-eieren-bord:

  • Vak 1: De Gouden Standaard (Compilable-Correct)
    • De Analogie: Je hebt het juiste antwoord en je wiskundestappen zijn perfect.
    • Betekenis: Het label van de AI komt overeen met dat van de menselijke expert, EN de computer heeft geverifieerd dat de redenering solide is.
  • Vak 2: De Verborgen Parel (Compilable-Alternative)
    • De Analogie: Je hebt een ander antwoord dan de docent, maar je wiskundestappen zijn perfect en bewijzen dat jouw antwoord geldig is onder een andere interpretatie.
    • Betekenis: Het label van de AI is anders dan dat van de menselijke expert, MAAR de computer heeft geverifieerd dat de redenering solide is. Dit suggereert dat de menselijke expert misschien een geldige manier om de zin te interpreteren, heeft gemist.
  • Vak 3: De Gelukkige Gok (Uncompilable-Correct)
    • De Analogie: Je hebt het juiste antwoord, maar je wiskundestappen zijn onleesbare krabbels.
    • Betekenis: De AI kwam overeen met het menselijke label, maar de computer kon de redenering niet verifiëren. De AI heeft het wellicht goed geraden door geluk.
  • Vak 4: De Dubbele Mislukking (Uncompilable-Incorrect)
    • De Analogie: Je hebt het fout en je wiskundestappen zijn onzin.
    • Betekenis: De AI zat ernaast en de redenering was gebrekkig.

Wat ze vonden (De Resultaten)

De onderzoekers testten dit op een dataset genaamd LOGIC-Climate (ongeveer 100 voorbeelden van logische argumenten). Dit is wat zij ontdekten:

  1. AI is verrassend goed in het opbouwen van logische ketens: In meer dan 90% van de gevallen kon de uitleg van de AI worden vertaald naar Lean4 en slaagde de AI voor de logische controle van de computer.
  2. Maar AI is slecht in het matchen van menselijke labels: Ondanks de goede logische ketens, stemde de AI slechts in ongeveer 20% van de gevallen overeen met menselijke experts.
  3. Het "Alternative"-vak is enorm: De meeste tijd was de AI niet "fout"; de AI zat in Vak 2 (Compilable-Alternative). De AI vond een logisch geldige reden om een zin anders te labelen dan de menselijke expert deed.

De Kernboodschap: Er is een enorme kloof tussen "Kan de AI zijn redenering bewijzen?" en "Komt de AI overeen met mensen?". Het paper suggereert dat veel menselijke labels te nauw zijn en een geldige interpretatie van een zin missen.

De "Groepsapp" voor Annotaties

Om het probleem op te lossen waarbij mensen en AI van mening verschillen, bouwden de auteurs een Consensus-Guided Annotation Pipeline.

  • De Analogie: Stel je een klas voor waar de docent (mens) en 15 leerlingen (AI-modellen) allemaal een toets nakijken. Normaal gesproken, als de docent "A" zegt en de leerlingen "B", gaan we ervan uit dat de leerlingen fout zitten.
  • De ForEx-aanpak: Ze kijken alleen naar de leerlingen die bewezen hebben dat hun logica klopte (geslaagd voor de Lean4-check). Als een groep van deze "slimme" leerlingen allemaal hetzelfde label geven dat de docent gemist heeft, markeren ze dit als een potentiële "Alternative" label.
  • Het Resultaat: Ze ontdekten een paar gevallen waar de AI-modellen collectief een geldige logische weg zagen die het oorspronkelijke menselijke label over het hoofd had gezien. Ze voegden deze toe aan de dataset, maar alleen voor de gevallen waar iedereen het eens was (hoge consensus).

Samenvatting

Dit paper betoogt dat we moeten stoppen met alleen controleren of een AI het "juiste" label krijgt. We moeten controleren of de redenering standhoudt, net als een wiskundig bewijs.

Ze ontdekten dat AI-modellen eigenlijk erg goed zijn in het bouwen van logische bewijzen (90% slagingspercentage), maar dat ze vaak van mening verschillen met menselijke experts. Dit suggereert dat menselijke experts misschien te rigide zijn in hoe ze logische drogredenen labelen, en dat er geldige, logische manieren zijn om zinnen te interpreteren die de huidige menselijke labels niet vatten. ForEx is een tool om die "verborgen" geldige interpretaties te vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →