← Nieuwste papers
💬 NLP

LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening

Dit artikel introduceert LLMEval-Logic, een strikt geverifieerde Chinese benchmark voor logisch redeneren die gebruikmaakt van deskundige audit, formele verificatie met Z3 en adversariale verharding om aanzienlijke prestatiekloven in huidige toonaangevende grote taalmodellen aan het licht te brengen.

Oorspronkelijke auteurs: Ming Zhang, Qiyuan Peng, Yinxi Wei, Yujiong Shen, Kexin Tan, Yuhui Wang, Zhenghao Xiang, Junjie Ye, Zhangyue Yin, Zhiheng Xi, Shihan Dou, Tao Gui, Maxm Pan, Ruizhi Yang, Qi Zhang, Xuanjing Huang

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ming Zhang, Qiyuan Peng, Yinxi Wei, Yujiong Shen, Kexin Tan, Yuhui Wang, Zhenghao Xiang, Junjie Ye, Zhangyue Yin, Zhiheng Xi, Shihan Dou, Tao Gui, Maxm Pan, Ruizhi Yang, Qi Zhang, Xuanjing Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren logisch na te denken. Je geeft het een raadsel en het moet het antwoord uitsluitend op basis van de door jou verstrekte regels achterhalen.

Lange tijd waren de tests die we gebruikten om te controleren of deze robots (Grote Taalmodellen, of LLM's) slimmer werden, als invulwerkbladen. Ze werden vaak gegenereerd door computers die een wiskundige formule namen en omzetten in een zin. Het probleem? De robots leerden het "patroon" van de zin te herkennen in plaats van daadwerkelijk de wiskunde te doen. Ze bedrogen door te gokken op basis van hoe de vraag eruitzag, niet door de logica te volgen.

Het artikel introduceert een nieuwe, veel strengere test genaamd LLMEval-Logic. Denk hierbij aan het vervangen van die invulwerkbladen door een echte escape room.

Zo werkt het, opgesplitst in eenvoudige onderdelen:

1. De "echte" verhalen (Forward Authoring)

In plaats van dat computers neppe vragen genereren, hebben echte mensen die experts zijn in logica deze problemen van scratch geschreven.

  • De analogie: Stel je een muziekcomponist voor die een nummer schrijft op basis van een specifieke regel (bijvoorbeeld: "Als je de trompet speelt, moet je ook de tuba spelen"). De test vraagt: "Welke instrumenten kunnen we samen gebruiken?"
  • Waarom dit belangrijk is: Deze verhalen voelen als echte situaties (zoals het plannen van een vergadering of beslissen wie de baan krijgt), zodat de robots niet zomaar kunnen gokken op basis van een patroon. Ze moeten het verhaal daadwerkelijk lezen en begrijpen.

2. De "Waarheidsmachine" (Z3-verificatie)

Elke enkele vraag op deze test is gecontroleerd door een superstreng "Waarheidsmachine" (een computerprogramma genaamd Z3).

  • De analogie: Stel je een scheidsrechter in een spel voor die een rekenmachine heeft. Voordat de test zelfs maar wordt vrijgegeven, draait de scheidsrechter de regels door de rekenmachine om 100% zeker te zijn dat het antwoord correct is. Als de rekenmachine zegt dat het antwoord "A" is, maar de mens schreef "B", wordt de vraag weggegooid en herschreven.
  • Waarom dit belangrijk is: Dit garandeert dat de test zelf perfect is. Er zijn geen "trucvragen" waarbij het antwoordblad verkeerd is.

3. De "Hard Mode" (Adversarial Hardening)

De onderzoekers stopten niet bij het maken van de test moeilijk; ze maakten het opzettelijk moeilijker. Ze gebruikten een team van AI-agenten om "Duivelsadvocaat" te spelen tegen de vragen.

  • De analogie: Stel je voor dat je een raadsel schrijft. Vervolgens probeert een team van "truuks" het te breken. Ze zeggen: "Wat als we hier een verwarrend detail toevoegen?" of "Wat als we een vervolgvraag stellen die de hele situatie verandert?" Ze blijven het raadsel herschrijven totdat het zo complex is dat zelfs een slimme mens moeite zou hebben, maar het heeft nog steeds een logisch antwoord.
  • Het resultaat: Ze creëerden een "Hard" versie van de test met meerstapspuzzels. Je kunt niet zomaar één stap oplossen; je moet het hele plaatje in je hoofd houden terwijl je een reeks vragen beantwoordt.

4. De "Beoordelingsrubriek" (Niet alleen goed of fout)

Wanneer de robots antwoordden, controleerden de onderzoekers niet alleen of het eindantwoord klopte. Ze keken hoe de robot het verhaal naar logica vertaalde.

  • De analogie: Stel je een student voor die een wiskundeprobleem oplost. Als ze het juiste antwoord krijgen maar de verkeerde formule gebruikten, zou een normale leraar ze misschien volwaardig credit geven. Maar deze test is als een strenge professor die zegt: "Je hebt het getal goed, maar je hebt de regel over 'als en slechts als' gemist. Dat is een falen."
  • De score: Ze gaven de robots twee scores: één voor het eindantwoord en één voor hoe goed ze het verhaal naar een logische taal vertaalden.

Wat vonden ze?

De resultaten waren een beetje een schok voor de industrie:

  • Het plafond is laag: Zelfs de slimste, meest geavanceerde robots die momenteel beschikbaar zijn, kregen slechts ongeveer 37,5% van de "Hard" vragen goed.
  • De vertaalkloof: Zelfs wanneer de robots het eindantwoord goed kregen, faalden ze er vaak in om het verhaal naar de juiste logische regels te vertalen. Het is als een student die het juiste antwoord raadt op een meerkeuzetoets, maar niet kan uitleggen waarom het goed is.
  • Het "Denk"-verschil: Sommige robots die mochten "nadenken" (vertragen en stap-voor-stap redeneren) deden het veel beter dan diegenen die direct antwoorden spuwden. Zelfs de "denkers" hadden echter moeite met de moeilijkste, meerstapspuzzels.

De conclusie

Dit artikel zegt: "We hebben een nieuwe, onbedriegbare, realistische logische test gebouwd. Toen we onze beste robots erdoorheen lieten gaan, faalden ze vaker dan we verwachtten. Ze zijn goed in het gokken van patronen, maar ze zijn nog steeds vreselijk in het strikt volgen van complexe regels in een veranderende omgeving."

De test is nu open voor iedereen om te gebruiken om te zien of hun eigen robots de escape room kunnen doorstaan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →