← Nieuwste papers
💬 NLP

TabularMath: Understanding Math Reasoning over Tables with Large Language Models

Deze paper introduceert AutoT2T, een neuro-symbolisch framework dat wiskundige woordproblemen omzet in schaalbare tabellatare redeneertaken, en presenteert TabularMath, een uitgebreide benchmark die de uitdagingen van wiskundig redeneren over tabellen met verschillende complexiteit, kwaliteit en modaliteiten in kaart brengt.

Oorspronkelijke auteurs: Shi-Yu Tian, Zhi Zhou, Wei Dong, Kun-Yang Yu, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

Gepubliceerd 2026-04-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shi-Yu Tian, Zhi Zhou, Wei Dong, Kun-Yang Yu, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Rekenmachine die Verwarring Ziet: Een Nieuwe Test voor Slimme Computers

Stel je voor dat je een zeer slimme, maar soms wat naïeve robot hebt die je kunt vragen: "Hoeveel geld heb ik verdiend?"

Tot nu toe hebben we deze robots getest met simpele tekstvragen, zoals: "Jan verdient €10 per uur en werkt 5 uur. Hoeveel verdient hij?" De robots waren hier heel goed in. Maar in het echte leven werkt het niet zo simpel. In de echte wereld krijgen we geen nette zinnen, maar tabellen. Denk aan een Excel-spreadsheet met honderden rijen, of een financiële rapportage in krant. En vaak zijn die tabellen niet perfect: soms ontbreekt een cijfer, soms klopt de som niet, en soms zit er een valstrik in.

De auteurs van dit paper (van de Universiteit van Nanjing) zeggen: "Onze robots zijn goed in tekst, maar ze strompelen als ze met tabellen moeten rekenen, vooral als die tabellen imperfect zijn."

Om dit te bewijzen en te verbeteren, hebben ze drie dingen gedaan:

1. De "Magische Vertaal-machine" (AUTOT2T)

Stel je voor dat je een machine hebt die een simpel verhaal (een wiskundetaak) kan omtoveren in een ingewikkelde, chaotische tabel.

  • Hoe werkt het? Ze hebben een systeem gebouwd (genaamd AUTOT2T) dat automatisch wiskundige problemen omzet in tabellen.
  • De truc: Ze kunnen deze tabellen "vervuilen". Ze kunnen rijen toevoegen die niets te maken hebben met de vraag, kolommen verwarren, of zelfs cijfers veranderen zodat de som niet meer klopt.
  • Waarom? Hierdoor hoeven ze niet duizenden mensen te vragen om handmatig tabellen te maken. De computer doet het in een flits, en kan oneindig veel variaties maken. Het is alsof je een bakje blokken hebt en die automatisch in duizend verschillende, soms onmogelijke, torens kunt bouwen om te zien of de robot ze kan oplossen.

2. De Nieuwe Test: "TabularMath"

Met die machine hebben ze een nieuwe test gemaakt, genaamd TabularMath. Deze test bestaat uit vier levels, net als een videospel:

  • Level 1 (Eenvoudig): Een nette, kleine tabel.
  • Level 2 (Moeilijk): Een grotere tabel met meer rijen en kolommen.
  • Level 3 (Zeer Moeilijk): Een enorme tabel waar je echt moet zoeken naar het juiste cijfer tussen veel ruis.
  • Level 4 (De Valstrik): Hier is de tabel gebrekkig. Misschien ontbreekt een cruciaal getal (zoals de prijs van een product), of staan er twee cijfers die tegenstrijdig zijn (bijvoorbeeld: "Totaal: 100" maar "Som van delen: 120").

De vraag aan de robots is niet alleen: "Kun je het antwoord vinden?", maar ook: "Kun je zien dat de vraag onmogelijk is te beantwoorden?"

3. Wat hebben ze ontdekt? (De Grote Drie)

Na het testen van 18 verschillende slimme modellen (zoals GPT-4, Qwen, en andere AI's) kwamen ze tot drie belangrijke ontdekkingen:

  • Ontdekking 1: De "Zoek-en-Reken" valkuil.
    Het is voor robots veel moeilijker om in een grote tabel te zoeken en dan te rekenen, dan om alleen te zoeken.

    • Vergelijking: Het is alsof je iemand vraagt: "Zoek de rode bal in deze kamer." Dat is makkelijk. Maar als je vraagt: "Zoek de rode bal, tel hoeveel blauwe ballen erbij liggen, en vermenigvuldig dat met 3," dan raken de robots in de war. Hoe groter de tabel, hoe meer ze vastlopen.
  • Ontdekking 2: Slechte data = Slechte antwoorden.
    Als de tabel fouten bevat (ontbrekende cijfers of tegenstrijdigheden), proberen de robots vaak toch een antwoord te geven. Ze "hallucineren" een oplossing.

    • Vergelijking: Stel je voor dat je een kok vraagt om een taart te bakken, maar je hebt geen eieren. Een slimme kok zou zeggen: "Ik kan dit niet doen, er ontbreken ingrediënten." Maar deze robots zeggen: "Hier is je taart!" en maken er een modderklomp van. Ze durven niet toe te geven dat de vraag fout is. Dit is gevaarlijk in de echte wereld (bijvoorbeeld bij financiële beslissingen).
  • Ontdekking 3: Tekst is makkelijker dan plaatjes.
    Zelfs voor robots die goed zijn in het zien van plaatjes (multimodale modellen), is het rekenen met een tabel als tekst (letters en getallen) makkelijker dan met een afbeelding van een tabel.

    • Vergelijking: Het is makkelijker om een recept te lezen in een boek dan om een foto van een handgeschreven recept te ontcijferen waar de inkt wat vervaagd is. De tekstversie is voor de computer "schoner" en duidelijker.

Conclusie: Waarom is dit belangrijk?

Dit onderzoek laat zien dat we AI niet zomaar kunnen vertrouwen op complexe, real-world data. Als we AI willen gebruiken voor zaken zoals belastingaangifte, medische dossiers of beursanalyses, moeten we eerst zorgen dat ze leren:

  1. Om goed te zoeken in grote hoeveelheden data.
  2. Om te zeggen: "Hé, hier ontbreekt iets, ik kan dit niet oplossen" in plaats van een fout antwoord te geven.

De auteurs hebben nu een gereedschap (AUTOT2T) en een testbaan (TabularMath) gemaakt om deze robots in de toekomst beter te trainen, zodat ze niet meer zo snel in de valstrikken lopen. Het is een eerste stap naar AI die niet alleen slim is, maar ook verantwoordelijk en veilig werkt met data.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →