← Nieuwste papers
🤖 AI

SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning

SheetCompass is een op grafen gestuurd, geheugengestuurd agentisch framework dat de beperkingen van bestaande LLM-gebaseerde spreadsheet-redenering aanpakt door hiërarchische structurele relaties en ruimtelijke contexten binnen en tussen werkbladen expliciet te modelleren om een effectievere automatisering van complexe werkboeken mogelijk te maken.

Oorspronkelijke auteurs: Panjing He, Mingyue Cheng, Yucong Luo, Li Li, Xiaohan Zhang

Gepubliceerd 2026-08-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Panjing He, Mingyue Cheng, Yucong Luo, Li Li, Xiaohan Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Raadsel van het Digitale Spreadsheet

Stel je voor dat je een superintelligente robot probeert te leren hoe hij een rommelig, meerpaginaal spreadsheet moet lezen. In de wereld van Kunstmatige Intelligentie is dit een beetje alsof je een detective vraagt een misdaad op te lossen door een lijst met woorden te lezen die uit een boek zijn gescheurd en in één enkele regel zijn gehusseld. Spreadsheets zijn bijzonder omdat ze niet alleen lijsten met gegevens zijn; het zijn visuele kaarten. Ze hebben rijen, kolommen en verborgen connecties tussen verschillende pagina's die een verhaal vertellen over geld, verkopen of voorraad. Voor een mens is het bekijken van een spreadsheet als het scannen van een stadsplattegrond: je ziet direct hoe de "Verkoop"-straat verbonden is met de "Prijs"-laan. Maar voor een Large Language Model (LLM) — het soort AI dat gedichten schrijft en vragen beantwoordt — zijn spreadsheets vaak een nachtmerrie. Wanneer we deze modellen een spreadsheet voeden, platten we het meestal af tot een lange tekstreeks, alsof we een 3D-gebouw veranderen in een plat stuk papier. Daarbij verliezen we de "waar" en de "hoe" van de gegevens. De robot vergeet dat een getal linksboven bij een categorie rechtsonder hoort, of dat twee verschillende tabbladen eigenlijk met elkaar communiceren. Dit artikel, getiteld SheetCompass, stelt een eenvoudige maar cruciale vraag: Hoe leren we een AI om weer de kaart te zien, in plaats van alleen de lijst met woorden te lezen?

Het Verhaal van het Papier: Een Kompas Bouwen voor de AI

De auteurs van dit artikel, werkzaam aan de University of Science and Technology of China, realiseerden zich dat het probleem niet was dat de AI niet slim genoeg was; het probleem was dat de AI het spreadsheet op de verkeerde manier bekeek. Zij stellen dat het behandelen van een spreadsheet als een simpel tekstdocument de structuur wegneemt die het juist nuttig maakt. Om dit op te lossën, bouwden zij een nieuw systeem genaamd SheetCompass. Zie SheetCompass niet als een robot die alleen maar leest, maar als een team van drie deskundige ontdekkingsreizigers die samenwerken met een op maat gemaakte kaart.

Ten eerste moest het team het "platte tekst"-probleem oplossen. In plaats van de AI een lange, verwarrende paragraaf te voeren, verandert SheetCompass het spreadsheet in een hiërarchische graaf. Stel je een spreadsheet voor als een rommelige kamer vol meubels. Traditionele methoden proberen de kamer te beschrijven door elk object in één enkele zin op te sommen: "stoel, tafel, lamp, stoel, tafel..." SheetCompass bouwt echter een 3D-model van de kamer. Het creëert een "Tabel-node" voor de hele tabel en "Kolom-nodes" voor de koppen, en trekt vervolgens lijnen die hen verbinden. Het tekent zelfs speciale "semantische lijnen" tussen kolommen die er verschillend uitzien maar hetzelfde betekenen (zoals "Prijs" op het ene blad en "Kosten" op het andere), zelfs als ze ver uit elkaar liggen. Dit creëert een stabiel, gestructureerd skelet waar de AI doorheen kan navigeren zonder de weg kwijt te raken.

Maar een kaart hebben is niet genoeg; de ontdekkingsreizigers moeten ook weten hoe ze deze moeten gebruiken. SheetCompass introduceert een geheugen op twee niveaus. Eén deel van het geheugen is als een bibliotheek van deskundige regels (Expert Knowledge), die de AI dingen leert zoals "verwijder geen rijen, maar verberg ze alleen" of "hoe bereken je een draaitabel." Het andere deel is een dagboek van eerdere fouten (Reasoning Experience), waarin het systeem onthoudt wat er in eerdere pogingen misging, zodat het dezelfde fout niet herhaalt. Dit is als een student die niet alleen een tekstboek heeft, maar ook een schrift bijhoudt met eigen correcties van toetsen.

Tot slot brengt het systeem een multi-agent team in actie. In plaats van één AI die alles probeert te doen, verdeelt SheetCompass de taak in drie rollen:

  1. De Navigator (Explorer): Deze agent bekijkt de grafiekkaart, vindt de juiste kolommen en tabellen, en bepaalt de volgorde van de stappen die nodig zijn om het probleem op te lossen.
  2. De Bouwer (Programmer): Deze agent neemt het plan en schrijft de daadwerkelijke code om de berekeningen uit te voeren of de grafieken te maken, waarbij hij strikt op de kaart blijft om te voorkomen dat hij fictieve gegevens verzint.
  3. De Inspecteur (Reflector): Dit is de veiligheidsbewaker. Nadat de code is uitgevoerd, controleert de Inspecteur de resultaten aan de hand van een checklist. Als de wiskunde vreemd lijkt (zoals het aftrekken van een minuscuul decimaal van een enorme prijs), stopt de Inspecteur het proces, zegt: "Wacht, dit klopt niet," en stuurt het team terug om het te herstellen.

Wat Ze Vonden

De onderzoekers testten SheetCompass op verschillende moeilijke datasets die complexe spreadsheets bevatten met meerdere tabellen en lastige instructies. Ze vergeleken hun nieuwe systeem met andere populaire AI-methoden, inclusief methoden die simpelweg in één keer code schrijven of eenvoudigere agent-loops gebruiken. De resultaten waren duidelijk: Sheetcompass was aanzienlijk beter in het voor het eerst goed uitvoeren van de taak.

In hun tests, bij het gebruik van een krachtig AI-model (GPT-4), behaalde SheetCompass een succespercentage van 63,2% op een belangrijke benchmark (SCB), waarmee het de op één na beste methode versloeg die slechts 61,1% haalde. Op een andere moeilijke test (SB) die vereiste dat de AI elke enkele controle in een reeks proeven doorstond, verbeterde SheetCompass het succespercentage naar 18,3%, een grote sprong ten opzichte van de vorige beste score van 13,5%. Wanneer ze een nog geavanceerder model gebruikten (GPT-5), werd het gat groter, waarbij SheetCompass 71,3% bereikte op de SCB-benchmark en 22,0% op de moeilijke SB-benchmark.

Het papier voerde ook "ablatie-studies" uit, die vergelijkbaar zijn met het uit elkaar halen van een machine om te zien welk onderdeel het belangrijkst is. Ze ontdekten dat als ze de grafiekkaart zouden verwijderen, de prestaties van het systeem drastisch zouden dalen, wat bewees dat de kaart het meest cruciale onderdeel is. Ze ontdekten ook dat de Inspecteur (Reflector) essentieel was; zonder deze maakte het systeem meer fouten omdat het zijn eigen fouten niet kon detecteren.

Waarom Het Er Toe Doet

De auteurs suggereren dat de sleutel tot het goed laten werken van AI met spreadsheets niet alleen het slimmer maken van de AI is, maar het geven van een betere manier om de gegevens te zien. Door platte tekst om te zetten in een gestructureerde graaf en een team van gespecialiseerde agents in te zetten om elkaars werk te controleren, overbrugt SheetCompass de kloof tussen hoe mensen van nature tabellen lezen en hoe computers informatie verwerken. Het artikel beweert niet dat het alle spreadsheetproblemen ter wereld heeft opgelost, maar het laat zien dat deze nieuwe benadering van "structurele perceptie" gecombineerd met "collaboratieve redenering" een krachtige weg vooruit is. Het suggereert dat voor AI om de rommelige, real-world tools die we dagelijks gebruiken echt te beheersen, het moet stoppen met het lezen van lijsten en moet beginnen met het lezen van kaarten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →