← Nieuwste papers
💻 computer science

Spreadsheet Modeling Experiments Using GPTs on Small Problem Statements and the Wall Task

Dit artikel evalueert de mogelijkheden van op GPT gebaseerde hulpmiddelen, met name Excel AI, bij het genereren van herbruikbare spreadsheetmodellen en komt tot de bevinding dat, hoewel ze goed gestructureerde concepten kunnen produceren, hun inconsistentie, gebrek aan reproduceerbaarheid en de daaruit voortvloeiende noodzaak tot verificatie door bekwame gebruikers momenteel hun betrouwbaarheid voor professioneel gebruik beperken.

Oorspronkelijke auteurs: Thomas A. Grossman, Yuan Chen, Sopiko Datuashvili

Gepubliceerd 2026-04-29
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Thomas A. Grossman, Yuan Chen, Sopiko Datuashvili

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer slimme, maar soms verstrooide, robotassistent te leren hoe je een spreadsheet moet bouwen. Je geeft het een eenvoudige beschrijving van een wiskundig probleem en je hoopt dat het je een perfect georganiseerd Excel-bestand teruggeeft dat je voor altijd kunt gebruiken.

Dit artikel is een rapportcijfer over hoe goed die robotassistent het er daadwerkelijk op heeft staan. De onderzoekers, Thomas Grossman en zijn team, hebben vijf verschillende "AI-helpers" op de proef gesteld om te zien welke het beste een herbruikbaar spreadsheetmodel kon bouwen. Ze kozen de winnaar, een tool genaamd Excel AI, en onderwierpen deze vervolgens aan een reeks stress-tests.

Hier is de uiteenzetting van hun bevindingen, met behulp van alledaagse analogieën:

1. Het Doel: Een "Lego-set" Bouwen, Geen "Zandkasteel"

De onderzoekers wilden dat de AI een spreadsheet zou bouwen die herbruikbaar is.

  • De Slechte Manier (Zandkasteel): Stel je voor dat de AI de cijfers direct in de cellen schrijft (zoals "10" en "12"). Als je later de kamergrootte wilt wijzigen, moet je alles wissen en opnieuw schrijven. Dit is als het bouwen van een zandkasteel; het ziet er even goed uit, maar je kunt het niet gemakkelijk herbouwen.
  • De Goede Manier (Lego-set): De onderzoekers wilden dat de AI de cijfers in speciale "invoer"-vakken plaatst en formules (zoals =A1*B1) gebruikt voor de rest. Dit is als een Lego-set. Je kunt de bakstenen (de invoercijfers) verwisselen, en de hele structuur werkt automatisch bij. Dit noemen ze ERFR (Essential Requirements for Reusability).

2. De Screening: De Beste Assistent Vinden

Het team probeerde vijf verschillende AI-tools uit. Het was alsof je vijf verschillende aannemers inhuurt om een schuur te bouwen.

  • Sommige aannemers gaven gebrekkige blauwdrukken terug.
  • Sommigen gaven hen een foto van een schuur in plaats van de schuur zelf.
  • Een aannemer, Excel AI, was het meest consistent. Het leverde meestal een schoon, downloadbaar bestand met de juiste structuur op. Daarom besloten de onderzoekers al hun toekomstige testen op deze ene te richten.

3. De Experimenten: Hoe de Robot Verschillende Taken Aanging

De onderzoekers gaven Excel AI acht verschillende eenvoudige wiskundige problemen om op te lossen, zoals "Bereken de oppervlakte van een kamer" of "Bereken de kosten van appels over een maand". Ze testten drie specifieke dingen:

  • De "Recept"-test (Gegevens versus Variabelen):

    • Scenario A: "Hier zijn de cijfers: 10 en 12."
    • Scenario B: "Hier zijn de namen van de cijfers: Lengte en Breedte."
    • Resultaat: De robot hanteerde beide perfect. Het wist lege vakken achter te laten voor de gebruiker om later in te vullen als er geen cijfers waren gegeven.
  • De "Kalender"-test (30 Dagen versus Een Maand):

    • Scenario A: "Doe dit voor 30 dagen."
    • Scenario B: "Doe dit voor een maand."
    • Resultaat: Hier struikelde de robot. Als er werd gezegd "30 dagen", bouwde het een perfecte lijst van 30 rijen. Maar als er werd gezegd "een maand", raakte het in de war. Soms bouwde het een lijst voor de huidige maand (die 31 dagen of minder heeft), en soms zette het echte cijfers in de cellen in plaats van formules. Het was als een kok die een recept voor "30 minuten" perfect kan volgen, maar in de war raakt als je zegt "een uur" en begint te gokken.
  • De "Onzinwoord"-test:

    • Ze gebruikten een verzonnen woord (zoals "Zorp") in plaats van een echt object (zoals "Appel").
    • Resultaat: De robot gaf er niets om. Het behandelde "Zorp" precies hetzelfde als "Appel". Dit was een succes.

4. Het Grote Probleem: Het "Magische 8-Bal"-Effect

Het grootste probleem dat de onderzoekers vonden, is reproduceerbaarheid.

  • Als je de robot exact dezelfde vraag twee keer stelt, kun je twee verschillende antwoorden krijgen.
  • Analogie: Stel je voor dat je een menselijke assistent vraagt: "Maak me een sandwich." De eerste keer geven ze je een perfecte kalkoensandwich. De tweede keer vraag je exact hetzelfde, en ze geven je een pindakaas-sandwich zonder korstjes.
  • Bij de "Muur-taak" (een iets complexer probleem over het bouwen van een muur) bouwde de robot soms een perfect, professioneel model. Op andere momenten bouwde het een gebroken model met ontbrekende formules dat Excel liet crashen. Je wist nooit welke versie je zou krijgen.

5. De "Zekerheid"- en "Werkstroom"-problemen

Het artikel sluit af met twee grote hoofdpijndossiers voor iedereen die deze technologie probeert te gebruiken:

  • Het Probleem van Zekerheid:
    Als een robot je een spreadsheet geeft, hoe weet je dan dat het goed is?

    • Analogie: Als een student je een wiskundetoets geeft, kun je de antwoorden controleren. Maar als de student een robot is die mogelijk hallucineert, moet je zelf een expert-wiskundige zijn om zijn werk te verifiëren. Je kunt er niet zomaar op vertrouwen. Het artikel zegt dat je een bekwame mens nodig hebt om het werk van de robot te controleren, wat het doel van het gebruik van de robot om tijd te besparen, tenietdoet.
  • Het Probleem van Werkstroom:
    Sommige mensen beweren: "Misschien moet de robot ons gewoon een 'conceptversie' geven die we kunnen repareren."

    • Analogie: Het is alsof je een robot vraagt om een eerste concept van een roman te schrijven. Als het concept vol met plotgaten en typefouten zit, is het dan sneller om het te repareren of om het boek vanaf nul te schrijven? De onderzoekers ontdekten dat voor complexe spreadsheets het repareren van het rommelige concept van de robot vaak net zoveel tijd kost (of meer) dan het zelf doen.

Het Eindoordeel

De conclusie van het artikel is voorzicht.

  • Het Goede: De AI kan soms prachtige, professioneel ogende spreadsheets bouwen uit eenvoudige instructies.
  • Het Slechte: Het is inconsistent, onbetrouwbaar en vaak onvoorspelbaar.
  • De Realiteit: Op dit moment zijn deze tools niet klaar voor de prime time. Ze zijn niet betrouwbaar genoeg voor professioneel gebruik waar fouten geld kunnen kosten. Ze worden het beste gezien als een "concept-assistent" die een bekwame mens vereist om het werk te superviseren, te verifiëren en te repareren.

Kortom: De robot is een getalenteerde leerling die soms een meesterwerk bouwt en soms een huis van kaarten. Totdat het leert consistent te zijn, heb je nog steeds een meesterbouwer (een mens) nodig die het klembord vasthoudt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →