← Nieuwste papers
💻 computer science

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

Het artikel introduceert SOP-Maze, een nieuwe benchmark afgeleid van echte zakelijke gegevens die grote taalmodellen evalueert op complexe standaardprocedures door taken te categoriseren in laterale en diepe redeneeruitdagingen, wat significante problemen met routeblindheid, conversationele fragiliteit en rekenfouten blootlegt bij state-of-the-art modellen.

Oorspronkelijke auteurs: Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

Gepubliceerd 2026-01-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde robot leert hoe hij een specifieke taak moet uitvoeren, zoals het werken als een klantenservicemedewerker of een verkoper. Je geeft de robot een dik regelboek genaamd een Standard Operating Procedure (SOP). Dit is niet zomaar een eenvoudige lijst van "doe dit, en doe dan dat", maar een complex doolhof met honderden "als-dan"-vertakkingen, zoals een kies-je-eigen-avontuur-boek waarbij één verkeerde afslag leidt tot een doodlopende weg.

Het papier "SOP-Maze" introduceert een nieuwe manier om te testen of deze AI-robots daadwerkelijk door deze echte zakelijke regelboeken kunnen navigeren zonder de weg kwijt te raken.

Hier is een eenvoudige uitsplitsing van wat de onderzoekers hebben gedaan en wat ze hebben gevonden:

1. De Nieuwe Test: SOP-Maze

De onderzoekers bouwden een "sportschool" voor AI-modellen genaamd SOP-Maze.

  • De Bron: In plaats van verzonnen regels te maken, namen ze 300.000 echte records uit de interne bedrijfslogs van een bedrijf. Ze hebben deze opgeschoond om 397 real-world scenario's te creëren (zoals een verkoopgesprek of een klantklacht) die bestaan uit 3.422 kleine stappen.
  • Het Doel: Om te zien of een AI een lang, ingewikkeld regelboek kan lezen, naar een luidruchtig menselijk gesprek kan luisteren en precies het pad kan volgen dat vereist is om het juiste antwoord te krijgen.

2. De Twee Soorten Doolhoven

De onderzoekers realiseerden zich dat zakelijke regels in twee smaken voorkomen, dus deelden ze de test op in twee categorieën (met een plantenmetafoor):

  • Lateral Root System (LRS) – Het "Brede" Doolhof:
    • De Metafoor: Stel je een boom voor met een ondiepe stam maar honderden takken die breed uitwaaieren.
    • De Uitdaging: De AI moet de ene juiste tak kiezen uit vele mogelijkheden. Het is alsof je bij een kruispunt staat met 10 verschillende borden en direct de juiste moet kiezen. Als je de verkeerde kiest, zit je vast.
  • Heart Root System (HRS) – Het "Diepe" Doelhof:
    • De Metafoor: Stel je een boom voor met een zeer diep, kronkelend wortelstelsel dat ver onder de grond gaat.
    • De Uitdaging: De AI moet een lange, complexe keten van logica volgen. Stap A moet gebeuren vóór Stap B, wat weer moet gebeuren vóór Stap C. Als de AI een stap van 10 minuten geleden in het gesprek vergeet, breekt de hele keten.

3. De Resultaten: De Robots raken de weg kwijt

De onderzoekers testten 18 van de slimste beschikbare AI-modellen (inclusief topmodellen van OpenAI, Anthropic en anderen). De resultaten waren verrassend: Bijna alle modellen hadden moeite.

Zelfs de "slimste" modellen konden de zakelijke regels niet betrouwbaar volgen. De onderzoekers ontdekten drie hoofdoorzaken waarom de robots faalden:

A. Routeblindheid (De weg kwijt in de kaart)

  • Het Probleem: De AI ziet de kaart, maar kan het pad niet volgen.
  • In het Brede Doolhof: De AI wordt overweldigd door te veel keuzes en kiest te vroeg een verkeerde tak, waarna hij weigert zichzelf te corrigeren.
  • In het Diepe Doolhof: De AI wordt ongeduldig en "haast zich vooruit". Hij neemt aan dat hij een stap al heeft uitgevoerd die hij eigenlijk nog niet heeft gedaan, wat leidt tot een verkeerde conclusie.

B. Conversationele Fragiliteit (Niet in staat tot menselijk geklets)

  • Het Probleem: De AI is te letterlijk en kan de rommeligheid van echt menselijk taalgebruik niet aan.
  • De Nuance: Mensen veranderen van gedachten, gebruiken sarcasme of onderbreken zichzelf.
    • Voorbeeld: Een gebruiker kan boos beginnen ("Ik ga een klacht indienen!") maar dan kalmer worden ("Laat maar, ik laat het erbij zitten"). De AI negeert de verandering vaak en blijft boos reageren.
    • Voorbeeld: Een gebruiker zegt, "Haha, ja, hoor," sarcastisch. De AI neemt dit op als een oprechte "Ja" en onderneemt de volgende actie op basis van een verkeerde aanname.

C. Rekenfouten (Slecht in contextuele wiskunde)

  • Het Probleen: De AI is slecht in het doen van eenvoudige berekeningen of tijdcalculaties wanneer deze begraven liggen in een lang gesprek.
  • De Nuance: Als je vraagt: "Hoeveel minuten zijn er verstreken tussen 13:00 uur en 13:05 uur?", krijgt de AI het goed. Maar als die vraag verborgen zit in een gesprek van 20 beurten over een vertraging in de levering, vergeet de AI vaak naar de tijdstempels te kijken of rekent de tijd verkeerd uit.

4. De Conclusie

Het papier concludeert dat hoewel AI-modellen geweldig zijn in het schrijven van gedichten of het beantwoorden van algemene vragen, ze momenteel niet betrouwbaar genoeg zijn om te fungeren als professionele agenten in complexe zakelijke omgevingen. Ze missen het "spiergeheugen" om strikte, meerstaps-procedures te volgen zonder afgeleid te worden door de eigenaardigheden van menselijke gesprekken of het maken van eenvoudige logische fouten.

De auteurs hebben hun testdata en code (SOP-Maze) openbaar gemaakt, zodat andere onderzoekers SOP-Maze kunnen gebruiken om betere, meer betrouwbare AI te bouwen die ook daadwerkelijk de regels van de echte wereld kan volgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →