← Nieuwste papers
🤖 AI

OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents

Het artikel introduceert OR-Space, een benchmark voor werkruimtes met een volledige levenscyclus die is ontworpen om industriële optimalisatie-agenten te evalueren op realistische, meerstaps taken die modelconstructie, revisie en onderbouwde uitleg omvatten binnen persistente, multi-artifact-omgevingen, en zo verder gaat dan traditionele beoordelingen van eenmalige probleemformuleringen.

Oorspronkelijke auteurs: Chenyu Zhou, Xinyun Lu, Jiangyue Zhao, Jianghao Lin, Dongdong Ge, Yinyu Ye

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chenyu Zhou, Xinyun Lu, Jiangyue Zhao, Jianghao Lin, Dongdong Ge, Yinyu Ye

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante nieuwe assistent inhuurt om een fabriek te helpen runnen. Je wilt zien of ze de baan daadwerkelijk kunnen uitvoeren, en niet alleen erover kunnen praten.

Lange tijd was de manier waarop we deze AI-assistenten (zogenaamde "LLM-agents") testten, als het geven van hen een perfect geschreven receptkaart. De kaart zei: "Hier is het probleem, hier zijn de ingrediënten, hier is de wiskundige formule. Schrijf nu de code om het op te lossen."

Als de AI de code correct schreef, gaf men haar een gouden ster. Maar in de echte wereld krijgen fabrieksmanagers geen perfecte receptkaarten. Ze krijgen een rommelig bureau met post-its, spreadsheets, oude code van vorig jaar en e-mails van de baas met de boodschap: "Oh, trouwens, we moeten de regels voor volgende maand aanpassen."

OR-Space is een nieuwe, veel moeilijkere test die ontworpen is om te zien of AI die rommelige, echte bureau-omgeving aankan.

De Drie Manieren waarop we de AI Testen

Het artikel introduceert een benchmark genaamd OR-Space (Operations Research Space). In plaats van één vraag, geeft het de AI een hele "werkruimte" (een digitale map met bestanden) en vraagt het haar om drie verschillende soorten taken uit te voeren die in een echte fabriek voorkomen:

  1. Bouwen (De Architect):

    • Het Scenario: Je geeft de AI een map met een zakelijk memo, een spreadsheet met cijfers en een leeg codebestand.
    • De Taak: De AI moet het memo lezen, uitzoeken wat de cijfers betekenen, en een gloednieuw computerprogramma schrijven om het probleem van de fabriek vanaf nul op te lossen.
    • De Vreemde: Het memo kan vaag zijn, en de spreadsheet kan rommelige kolommen hebben. De AI moet de punten verbinden tussen de tekst en de data zonder een perfecte leidraad.
  2. Herzien (De Reparateur):

    • Het Scenario: De fabriek is van gedachten veranderd. Misschien hebben ze nu meer vrachtwagens, of een nieuwe regel over veiligheid. De AI krijgt het oude programma en de nieuwe regels.
    • De Taak: De AI moet de oude code updaten om te passen bij de nieuwe regels, zonder de delen die al werkten, kapot te maken.
    • De Vreemde: Dit is als proberen een huis te renoveren terwijl er nog mensen in wonen. Als de AI een variabele-naam uit de oude code kopieert die niet meer logisch is, crasht het hele systeem. Het artikel vond dat sommige AI's in de war raken door de oude code en proberen de fouten ervan te kopiëren, terwijl slimmere AI's weten wat ze moeten behouden en wat ze moeten weggooien.
  3. Uitleggen (De Vertaler):

    • Het Scenario: De computer heeft het probleem opgelost, maar de fabrieksmanager (die geen wiskunde-expert is) vraagt: "Waarom heb je besloten om 5 vrachtwagens naar het noordelijke magazijn te sturen in plaats van naar het zuidelijke?"
    • De Taak: De AI moet naar de oplossing, de code en de datalogboeken kijken om een waarheidsgetrouw antwoord te geven.
    • De Vreemde: De AI kan niet zomaar een verhaal verzinnen. Ze moet verwijzen naar de specifieke regel in de spreadsheet of de specifieke regel in de code die die beslissing af dwong. Als ze gokt, verliest ze punten.

Waarom deze Test Anders is (De "Werkruimte" versus de "Prompt")

De auteurs betogen dat eerdere tests als flitskaarten waren. Je toont de AI een schoon, geïsoleerd probleem, en ze geeft een antwoord.

OR-Space is als een echt kantoor.

  • De Bestanden zijn Gescheiden: De eisen staan in een Word-document, de cijfers in een CSV-bestand en de code in een Python-bestand. De AI moet ze allemaal openen, lezen en beseffen hoe ze bij elkaar passen.
  • Het "Grounding"-Probleem: Bij een flitskaarttest kan de AI het juiste antwoord raden omdat ze de woorden herkent. In OR-Space faalt de AI als ze het woord "capaciteit" in het memo niet correct koppelt aan de kolom "max_load" in de spreadsheet. Het artikel noemt dit "grounding" – het verbinden van woorden met de feitelijke data.

Wat ze Vonden (De Resultaten)

De onderzoekers testten 20 verschillende AI-modellen (de "slimste" die beschikbaar waren) op deze nieuwe test. Dit is wat er gebeurde:

  • Het is Moeilijker dan het Lijkt: Zelfs de beste AI's hadden moeite. Hoewel sommige het "flitskaart"-versie van het probleem konden oplossen, faalden ze vaak wanneer ze de rommelige map met bestanden moesten navigeren.
  • Oude Code is een Dubbelzinnig Zwaard: Toen de AI oude code kreeg om het model te helpen herzien, werden de slimste AI's beter omdat ze de oude code gebruikten als een nuttige hint. Maar de zwakkere AI's werden slechter omdat ze blind de fouten van de oude code kopieerden (zoals het proberen te gebruiken van een variabele die niet meer bestond).
  • De "Uitleg"-Kloof: Sommige AI's waren geweldig in het schrijven van code, maar vreselijk in het uitleggen ervan. Ze konden de wiskunde oplossen, maar konden je niet vertellen waarom ze die keuze maakten op basis van de bestanden die ze hadden.
  • De "Bestandssysteem"-Boete: Het artikel vond dat wanneer AI's daadwerkelijk mappen moesten navigeren en bestanden moesten lezen (de "Filesystem"-modus), ze slechter presteerden dan wanneer dezelfde informatie gewoon in één groot tekstblok was geplakt. Dit bewijst dat het vinden en ordenen van informatie op zichzelf een vaardigheid is, en niet slechts een opmaakprobleem.

De Conclusie

Het artikel concludeert dat we AI niet alleen kunnen testen op hoe goed ze code schrijft vanuit een perfecte prompt. Om nuttig te zijn in echte industrieën (zoals logistiek, productie of financiën), moet AI getest worden op haar vermogen om:

  1. De juiste informatie te vinden in een rommelige stapel documenten.
  2. Oude systemen bij te werken zonder ze kapot te maken.
  3. Haar beslissingen te verklaren met bewijs uit de feitelijke bestanden, en niet alleen verzonden verhalen.

OR-Space is de nieuwe "rijtest" voor deze AI-agents, die hen verplaatst van de parkeerplaats (perfecte prompts) naar de drukke stadsstraten (echte werkruimtes).

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →