← Nieuwste papers
💻 computer science

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

Dit artikel introduceert ClawMark, een nieuwe benchmark die is ontworpen om multi-turn, multi-day en multimodale coworker-agents te evalueren in een dynamische, stateful omgeving, waarbij wordt aangetoond dat hoewel frontier-modellen gedeeltelijke vooruitgang tonen, ze aanzienlijk moeite hebben om zich aan te passen aan exogene veranderingen en volledige end-to-end taaksucces te behalen.

Oorspronkelijke auteurs: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xi
Gepubliceerd 2026-04-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe assistent inhuurt om je kantoor te runnen. De meeste tests voor AI-assistenten vandaag zijn als een korte toets: ze geven de AI één vraag, het antwoordt, en de test is voorbij. De wereld is tijdens die toets in de tijd bevroren.

Maar in het echte leven antwoordt een assistent niet alleen één vraag en vertrekt dan. Ze blijven dagen bij je. Terwijl ze werken, verandert de wereld om hen heen. Nieuwe e-mails komen binnen, je agenda verschuift, bestanden worden bijgewerkt en nieuwe bewijsstukken (zoals foto's of spraaknotities) duiken op. Als je assistent deze veranderingen niet opmerkt, kan het zijn dat het beslissingen neemt op basis van oude informatie, wat leidt tot fouten.

ClawMark is een nieuwe "proefrit" die specifiek is ontworpen om te zien of AI-assistenten dit rommelige, veranderende realiteit aankunnen.

De "Levendig Kantoor"-test

In plaats van een bevroren toets, is ClawMark als een geanimeerd kantoor dat ademt.

  • De Opzet: De AI krijgt een baan (zoals het afhandelen van een verzekeringsclaim of het beheren van een project) die verscheidene "werkdagen" beslaat.
  • De Twist: Tussen elke dag verandert de omgeving vanzelf. Misschien komt er een nieuwe e-mail binnen, wordt een spreadsheet bijgewerkt, of wordt een stil bestand in de map gedropt zonder dat iemand de AI erover vertelt.
  • Het Bewijs: De AI leest niet alleen tekst. Het moet naar ruwe foto's kijken, naar audio-opnames luisteren, gescande PDF's lezen en video analyseren, net als een mens dat zou doen.

Hoe ze de AI beoordelen

Bij veel AI-tests leest een mens of een andere AI het antwoord en zegt: "Dat klinkt goed." ClawMark doet iets strekers: het gebruikt een robotrechter.

  • Er zijn hier geen "meningen". De test maakt gebruik van 1.537 kleine, automatische Python-scripts (controlemechanismen) die kijken naar de daadwerkelijke staat van de computer nadat de AI klaar is.
  • Heeft de AI het bestand daadwerkelijk opgeslagen? Heeft het de agenda bijgewerkt? Heeft het het verborgen foto ontdekt?
  • Als de AI zegt "Ik heb het gedaan" maar het bestand is er niet, geeft de robotrechter een nul. Het is als een wiskundetoets waarbij je alleen punten krijgt als het antwoord in het juiste vakje staat geschreven, en niet alleen als je het juiste getal hardop hebt gezegd.

De Resultaten: Goed in Begin, Slecht in Aanpassing

De onderzoekers testten zeven top-tier AI-modellen (zoals de hersenen achter grote chatbots) in dit "levendige kantoor". Dit is wat ze vonden:

  1. De "Perfecte Score" is Zeldzaam: Zelfs de beste AI behaalde slechts op 20% van de taken een "perfecte" succesvolheid van begin tot eind. Dit betekent dat hoewel ze vaak eenige vooruitgang boekten, ze zelden de hele klus zonder één enkele fout afrondden.
  2. De "Dag 2 Daling": Dit is de meest interessante bevinding. Op de eerste dag deden de AI's het best wel goed. Maar op de tweede dag, toen de omgeving veranderde (nieuwe e-mails, nieuwe bestanden), presteerden zes van de zeven modellen aanzienlijk slechter.
    • Analogie: Stel je voor dat je een videospelletje speelt. Je verslaat Niveau 1 makkelijk. Maar wanneer het spel plotseling de regels verandert en nieuwe vijanden toevoegt in Niveau 2, vergeet de AI hoe het moet spelen en begint het te struikelen. Het heeft moeite om "wakker te worden" en te beseffen dat de wereld is veranderd.
  3. Stille Veranderingen zijn het Kryptoniet: De AI faalde het vaakst wanneer het een "stille mutatie" miste – een verandering die plaatsvond zonder een luid aankondiging (zoals een bestand dat rustig op de achtergrond wordt bijgewerkt). Ze hadden ook moeite om hun werk daadwerkelijk op de juiste plek op te slaan (backend writeback).

Het Oordeel

ClawMark toont aan dat hoewel AI-assistenten slimmer worden in het oplossen van individuele problemen, ze nog steeds leren hoe ze standvastige collega's moeten zijn. Ze zijn goed in de "eerste dag", maar verliezen vaak hun evenwicht wanneer de kantooromgeving om hen heen verschuift.

Het paper concludeert dat we, om een echt betrouwbare AI-collega te bouwen, minder moeten focussen op hoe goed het een enkele vraag beantwoordt en meer op hoe goed het zich aanpast aan een veranderende wereld en vergeet niet zijn hulpmiddelen bij te werken wanneer de wereld verandert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →