← Nieuwste papers
💬 NLP

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

Deze paper introduceert Toolathlon, een nieuw benchmark voor taalagenten dat realistische, langdurige taken over 32 diverse applicaties en 604 tools evalueert en hiermee de aanzienlijke beperkingen van huidige state-of-the-art modellen in complexe, echte werkomgevingen blootlegt.

Oorspronkelijke auteurs: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xin
Gepubliceerd 2026-02-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-assistent hebt die niet alleen kan lezen en schrijven, maar ook echt werk kan doen: e-mails beantwoorden, spreadsheets bijwerken, databases controleren en zelfs code schrijven. Dit noemen we een "taal-agent".

Het probleem? De tests die we tot nu toe hebben gebruikt om deze assistenten te beoordelen, waren vaak net als een zwembad voor beginners: ze waren te simpel, te schoon en hadden geen echte golven. Ze konden niet laten zien of een assistent echt klaar was voor de ruwe zee van de echte wereld.

De auteurs van dit paper hebben daarom TOOLATHLON bedacht. Laten we uitleggen wat dat is, met een paar leuke vergelijkingen.

1. De Naam: "Tool Decathlon"

In de sport is een decathlon een wedstrijd met tien verschillende onderdelen (hardlopen, hoogspringen, discuswerpen, etc.). Je moet goed zijn in alles, niet alleen in één ding.

TOOLATHLON is precies zo voor kunstmatige intelligentie. In plaats van één simpele taak, moeten de AI's een reeks van 108 verschillende, moeilijke taken uitvoeren.

  • De "Sporters": De AI-modellen (zoals Claude, GPT-5, DeepSeek).
  • De "Onderdelen": Taken die gaan van "organiseer mijn schoolwerk" tot "beheer een bedrijfsdatabase".
  • De "Hulpmiddelen": De AI's mogen gebruikmaken van 604 verschillende tools (zoals Google Calendar, Notion, een database genaamd Snowflake, of een e-mailserver).

2. De Grote Verschillen: Waarom is dit anders?

A. De "Lege Kamer" vs. De "Volle Zolder"

  • Oude tests: Stel je voor dat je een assistent vraagt om een kamer te schoonmaken, maar de kamer is leeg. Dat is makkelijk!
  • TOOLATHLON: Hier krijg je een assistent die een volle zolder moet opruimen. Er liggen duizenden oude dozen, er zijn mappen met foutieve bestanden, en er staan dozen vol met spullen die je misschien nodig hebt, maar ook veel rommel.
    • Voorbeeld: Een AI moet e-mails checken voor huiswerk. In de echte wereld zitten er honderden e-mails in, niet alleen de één die je nodig hebt. De AI moet zelf weten welke hij moet pakken en welke hij moet negeren.

B. De "Receptboek" vs. De "Vage Vraag"

  • Oude tests: De instructie was vaak als een recept: "Stap 1: Haal bloem. Stap 2: Voeg eieren toe." De AI hoefde niet na te denken.
  • TOOLATHLON: De instructie is als een vage vraag van een klant: "Ik wil een weekendavontuur plannen, maar ik weet niet precies hoe."
    • De AI moet zelf raden wat je bedoelt, kijken naar wat er al beschikbaar is (bijvoorbeeld een database met activiteiten), en zelf een plan maken. Het is alsof je iemand vraagt om een diner te koken zonder recept, alleen met de ingrediënten die in de koelkast liggen.

C. De "Zandkast" vs. De "Echte Wereld"

  • Oude tests: De AI oefende in een zandkast (een nep-omgeving). Als de AI een fout maakte, was het alsof hij in een droom was gevallen.
  • TOOLATHLON: De AI werkt in de echte wereld (of zeer realistische simulaties). Als de AI een knop indrukt in een echte database, verandert er echt iets. Als hij een e-mail verstuurt, is die weg. Er zijn geen "ongedaan maken"-knoppen.

3. De Resultaten: De "Grote Teleurstelling"

De auteurs hebben de beste AI's ter wereld (zoals Claude 4.5 en GPT-5) de wedstrijd laten doen. Het resultaat? Ze vielen flink door de mand.

  • De winnaar (Claude-4.5-Sonnet): Haalde maar 38,6% succes. Dat betekent dat hij bij bijna 2 van de 3 taken faalde.
  • De open-source kampioen (DeepSeek): Haalde maar 20,1%.

Waarom faalden ze?

  1. Ze werden moe: De taken waren lang. Soms moest de AI 20 keer "klikken" en "denken" voordat hij klaar was. Na een tijdje raakten ze de draad kwijt of gaven ze te vroeg op.
  2. Ze maakten fouten met de tools: Ze probeerden soms een knop in te drukken die er niet was, of ze gebruikten de verkeerde sleutel om een deur te openen.
  3. Ze konden niet goed omgaan met rommel: Als de AI een heel lang stuk tekst kreeg (bijvoorbeeld een hele database), raakten ze in de war en hielden ze op met zoeken.

4. Waarom is dit belangrijk?

Stel je voor dat je een robot bouwt die je huis moet schoonmaken. Als je hem alleen test in een leeg huis, denk je: "Hij is perfect!". Maar als je hem in een echt huis met kinderen, huisdieren en rommel zet, valt hij misschien om.

TOOLATHLON is die echte test. Het laat zien dat we nog een lange weg te gaan hebben voordat AI-assistenten echt betrouwbaar zijn voor complexe, echte taken. Het is een roep om de makers van deze AI's om hun "sporters" beter te trainen voor de echte marathon, niet alleen voor de korte sprint.

Kortom: TOOLATHLON is de eerlijke, moeilijke olympische wedstrijd voor AI's, en tot nu toe zijn ze nog niet klaar voor de gouden medaille. Maar nu we weten waar ze falen, kunnen we ze eindelijk echt verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →