← Nieuwste papers
💬 NLP

AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios

Dit artikel introduceert AgentIF-OneDay, een nieuwe benchmark bestaande uit 104 diverse dagelijkse taken op het gebied van open workflow-executie, latente instructie-inferentie en iteratieve verfijning, ontworpen om het vermogen van algemene AI-agenten te evalueren om natuurlijke taalinstructen op te volgen en tastbare bestandgebaseerde resultaten te produceren, waarbij wordt onthuld dat zowel API-gebaseerde als door RL verbeterde agenten momenteel het veld leiden.

Oorspronkelijke auteurs: Kaiyuan Chen, Qimin Wu, Taiyu Hou, Tianhao Tang, Xueyu Hu, Yuchen Hou, Bikun Li, Chengming Qian, Guoyin Wang, Haolin Chen, Haotong Tian, Haoye Zhang, Haoyu Bian, Hongbing Pan, Hongkang Zhang, Hongyi Z
Gepubliceerd 2026-02-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kaiyuan Chen, Qimin Wu, Taiyu Hou, Tianhao Tang, Xueyu Hu, Yuchen Hou, Bikun Li, Chengming Qian, Guoyin Wang, Haolin Chen, Haotong Tian, Haoye Zhang, Haoyu Bian, Hongbing Pan, Hongkang Zhang, Hongyi Zhou, Jiaqi Cai, Jiewu Rao, Jiyuan Ren, Keduan Huang, Lucia Zhu Huang, Mingyu Yuan, Naixu Guo, Qicheng Tang, Qinyan Zhang, Shuai Chen, Siheng Chen, Ting Ting Li, Xiaoxing Guo, Yaocheng Zuo, Yaoqi Guo, Yinan Wang, Yinzhou Yu, Yize Wang, Yuan Jiang, Yuan Tian, Yuanshuo Zhang, Yuxuan Liu, Yvette Yan Zeng, Zenyu Shan, Zihan Yin, Xiaobo Hu, Yang Liu, Yixin Ren, Yuan Gong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Eén-Dag"-test voor AI-assistenten

Stel je voor dat je een nieuwe persoonlijke assistent inhuurt. Je wilt niet alleen zien of ze een trivia-vraag kunnen beantwoorden of een gedicht kunnen schrijven. Je wilt zien of ze jouw hele dag kunnen beheren—van het organiseren van je werkplanning tot het plannen van een gezinsreis, terwijl ze jouw specifieke, soms rommelige instructies opvolgen.

Dit artikel introduceert AgentIF-OneDay, een nieuwe "eindtoets" voor AI-agenten, ontworpen om precies dat te testen. Het beweegt weg van het testen van AI op moeilijke programmeerpuzzels of diepgaand wetenschappelijk onderzoek en vraagt in plaats daarvan: "Kan deze AI een gewone persoon echt helpen om hun dagelijkse leven en werk te doen?"


De Drie Typen "Dagelijkse Taken"

De onderzoekers hebben 104 verschillende scenario's gemaakt om de AI te testen. Ze hebben deze taken gegroepeerd in drie categorieën, die lijken op drie verschillende manieren waarop je een assistent om hulp zou kunnen vragen:

1. De "Volg het Recept"-test (Open Workflow Executie)

  • De Analogie: Je geeft je assistent een zeer specifiek, stapsgewijs recept voor een complex gerecht. Je zegt: "Controleer eerst de temperatuur van de oven. Kijk daarna naar de timer. Meng vervolgens deze drie ingrediënten. Sla stap 3 niet over."
  • Wat het test: Kan de AI een lange, gedetailleerde lijst met instructies volgen zonder in de war te raken, een stap te vergeten of dingen te verzinnen? Het test of de AI zich aan het plan kan houden dat je gaf, zelfs als het plan lang en ingewikkeld is.

2. De "Lees Tussen de Regels"-test (Latente Instructie-inferentie)

  • De Analogie: Je overhandigt je assistent een map met oude documenten en zegt: "Maak een nieuw rapport dat precies lijkt op deze." Je schrijft de regels niet op (zoals "gebruik blauwe koppen" of "zet de datum rechtsonder"). Je verwacht dat de assistent naar de oude documenten kijkt, de verborgen stijlregels ontdekt en deze toepast op het nieuwe rapport.
  • Wat het test: Kan de AI naar een bestand (zoals een PDF of een spreadsheet) kijken en de onuitgesproken regels begrijpen? Het gaat om het herkennen van patronen en impliciete beperkingen die je niet expliciet hardop hebt uitgesproken.

3. De "Edit en Verbeter"-test (Iteratieve Verfijning)

  • De Analogie: Je assistent maakt een concept voor een presentatie. Je bekijkt het en zegt: "Het lettertype is te klein en de tweede dia mist een grafiek. Maak ook de achtergrond lichter." Je vraagt niet om een nieuwe presentatie vanaf nul; je wilt dat ze de bestaande aanpassen terwijl de goede onderdelen behouden blijven.
  • Wat het test: Kan de AI onthouden wat het net heeft gedaan, de feedback begrijpen en nauwkeurige wijzigingen aanbrengen zonder de rest van het werk te breken? Het test hoe goed de AI de "status" van het project onthoudt.

Hoe ze de AI hebben beoordeeld

In plaats van alleen te vragen "Werkt het?", gebruikten de onderzoekers een zeer strikt beoordelingsschema (zoals het antwoordmodel van een docent).

  • De "Rechter": Ze gebruikten een super-slimme AI (Gemini-3-Pro) om de resultaten te beoordelen, maar ze controleerden dit tegen menselijke beoordelaars om te zorgen dat het eerlijk was. Ze kwamen tot de conclusie dat de AI-rechter in 80% van de gevallen het eens was met de mensen.
  • De Bestanden: De test ging niet alleen over tekst. De AI moest echte bestanden verwerken—PDF's, Excel-sheets, afbeeldingen en code—net zoals een mens dat zou doen.

Wat ze vonden: De Resultaten

Ze hebben vier van de beste AI-agenten van dit moment getest. Hier is de kern:

  1. Het "API" versus "Gespecialiseerd" Debat:

    • Sommige bedrijven bouwen AI-agenten door simpelweg een krachtige chatbot aan een reeks hulpmiddelen te koppelen (als een generalist).
    • Anderen bouwen agenten met speciale "hersentraining" (Reinforcement Learning) specifief gericht op het uitvoeren van taken.
    • De Verrassing: Het artikel vond dat beide typen bijna even goed presteren. De "speciale training" geeft geen groot voordeel meer. Het lijkt erop dat de basis-"intelligentie" om taken af te handelen nu al ingebouwd zit in de hoofd-AI-modellen zelf.
  2. De Winnaars:

    • Manus kwam als algemene winnaar uit de bus. Het was bijzonder goed in het volgen van lange, complexe workflows.
    • Genspark was uitstekend in het opvolgen van instructies en het omgaan met negatieve beperkingen (zoals "doe niet X").
    • ChatGPT-Agent was het beste in werkgerelateerde taken.
    • Minimax-Agent was de langzaamste; het duurde lang voordat het nadacht, hoewel het goed was in logica.
  3. De Zwakte:

    • Het moeilijkste deel voor alle AI's was Latente Instructie-inferentie (lezen tussen de regels). Zelfs de beste agenten hadden moeite om verborgen regels uit een bestand perfect te ontdekken zonder dat er expliciet werd gezegd waar ze naar moesten kijken.

De Kernboodschap

Dit artikel betoogt dat we moeten stoppen met het testen van AI alleen op hoe "slim" het is in het oplossen van raadsels. In plaats daarvan moeten we testen hoe nuttig het is in het echte leven.

Het goede nieuws is dat AI-agenten heel goed worden in het afhandelen van de "saaie" maar essentiële onderdelen van onze dag—het beheren van bestanden, het volgen van complexe workflows en het bewerken van werk. Het slechte nieuws is dat ze soms nog steeds moeite hebben om "de sfeer te proeven" of verborgen regels in documenten te ontdekken zonder een beetje extra hulp van ons.

De toekomst van AI gaat niet alleen over het slimmer maken van het model; het gaat over het bouwen van betere producten die ons helpen navigeren door ons specifieke, rommelige, dagelijkse leven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →