← Nieuwste papers
🤖 AI

A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

Om de verzadiging en de beperkte dekking van toolgebruik in bestaande agent-benchmarks aan te pakken, introduceert dit artikel TASTE, een geautomatiseerde methode die het taakconstructieproces omkeert door toolsequenties te evolueren om de uitdagende, hooggedekte τc\tau^c-Bench te genereren, wat aantoont dat huidige state-of-the-art-modellen aanzienlijke prestatiedalingen vertonen wanneer ze worden geconfronteerd met deze complexere en diversere taken.

Oorspronkelijke auteurs: Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichert

Gepubliceerd 2026-05-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichert

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te testen hoe goed een nieuwe robotkok is in het koken.

Het Probleem: Het "Eenvoudige Menu" is Uitgeput
Op dit moment hebben we een standaard testmenu (genaamd τ\tau-Bench) waarbij de robot instructies moet volgen zoals "maak een boterham" of "bestel een pizza". Het probleem is dat de slimste robotkokken dit menu al uit hun hoofd hebben geleerd. Ze halen perfecte scores, maar niet omdat ze genieën zijn; het is gewoon omdat de test te makkelijk en repetitief is. Het is als een student die een A+ haalt op een wiskundetoets omdat de leraar ze alleen maar vraagt om cijfers onder de tien bij elkaar op te tellen.

Daarnaast is het maken van nieuwe, moeilijkere testvragen een nachtmerrie. Het vereist dat mensen gaan zitten, complexe verhalen schrijven, de exacte stappen bedenken die de robot moet nemen, en controleren of het verhaal logisch is. Dit is traag, duur en beperkt ons tot de soorten verhalen waar mensen toevallig op komen.

De Oplossing: TASTE (De "Omgekeerde Recept" Machine)
De auteurs hebben een nieuw systeem bedacht dat TASTE (Task Synthesis from Tool Sequence Evolution) heet. In plaats van te beginnen met een verhaal en de stappen te bedenken, draait TASTE het proces ondersteboven.

Denk er als volgt over:

  1. De "Tool Sequence" (De Stappen): Eerst genereert het systeem duizenden willekeurige lijsten met acties, zoals "Koelkast openen, melk pakken, glas inschenken, koelkast sluiten".
  2. De "Plausibility Filter" (De Smaaktest): Het gebruikt een superintelligente AI-rechter om deze lijsten te bekijken en te zeggen: "Nee, dat is onmogelijk. Je kunt geen melk inschenken voordat je de koelkast opent," of "Ja, dat is een geldige reeks gebeurtenissen." Het leert van zijn fouten en wordt beter in het onderscheiden van geldige versus ongeldige stappen.
  3. De "Clustering" (Groeperen op Smaak): Het groepeert deze geldige reeksen samen. Als één groep allemaal over "ontbijt maken" gaat en een andere over "een boterham maken", kiest het het meest representatieve voorbeeld uit elke groep om ervoor te zorgen dat de test een breed scala aan scenario's bestrijkt.
  4. De "Evolution" (Kruiden): Dit is de geheime saus. Zodra het een basisopdracht heeft (bijvoorbeeld "Bestel een pizza"), maakt het het opzettelijk moeilijker. Het kan:
    • De klant (de gesimuleerde gebruiker) laten vergeten wat ze besteld hebben.
    • "Misleidende" opties aan het menu toevoegen die er goed uitzien maar eigenlijk verkeerd zijn (zoals een pizza die uitverkocht is).
    • De klant onbehulpzaam of verwarrend maken.

Het Resultaat: τc\tau^c-Bench
Met deze methode bouwden ze een nieuwe, veel moeilijkere test genaamd τc\tau^c-Bench.

Toen ze de "kampioen" robotkokken (zoals Gemini-3-Flash) op dit nieuwe menu testten, waren de resultaten schokkend.

  • Op het oude, eenvoudige menu scoorden deze robots 0,90 (bijna perfect).
  • Op het nieuwe, door TASTE gegenereerde menu daalden hun scores naar 0,30 of lager.

Waarom Dit Belangrijk Is
Het paper stelt dat de hoge scores op de oude tests een "vals alarm" waren. De robots waren niet echt zo goed in het oplossen van complexe, rommelige problemen uit de echte wereld; ze kenden de oude testvragen gewoon uit hun hoofd.

De nieuwe methode bewijst dat:

  • Dekking: De nieuwe tests robots dwingen een veel bredere variëteit aan tools en combinaties te gebruiken, niet alleen dezelfde paar trucs.
  • Moeilijkheidsgraad: De tests zijn echt moeilijker omdat ze verwarring, ontbrekende informatie en lastige scenario's bevatten.
  • Automatisering: We hoeven deze moeilijke tests niet langer door mensen te laten schrijven. Het systeem kan een eindeloze voorraad uitdagende, geldige en diverse taken genereren om robots te blijven testen naarmate ze slimmer worden.

Kortom, TASTE is een machine die automatisch "baasgevechten" voor AI-agenten bedenkt, zodat we het verschil kunnen zien tussen een robot die een script uit zijn hoofd heeft geleerd en een robot die echt kan denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →