← Nieuwste papers
🤖 AI

Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

Deze paper introduceert Proactive Agent Research Environment (Pare), een framework dat applicaties modelleert als eindige toestandsmachines om realistische actieve gebruikers te simuleren, en presenteert Pare-Bench, een benchmark van 143 taken voor het evalueren van proactieve agenten.

Oorspronkelijke auteurs: Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang

Gepubliceerd 2026-04-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Droom van de Proactieve Assistent

Stel je voor dat je een digitale butler hebt die niet alleen wacht tot je iets vraagt, maar je kent. Hij ziet dat je een boodschappenlijstje half hebt ingevuld en een berichtje krijgt van je huisgenoot dat er geen zeep meer is. Zonder dat je erom vraagt, voegt hij 'zeep' toe aan je lijstje. Dat is een proactieve assistent.

Het probleem is echter: hoe testen we of zo'n assistent slim genoeg is? Als we hem alleen vragen doen, is dat saai. We moeten kijken of hij echt begrijpt wat we nodig hebben voordat we het zelf zeggen.

Het Probleem met de Oude Testen

Vroeger testten onderzoekers deze assistents alsof ze in een videospelletje zaten waar alles op één knop werkt. Je zegt "stuur een bericht" en de assistent doet het direct. Maar in het echte leven is dat niet zo. Jij moet eerst je telefoon ontgrendelen, de app openen, het contact zoeken en dan pas sturen.

De oude tests negeerden deze stappen. Het was alsof je een piloot testte in een vliegtuig dat geen vleugels heeft. Het werkte niet realistisch.

De Oplossing: Pare (De Proactieve Agent Research Omgeving)

De auteurs van dit papier hebben Pare bedacht. Je kunt je Pare voorstellen als een super-realistische virtuele wereld voor je telefoon.

In deze wereld zijn er twee spelers:

  1. De Gebruiker (Jij): Een robot die zich gedraagt als een mens. Deze robot mag niet direct op de "magische knop" drukken. Hij moet net als jij door de app-schermen navigeren, wachten tot de pagina laadt en de juiste velden invullen. Dit is een Finite State Machine (FSM): een soort stramien van stappen die je moet volgen.
  2. De Assistent: Deze robot heeft een superkracht. Hij kan direct de "achterdeur" van de apps openen (via API's) om alles te zien en te doen. Hij ziet alles wat er gebeurt, maar hij mag niet zomaar ingrijpen.

De Analogie:
Stel je een keuken voor.

  • De Gebruiker is de kok die moet wachten tot de oven opwarmt, de ingrediënten moet snijden en de pan moet vinden voordat hij kan koken.
  • De Assistent is een magische keukenhulp die direct de ingrediënten uit de lucht kan toveren en de oven kan aansteken.
  • Maar de magische hulp mag niet koken zonder toestemming. Hij moet eerst vragen: "Wil je dat ik dit gerecht voor je maak?" Als de kok (de gebruiker) "Ja" zegt, dan doet de hulp het werk.

De Test: Pare-Bench

Om te zien welke assistent de slimste is, hebben ze Pare-Bench gemaakt. Dit is een grote test met 143 verschillende situaties.

Stel je voor dat het een grote sportschool is voor AI-assistenten. De oefeningen variëren van:

  • "Ik heb een e-mail over een vergadering gekregen, regel het in mijn agenda."
  • "Ik heb een berichtje dat mijn vriendin op zoek is naar een appartement, zoek iets binnen mijn budget."
  • "Ik heb een boodschappenlijstje, maar ik heb geen tijd om te winkelen."

De assistent moet:

  1. Kijken: Wat doet de gebruiker? Wat zijn de nieuwe berichten?
  2. Begrijpen: Wat wil de gebruiker waarschijnlijk doen?
  3. Vragen: "Zal ik dit voor je regelen?"
  4. Doen: Als de gebruiker ja zegt, voert hij de taken uit.

Wat hebben ze ontdekt?

Ze hebben zeven verschillende AI-modellen getest (zoals Claude, GPT, Gemini, etc.). Hier zijn de belangrijkste bevindingen:

  • De beste modellen zijn nog niet perfect: Zelfs de slimste AI's (zoals Claude en Gemini) slaagden maar in ongeveer 42% van de gevallen. Dat betekent dat ze in meer dan de helft van de situaties de verkeerde conclusie trokken of de gebruiker te veel lastigvielen.
  • Kleinere modellen worstelen: De kleinere, goedkopere modellen (die je misschien op je telefoon zou willen draaien) faalden vaak. Ze konden de taken niet goed uitvoeren, zelfs als ze wel wisten wat er moest gebeuren.
  • Te veel of te weinig: Sommige assistents waren te druk bezig met voorstellen ("Ik kan dit doen! Ik kan dat doen!"), terwijl de gebruiker dat niet wilde. Anderen waren te passief en wachtten te lang.
  • De "Oog-Hand" coördinatie: De slimste assistents keken eerst goed om zich heen (ze verzamelden informatie) voordat ze iets voorstelden. De minder goede modellen schoten er vaak te vroeg uit.

Waarom is dit belangrijk?

Dit onderzoek is een grote stap voorwaarts voor privacy en autonomie.

  • Privacy: Omdat de assistent alleen kijkt naar wat er gebeurt (gebeurtenissen) en niet naar elk detail op je scherm, blijft je privacy beter gewaarborgd.
  • Autonomie: De assistent doet niets zonder toestemming. Hij is een helper, geen meester.

Conclusie

Dit papier introduceert een nieuwe manier om te testen of digitale assistents echt "proactief" zijn. In plaats van ze te testen in een virtuele wereld waar alles makkelijk is, dwingen ze ze om te werken in een wereld die precies zo werkt als jouw telefoon: met scherm-navigatie, wachttijden en menselijke beslissingen.

Het resultaat? We weten nu dat we nog een lange weg te gaan hebben voordat onze AI-assistenten echt als een slimme, betrouwbare butler kunnen fungeren die ons echt helpt zonder ons te irriteren. Maar met Pare hebben we eindelijk de juiste testbaan om ze te trainen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →