← Nieuwste papers
🤖 machine learning

ProactBench: Beyond What The User Asked For

ProactBench introduceert een nieuw benchmark voor het evalueren van conversatieve proactiviteit—het vermogen van LLM's om geïmpliceerde gebruikersbehoeften te identificeren en daarop te handelen—door dit te ontleden in Emergent, Critical en Recovery-fasen en aan te tonen dat Recovery-prestaties een distinct, moeilijk evaluatiesignaal vormen dat niet wordt vastgelegd door bestaande benchmarks.

Oorspronkelijke auteurs: Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je met een vriend praat die een expert-assistent is. Je zegt: "Ik ga over een uur naar de vliegveld, en ik realiseer me net dat ik mijn lader heb vergeten in te pakken."

Een reactieve assistent (het type dat de meeste AI vandaag de dag is) zou zeggen: "Oké, ik heb dat genoteerd. Veel succes met je vlucht!" Het beantwoordde je verzoek perfect, maar het miste het feit dat je zonder stroom vast zou komen te zitten.

Een proactieve assistent zou zeggen: "Aangezien je over een uur vertrekt, heb je geen tijd om er een nieuwe te kopen. Heb je een draagbare accu in je tas? Ook, je vlucht is om 18.00 uur, dus als je de gate mist, moet je direct de luchtvaartmaatschappij bellen. Hier is hun nummer."

Dit paper, ProactBench, is een nieuwe test ontworpen om te zien of AI dat tweede soort vriend kan zijn. Het vraagt: Kan de AI opmerken wat je niet hebt gezegd en je helpen voordat je het zelfs maar vraagt?

De drie "momenten" van proactiviteit

De auteurs realiseerden zich dat proactief zijn niet slechts één vaardigheid is; het gebeurt op verschillende momenten in een gesprek. Ze onderverdelde het in drie "triggers", zoals checkpoints in een videospel:

  1. Emergent (De vroege aanwijzing):

    • Het scenario: Je noemt terloops dat je baas niet op kantoor is.
    • De proactieve zet: De AI beseft: "Oh, als de baas er niet is, kan niemand dit dringende verzoek nu goedkeuren," en stelt een omweg voor.
    • De test: Heeft de AI een enkel klein detail verbonden met een verborgen probleem?
  2. Critisch (De puzzeloplosser):

    • Het scenario: Over een paar beurten noem je dat je een krap budget hebt, een zware koffer en een vlucht die vroeg morgen vertrekt.
    • De proactieve zet: De AI legt deze drie aanwijzingen samen en zegt: "Aangezien je op een budget zit en een zware tas hebt, moet je de bus nemen in plaats van een taxi, en moet je om 04.00 uur wakker worden om deze te halen."
    • De test: Heeft de AI meerdere verspreide details gecombineerd om tot een nieuwe, bruikbare conclusie te komen?
  3. Herstel (Het "Wacht, nog één ding"):

    • Het scenario: Je zegt: "Oké, het plan staat vast. Ik ben klaar!"
    • De proactieve zet: Een normale AI zegt: "Geweldig! Fijne dag." Een proactieve AI zegt: "Geweldig! Nog één ding: aangezien je die zware apparatuur in je hatchback laadt, vergeet dan niet om de projector als laatste te doen, zodat het het eerste is wat je eruit haalt wanneer je aankomt."
    • De test: Dit is het moeilijkste deel. Heeft de AI waarde toegevoegd nadat de taak technisch gezien klaar was, zonder vervelend te zijn?

Hoe ze het testten (De "geheime saus")

Om ervoor te zorgen dat de AI niet gewoon gokte of de testantwoorden las, bouwden de onderzoekers een "drie-agenten" systeem, zoals een toneelstuk met drie acteurs:

  • De Regisseur (Planner): Deze AI schrijft het script en beslist wanneer de assistent getest wordt. Het kent het geheime doel en de "rubriek" (het beoordelingsformulier), maar vertelt het de assistent nooit.
  • De Acteur (Gebruiker-agent): Deze AI speelt de mens. Het volgt de instructies van de Regisseur, maar spreekt natuurlijk, met verschillende persoonlijkheden (kletsziek, chagrijnig, precies, enz.).
  • De Uitvoerder (Assistent-model): Dit is de AI die getest wordt. Het ziet alleen het gesprek. Het heeft geen idee dat het wordt beoordeeld, geen idee wat het geheime doel is, en geen idee hoe de "Gebruiker" echt is.

Deze opstelling voorkomt dat de AI "valt" door de testvragen te memoriseren of gewoon probeert aardig te klinken.

Wat ze vonden

De onderzoekers testten 16 verschillende AI-modellen (de slimste die beschikbaar waren) op 198 gesprekken. Hier is de grote verrassing:

  • De "Reactive" kloof: De meeste modellen zijn uitstekend in het beantwoorden van directe vragen. Ze zijn als uitstekende studenten die een 'A' halen op de test als de leraar de exacte vraag stelt.
  • De "Proactieve" kloof: Toen het ging om de Herstel-fase (het "Wacht, nog één ding"-moment), faalden bijna alle modellen jammerlijk. Zelfs de slimste AI slaagde slechts ongeveer 37% van de tijd.
  • De disconnectie: Goed zijn in coderen, wiskunde of logica (standaard AI-tests) voorspelde niet wie goed zou zijn in proactief zijn. Je kunt een genie-coder hebben die verschrikkelijk is in het anticiperen op je behoeften.

Het menselijke oordeel

De onderzoekers vroegen echte mensen om de antwoorden van de AI te beoordelen.

  • Vinden mensen het leuk? Ja! Wanneer de AI proactief was, gaven mensen het 80% van de tijd de voorkeur boven de standaard "beleefde maar lege" reactie.
  • Is het gewoon een "ja-knikker" zijn? Nee. De test bestraft specifiek AI die met alles akkoord gaat of generiek advies geeft. De AI moest specifieke details uit het gesprek gebruiken om behulpzaam te zijn.

De conclusie

ProactBench toont aan dat, terwijl AI slimmer wordt in het volgen van orders, het nog steeds leert hoe het een behulpzame partner kan zijn. Het is momenteel zeer goed in doen wat het wordt verteld, maar het heeft moeite om te merken wat je nodig hebt voordat je het zegt. De auteurs suggereren dat dit niet alleen een gebrek aan intelligentie is; het is een verschil in "beleid" of gedrag. De beste AI-modellen leren meer te zijn als een doordachte vriend die je behoeften anticiperen, in plaats van slechts een zeer snelle rekenmachine.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →