← Nieuwste papers
💬 NLP

MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents

Oorspronkelijke auteurs: Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

Gepubliceerd 2026-06-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een persoonlijke assistent inhuurt om je leven te beheren. Je zou diegene toch ook niet een gloednieuw, leeg bureau geven zonder bestanden, zonder foto's en zonder geheugen van wie je bent? Je zou verwachten dat ze weten wat je favoriete koffietentje is, wat je banksaldo is, je komende vakantie en de verjaardag van je vriend(in).

Het Probleem: De "Lege Bureau"-test
Momenteel zijn de tests die we gebruiken om te zien of AI-computers slim genoeg zijn om persoonlijke assistenten te zijn, als het geven van dat lege bureau aan hen. De AI krijgt de opdracht om taken uit te voeren op een computer die geen geschiedenis, geen ingelogde accounts en geen persoonlijke gegevens heeft. Het is alsof je iemand vraagt om "je gebruikelijke diner te bestellen" terwijl diegene geen idee heeft wie je bent of wat je gewoonlijk bestelt.

Het artikel betoogt dat dit een enorme kloof is. Echte persoonlijke assistenten moeten een digitaal leven navigeren dat rommelig, onderling verbonden en vol persoonlijke geschiedenis is.

De Oplossing: MYPCBENCH (De "Michael Scott"-simulatie)
Om dit op te lossen, hebben de onderzoekers een nieuwe test gebouwd genaamd MYPCBENCH. In plaats van een leeg bureau, hebben ze een volledig gevuld digitael leven gecreëerd voor een specifiek personage: Michael Scott uit de tv-serie The Office.

Beschouw dit als het bouwen van een enorme, interactieve videogame-wereld waarin:

  • Het Personage: Michael Scott is de "gebruiker".
  • De Data: De computer is vooraf geladen met 1.812 banktransacties, 2.398 e-mails, 679 agenda-afspraken en duizenden chatberichten.
  • De Apps: Er zijn 17 verschillende "nep" websites (zoals een nepbank, een nep-airline, een nep-maaltijdbezorgapp) die allemaal met elkaar verbonden zijn. Als Michael een vlucht boekt bij de nep-airline, verschijnt er automatisch een afschrijving op zijn nepbankafschrift en komt er een bevestigingsmail in zijn nep-inbox terecht.
  • Het Doel: De AI moet optreden als Michaels assistent en deze apps gebruiken om echte levensproblemen op te lossen met behulp van zijn specifieke geschiedenis.

De Test: 184 Real-World Uitdagingen
De onderzoekers hebben 184 specifieke taken gemaakt op basis van echte verzoeken die mensen daadwerkelijk aan AI-assistenten doen. Deze taken variëren van eenvoudig tot ongelooflijk complex:

  • Eenvoudig: "Stuur $100 naar Pam via Zelle." (De AI moet eerst controleren of Pam in de contacten staat).
  • Complex: "Ik heb reizen naar Jamaica en Barbados geboekt. Kan ik beide betalen op basis van mijn huidige creditcardsaldo?" (De AI moet de bank-app bekijken, de reis-app bekijken en een berekening maken).
  • Patroonherkenning: "Wat geef ik meestal als fooi bij maaltijdbezorging?" (De AI moet honderden eerdere bestellingen scannen om een patroon te vinden).

De Resultaten: De AI worstelt met het "Echte Leven"
De onderzoekers hebben zes van de slimste beschikbare AI-modellen (van bedrijven als Anthropic, OpenAI en anderen) getest op deze test. Dit is wat er gebeurde:

  1. De Beste Presteerder: Het topmodel (Claude Opus 4.6) slaagde erin om ongeveer 55% van de taken perfect uit te voeren. Dat klinkt goed, maar vergeet niet dat dit de beste beschikbare AI is. Het faalde nog steeds bijna de helft van de tijd.
  2. Het "Multi-App"-Probleem: De AI werd aanzienlijk slechter naarmate taken vereisten dat er meer dan één app werd gebruikt. Wanneer een taak de AI vereiste om tussen 7 of meer verschillende apps te springen (zoals e-mail controleren, dan een agenda, dan een bank, dan een reiswebsite), daalde het succespercentage voor de meeste modellen naar 0%.
  3. Het "Lang Geheugen"-Probleem: De AI had moeite om een lange keten van acties bij te houden. Als een taak 50 stappen vereiste, raakte de AI vaak de weg kwijt of gaf hij op.
  4. Verschillende Faalstijlen:
    • Sommige AI's (zoals GPT) hadden de neiging om te vroeg op te geven door te zeggen "Ik ben klaar" voordat ze het werk daadwerkelijk hadden voltooid.
    • Sommige AI's (zoals Qwen) begonnen dingen te verzinnen, waarbij ze feiten over Michael Scott verzonnen die niet in de data stonden.
    • De beste AI (Claude) nam soms een afkorting door de commandoregel van de computer te gebruiken (als een hacker) in plaats van doorheen de menu's te klikken zoals een normaal persoon dat zou doen.

De Kernboodschap
Het artikel concludeert dat hoewel AI beter wordt in het gebruiken van computers, het nog niet klaar is om een echte "persoonlijke" assistent te zijn. Het kan een schone, eenvoudige taak afhandelen, maar het valt uit elkaar wanneer het een rommelig, onderling verbonden, echt digitaal leven met persoonlijke geschiedenis moet navigeren.

De onderzoekers hebben hun testomgeving (de "Michael Scott"-computer) openbaar gemaakt, zodat andere wetenschappers kunnen proberen betere assistenten te bouwen die daadwerkelijk de complexiteit van een echt menselijk digitaal leven kunnen aan kunnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →