← Nieuwste papers
🤖 machine learning

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

Dit artikel introduceert PPT-Eval, een benchmark van 120 PowerPoint-taken ontworpen om computergebruikende agenten te evalueren, met een nieuw op rubrieken gebaseerd framework dat gede progreso vastlegt en sterk correleert met menselijk oordeel om te onthullen dat huidige grensmodellen nog steeds moeite hebben met complexe presentatiebewerking.

Oorspronkelijke auteurs: Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

Gepubliceerd 2026-07-01
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij Microsoft PowerPoint moet gebruiken. Je wilt zien of de robot daadwerkelijk naar een dia kan kijken, een verzoek begrijpt zoals "voeg hier een blauwe cirkel toe," en vervolgens op de juiste knoppen kan klikken om dit voor elkaar te krijgen.

Het artikel "PPT-EVAL" is in feite een gigantische, lastige test die ontworpen is om te zien hoe goed deze "computergebruik"-robots zijn in het uitvoeren van echt presentatiewerk.

Hier is de uitsplitsing van het artikel met behulp van eenvoudige analogieën:

1. Het Probleem: De Robot versus de Echte Wereld

De meeste eerdere tests voor robots waren als het geven van een gamecontroller met een beperkt aantal knoppen. De robot kon alleen doen wat het spel toestond (zoals "tekst toevoegen" of "kleur veranderen" via een codecommando).

Maar in de echte wereld gebruiken mensen geen code; ze gebruiken een muis, een toetsenbord en een scherm. Ze klikken op menu's, slepen vormen en gebruiken ontwerptools die geen simpele codeknoppen hebben.

  • De claim van het artikel: Bestaande tests controleerden niet of robots daadwerkelijk de muis konden gebruiken in PowerPoint. Ze controleerden alleen of robots een "cheatcode" (API) konden gebruiken. PPT-EVAL is de eerste test die de robot dwingt om de werkelijke PowerPoint-interface (de GUI) te gebruiken, precies zoals een mens dat zou doen.

2. De Test: De "PowerPoint-sportschool"

De onderzoekers bouwden een sportschool met 120 verschillende oefeningen (taken) verspreid over 12 verschillende PowerPoint-bestanden.

  • De bestanden: Deze zijn als echte presentaties die je in een bibliotheek zou kunnen vinden—sommigen gaan over geneeskunde, sommige over geschiedenis, andere over accountancy. Ze bevatten grafieken, vreemde lay-outs en animaties.
  • De moeilijkheidsgraad: De oefeningen worden beoordeeld als in een videogame:
    • Gemakkelijk: "Verander de achtergrondkleur naar blauw." (Simpel)
    • Gemiddeld: "Voeg een nieuw teamlid toe aan de lijst en verander hun lettertype." (Enkele stappen)
    • Moeilijk: "Herschik dit complexe diagram, voeg een nieuw gedeelte toe en zorg dat de animatie correct wordt afgespeeld." (Vereist nadenken en veel stappen).

3. De Scoring: Het "Beoordelingsschema" (Het belangrijkste deel)

Dit is de grootste innovatie van het artikel. In het verleden waren tests als een Keur/Niet-keur examen. Als de robot 90% van het antwoord goed had maar één klein detail miste, kreeg hij een nul. Dat is onrechtvaardig, omdat de robot wel geprobeerd heeft en het grootste deel van het werk heeft gedaan.

De onderzoekers creëerden een Beoordelingsschema (een gedetailleerd beoordelingsblad), wat meer lijkt op een talentenshow-jury in plaats van een strenge leraar.

  • Deelsucces: Als de robot de cirkel toevoegt maar hem op de verkeerde plek zet, geeft de jury punten voor het toevoegen van de cirkel, maar trekt het punten af voor de plaatsing.
  • Strafpunten: Als de robot per ongeluk een dia verwijdert of een vreemde animatie toevoegt waar hij niet om gevraagd werd, haalt de jury punten weg.
  • De "Menselijke" Touch: Het scoresysteem gebruikt AI om een natuurlijke taalverklaring te schrijven, zoals: "Je hebt de cirkel geplaatst, maar deze blokkeert de tekst. Goed gedaan met de kleur, maar de positie moet beter."

Het resultaat: Dit "Talentenshow-jury"-systeem was 77% in lijn met hoe echte mensen het werk zouden beoordelen. Dit betekent dat de test eerlijk en nauwkeurig is.

4. De Resultaten: De Robots zijn Nog aan het Leren

De onderzoekers lieten de slimste AI-robots ter wereld (zoals Claude-4.5 en de modellen van OpenAI) deze test doen.

  • De Score: Zelfs de beste robots voltooiden slechts ongeveer 45% van de taken "perfect".
  • Het Gemiddelde: Gemiddeld behaalden ze ongeveer 57% van de punten wanneer je rekening houdt met hun gedeelde voortgang.
  • De Vergelijking: Een menselijke expert zou bij dezelfde test ongeveer 80% scoren.
  • De API versus GUI Kloof: Opvallend genoeg, wanneer de robots werden toegestaan om "cheatcodes" (API's) te gebruiken in plaats van de muis, deden ze het veel beter (62% succes). Dit bewijst dat hoewel de robots slim zijn, ze nog steeds onhandig zijn met een muis en toetsenbord vergeleken met hoe ze met code omgaan.

Samenvatting

Beschouw PPT-EVAL als een rijexamen voor robots.

  • Oude Tests: Vraagd de robot: "Kun je de snelheid van de auto berekenen?" (Code/API).
  • PPT-EVAL: Zet de robot in de bestuurdersstoel, geeft hem het stuur en zegt: "Rijd naar de winkel, parkeer in de parkeervak en raak de stoeprand niet." (GUI/Muis).

Het artikel concludeert dat hoewel onze huidige robots beter worden, ze nog steeds worstelen met de fijne motoriek en het visuele redeneren die nodig zijn om PowerPoint te gebruiken zoals een mens. Er is nog een lange weg te gaan voordat ze volledig onze presentatiebanen kunnen overnemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →