← Nieuwste papers
💻 computer science

UniPPTBench: A Unified Benchmark for Presentation Generation Across Diverse Input Settings

Dit artikel introduceert UniPPTBench, een unificerend benchmark- en scenario-bewust evaluatiekader dat is ontworpen om presentatiegeneratiesystemen te beoordelen in uiteenlopende realistische invoersituaties, waarmee de beperkingen van bestaande geïsoleerde evaluaties en generieke kwaliteitsmaten worden aangepakt.

Oorspronkelijke auteurs: Bo Zhao, Maosheng Pang, Chen Zhang, Huan Yang, Yixin Cao, Wei Ji

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bo Zhao, Maosheng Pang, Chen Zhang, Huan Yang, Yixin Cao, Wei Ji

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een manager bent die een assistent vraagt om een PowerPoint-presentatie te maken. Soms zeg je gewoon: "Maak een presentatie over onze nieuwe strategie," zonder details. Op andere momenten geef je hen een 200 pagina's tellend financieel rapport, een map vol met diagrammen en grafieken, of drie verschillende documenten van verschillende afdelingen die elkaar tegenspreken.

Tot nu toe hebben AI-onderzoekers hun robots voor het maken van presentaties voornamelijk getest in een vacuüm. Ze testten een robot die alleen korte instructies aankan, of een andere robot die slechts één specifiek document verwerkt. Ze hadden geen enkele, eerlijke manier om te zien of een robot al deze rommelige, realistische situaties aankan.

Dit artikel introduceert UniPPTBench, een nieuwe "sportschool" voor het testen van deze AI-presentatiegeneratoren, en UniPPTEval, een nieuwe "scorekaart" om ze te beoordelen.

Hier is de uiteenzetting van hun werk met behulp van eenvoudige analogieën:

1. Het Probleem: De "Eén-Tool"-Valstrik

Stel je een timmerman voor die uitstekend is in het hameren van nagels, maar verschrikkelijk in het zagen van hout. Als je ze alleen test op het hameren, lijken ze een meesterhandwerker. Maar als je vraagt om een heel huis te bouwen, falen ze.

Huidige AI-presentatietools zijn als die timmerman.

  • Sommigen zijn uitstekend in het omzetten van een korte zin in een presentatie (zoals een "Alleen-Prompt"-tool).
  • Sommigen zijn uitstekend in het samenvatten van één PDF (zoals een "Document-naar-Slide"-tool).
  • Maar niemand had een geünificeerde test om te zien of een tool vage ideeën, lange documenten, afbeeldingen/diagrammen of meerdere tegenstrijdige bronnen allemaal tegelijk kon aanpakken.

2. De Oplossing: De "Universele Sportschool" (UniPPTBench)

De auteurs bouwden een enorme testomgeving genaamd UniPPTBench. Denk hierbij aan een sportschool met vier verschillende obstakelbanen, elk ontworpen om een specifieke vaardigheid te testen:

  • De "Vage Prompt"-baan: Je geeft de AI een vaag idee zoals "Maak iets over klimaatverandering." De AI moet het hele verhaal van scratch plannen.
  • De "Lange Document"-baan: Je geeft de AI een 100 pagina's tellend rapport. De AI moet optreden als een bekwame redacteur, de opvulling weglaten en alleen de belangrijkste feiten behouden zonder de betekenis te verliezen.
  • De "Multimodale" baan: Je geeft de AI een document met tekst en complexe diagrammen. De AI moet niet alleen de tekst lezen, maar ook de diagrammen begrijpen en ervoor zorgen dat de tekst overeenkomt met de afbeelding (bijvoorbeeld niet zeggen "de verkoop steeg" terwijl het diagram laat zien dat deze daalde).
  • De "Meerdere Bronnen"-baan: Je geeft de AI drie verschillende rapporten die mogelijk verschillende dingen zeggen. De AI moet optreden als een diplomaat, ze combineren tot één vloeiend verhaal zonder zichzelf te herhalen of in de war te raken.

3. De Nieuwe Scorekaart: "Hebben Ze Gelogen?" (UniPPTEval)

Vroeger was het beoordelen van deze AI's als het beoordelen van een goochelshow alleen op hoe glanzend de kostuums waren. Als de slides er mooi uitzagen en mooie lettertypes hadden, kreeg de AI een A.

De auteurs beseften dat dit oneerlijk was. Een presentatie kan er prachtig uitzien, maar vol liegen of belangrijke feiten missen. Ze creëerden UniPPTEval, een nieuw beoordelingssysteem met twee delen:

  • De "Algemene Sfeer"-check: Ziet het er goed uit? Is het leesbaar? Is de lay-out mooi? (Dit is de oude manier).
  • De "Waarheid & Relevantie"-check: Dit is het nieuwe deel.
    • Hebben ze de kernpunten behandeld? (Als je ze een 50 pagina's tellend rapport gaf, hebben ze dan de belangrijkste alinea gemist?)
    • Hebben ze gehallucineerd? (Hebben ze feiten verzonnen die niet in de bron stonden?)
    • Hebben ze de afbeeldingen overeen laten komen? (Als de bron een grafiek had, heeft de AI deze dan correct beschreven?)
    • Hebben ze de bronnen samengevoegd? (Als je ze drie documenten gaf, hebben ze ze dan samengesmolten of gewoon naast elkaar gekopieerd en geplakt?)

4. De "Meesterbouwer" (UniPPTAgent)

Om te bewijzen dat hun nieuwe test werkt, bouwden de auteurs hun eigen AI-assistent genaamd UniPPTAgent. In plaats van te proberen alles in één groot brein te doen, bouwden ze een team van drie gespecialiseerde agenten:

  1. De Onderzoeker: Leest de rommelige invoer en maakt een stevig overzicht.
  2. De Stylist: Beslist over het kleurenschema en de lettertypes zodat de hele presentatie er consistent uitziet.
  3. De Ontwerper: Bouwt de daadwerkelijke slides en controleert ze vervolgens op fouten (zoals tekst die over afbeeldingen heen loopt) en repareert ze automatisch.

5. Wat Ze Vonden

Toen ze de tests uitvoerden, vonden ze enkele verrassende dingen:

  • Mooi is niet genoeg: Veel AI-systemen kregen hoge scores voor "er goed uitzien", maar faalden erbarmelijk in "trouw blijven aan de bron". Ze maakten prachtige slides die verzonnen feiten bevatten.
  • De "Waarheid" is moeilijk: Het moeilijkste deel voor AI was niet het mooi maken van de slides; het was het nauwkeurig samenvatten van lange documenten of het combineren van meerdere bronnen zonder in de war te raken.
  • Open source loopt achter: Terwijl sommige commerciële tools (zoals NotebookLM of Manus) het goed deden, hadden veel open-source tools moeite met alles behalve eenvoudige, enkel-documenttaken.

De Conclusie

Dit artikel zegt: "Stop met het beoordelen van presentatie-AI's alleen op hoe mooi ze eruitzien. We hebben een nieuwe standaard nodig die controleert of ze de opdracht daadwerkelijk hebben begrepen, niets hebben verzonnen en de rommelige, realistische data die we eigenlijk hebben, aankunnen." Ze hebben de tools (de benchmark en de scorekaart) geleverd om ze eindelijk eerlijk te testen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →