← Nieuwste papers
💻 computer science

X+Slides: Benchmarking Audience-Conditioned Slide Generation

Het artikel introduceert X+Slides, een nieuwe benchmark met een dynamisch, op het publiek toegespitst evaluatiekader met vier complementaire metrieken om te beoordelen hoe goed grote taalmodellen diavoorstellen genereren die de balans bewaren tussen bron-gebaseerde juistheid en de specifieke informatiebehoeften van diverse doelgroepen.

Oorspronkelijke auteurs: Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

Gepubliceerd 2026-06-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, dichte encyclopedie hebt over een specifiek onderwerp. Stel je nu voor dat je deze encyclopedie moet omzetten in een korte, krachtige presentatie met dia's.

Het probleem is dat wie er naar de presentatie kijkt, alles verandert.

  • Als je aan een wetenschapper presenteert, willen zij de diepgaande details, de wiskundige bewijzen en de minuscule uitzonderingen.
  • Als je aan een CEO presenteert, geven zij alleen om de onderlijn, de risico's en de vraag: "Wat doen we nu verder?"
  • Als je aan een student presenteert, hebben zij alleen het grote plaatje en een simpel verhaal nodig.

Lange tijd waren computers die deze dia's probeerden te maken als een slechte ober die iedereen exact hetzelfde gerecht serveert: een enorme, ongesneden biefstuk. Het kan "correct" zijn (de biefstuk is echt), maar het is nutteloos voor de vegetariër, het kind, of de persoon die gewoon een snelle snack wil.

Dit artikel introduceert X+Slides, een nieuwe manier om te testen of AI een betere ober kan zijn.

Het Kernidee: De "Universele Vragenbank"

In plaats van de AI te laten raden wat het publiek wil, hebben de onderzoekers een enorme, neutrale "vragenbank" gebouwd op basis van het brondocument. Denk hierbij aan een meesterlijst van elke mogelijke feit in de encyclopedie.

  1. De Neutrale Lijst: Eerst genereren ze duizenden vragen over het document (bijv. "Wat was de experimentele methode?" of "Wat is de belangrijkste conclusie?"). Deze vragen zijn neutraal; ze weten nog niet wie er kijkt.
  2. De Publieksfilter: Vervolgens passen ze een "filter" toe op basis van het publiek.
    • Voor de wetenschapper zegt de filter: "De methode-vraag is 100 punten waard. De 'grote plaatje'-vraag is 10 punten waard."
    • Voor de CEO draait de filter om: "De 'grote plaatje'-vraag is 100 punten waard. De methode-vraag is 0 punten waard."
  3. De Score: De AI maakt een set dia's. De onderzoekers controleren vervolgens: "Heeft de AI de hoogwaardige vragen voor dit specifieke publiek opgenomen?"

De Vier Scorekaarten

X+Slides geeft niet slechts één score. Het gebruikt vier verschillende manieren om de presentatie te beoordelen, zoals een docent die een rubric gebruikt:

  1. Publieksdekking (Hadden ze de juiste zaken?): Dit meet hoeveel van de "hoogwaardige" vragen waar het publiek om geeft, daadwerkelijk in de dia's werden beantwoord. Als de CEO risico's wilde en de AI alleen geschiedenis gaf, daalt deze score.
  2. Domeindekking (Kozen ze de juiste soorten zaken?): Dit gaat een stap verder. Richtte de AI zich te veel op "methoden" terwijl het publiek om "implicaties" vroeg? Het is alsof je controleert of een chef-kok te veel garnering heeft geserveerd en niet genoeg hoofdgerecht.
  3. Efficiëntie (Was het te lang?): Dit vraagt: "Hoeveel nuttige informatie heb ik gekregen per minuut van mijn tijd?" Als de dia's 50 pagina's lang zijn maar slechts kunnen zeggen wat in 5 pagina's gezegd had kunnen worden, is de efficiëntiescore laag.
  4. Correctheid (Hebben ze gelogen?): Dit is de veiligheidsbarrière. Het controleert of elke bewering op de dia daadwerkelijk wordt ondersteund door het originele document. Dit voorkomt dat de AI indrukwekkende, maar onware feiten verzint.

Wat ze vonden (De Resultaten)

De onderzoekers testten drie populaire AI-dia-generatoren (DeepPresenter, SlideTailor en NotebookLM) met dit nieuwe systeem.

  • Het Goede Nieuws: De AI is niet slecht. Het kan veel van de belangrijke informatie oppakken.
  • Het Slechte Nieuws: Het mist nog steeds de plank mis wat betreft wie het aanspreekt.
    • Wanneer gevraagd werd om tegen een wetenschapper te praten, miste de AI vaak de diepe technische details (de "Level 3 en 4" feiten).
    • Wanneer gevraagd werd om tegen een CEO te praten, raakte de AI soms verstrikt in te veel technisch jargon.
    • NotebookLM (een Google-tool) deed verrassend goed zijn best bij het kiezen van de juiste informatie voor CEO's en studenten, maar had wat moeite met de diepe technische details voor wetenschappers.

De Belangrijkste Conclusie

Het artikel betoogt dat we niet langer alleen kunnen zeggen: "Kijk hoe mooi en uitgebreid deze dia-set is!" om een AI te beoordelen. Een prachtige set die een CEO een 50 pagina tellende wiskundige lezing geeft, is een mislukking, zelfs als de wiskunde 100% correct is.

X+Slides bewijst dat als we een echt nuttige AI voor presentaties willen bouien, we moeten stoppen met het behandelen van alle feiten als gelijkwaardig. We moeten de AI leren dat wat belangrijk is voor een wetenschapper, nutteloos is voor een CEO, en vice versa. Het artikel biedt de liniaal om te meten of de AI eindelijk die les leert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →