← Últimos artigos
💻 computer science

X+Slides: Benchmarking Audience-Conditioned Slide Generation

O artigo apresenta o X+Slides, um novo benchmark que apresenta uma estrutura de avaliação dinâmica e condicionada ao público com quatro métricas complementares para avaliar quão bem os grandes modelos de linguagem geram apresentações de slides que equilibram a correção fundamentada na fonte com as necessidades informacionais específicas de diversos públicos-alvo.

Autores originais: Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

Publicado 2026-06-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma enciclopédia massiva e densa sobre um tópico específico. Agora, imagine que você precisa transformar essa enciclopédia em uma apresentação de slides curta e direta.

O problema é que quem está assistindo à apresentação muda tudo.

  • Se você estiver apresentando para um cientista, eles querem os detalhes minuciosos, as provas matemáticas e as minúsculas exceções.
  • Se você estiver apresentando para um CEO, eles só se importam com o resultado final, os riscos e o "o que fazemos a seguir?".
  • Se você estiver apresentando para um estudante, eles só precisam da visão geral e de uma história simples.

Por muito tempo, computadores tentando criar esses slides foram como um mau garçom que serve exatamente a mesma refeição para todos: um bife gigante e sem cortes. Pode ser que seja "correto" (o bife é real), mas é inútil para o vegetariano, para a criança ou para quem quer apenas um lanche rápido.

Este artigo apresenta o X+Slides, uma nova maneira de testar se a IA pode ser um garçom melhor.

A Ideia Central: O "Banco de Questões Universal"

Em vez de pedir que a IA adivinhe o que o público quer, os pesquisadores construíram um enorme "banco de questões" neutro baseado no documento de origem. Pense nisso como uma lista mestra de todos os fatos possíveis na enciclopédia.

  1. A Lista Neutra: Primeiro, eles geram milhares de perguntas sobre o documento (ex: "Qual foi o método do experimento?" ou "Qual é a conclusão principal?"). Essas perguntas são neutras; elas ainda não sabem quem está assistindo.
  2. O Filtro de Audiência: Em seguida, eles aplicam um "filtro" baseado no público.
    • Para o Cientista, o filtro diz: "A pergunta sobre o método vale 100 pontos. A pergunta de 'visão geral' vale 10 pontos."
    • Para o CEO, o filtro inverte: "A pergunta de 'visão geral' vale 100 pontos. A pergunta sobre o método vale 0 pontos."
  3. A Pontuação: A IA cria um conjunto de slides. Os pesquisadores então verificam: "A IA incluiu as perguntas de alto valor para este público específico?"

Os Quatro Boletins

O X+Slides não dá apenas uma nota. Ele usa quatro maneiras diferentes de avaliar a apresentação, como um professor usando uma rubrica:

  1. Cobertura de Audiência (Eles pegaram o que era certo?): Isso mede quantas das perguntas de "alto valor" que o público se importa foram realmente respondidas nos slides. Se o CEO queria riscos e a IA apenas deu história, essa pontuação cai.
  2. Cobertura de Domínio (Eles escolheram os tipos certos de coisas?): Isso detalha mais a fundo. A IA focou demais em "métodos" quando o público queria "implicações"? É como verificar se um chef serviu muitos acompanhamentos e não o prato principal.
  3. Eficiência (Era longo demais?): Isso pergunta: "Quanto de informação útil eu obtive por minuto do meu tempo?" Se os slides têm 50 páginas, mas apenas dizem o que poderia ser dito em 5, a pontuação de eficiência é baixa.
  4. Correção (Eles mentiram?): Este é o guarda-corpo de segurança. Verifica se cada afirmação no slide é de fato sustentada pelo documento original. Isso evita que a IA invente fatos interessantes que não são verdadeiros.

O Que Eles Descobriram (Os Resultados)

Os pesquisadores testaram três geradores de slides de IA populares (DeepPresenter, SlideTailor e NotebookLM) usando este novo sistema.

  • A Boa Notícia: A IA não é terrível. Ela consegue capturar muita informação importante.
  • A Má Notícia: Ela ainda está errando o alvo em relação a quem está ouvindo.
    • Quando solicitada a falar com um Cientista, a IA frequentemente perdia os detalhes técnicos profundos (os fatos de "Nível 3 e 4").
    • Quando solicitada a falar com um CEO, a IA às vezes se perdia em excesso de jargão técnico.
    • O NotebookLM (uma ferramenta do Google) teve um desempenho surpreendentemente bom ao escolher as informações certas para CEOs e estudantes, mas teve certa dificuldade com os detalhes técnicos profundos para cientistas.

A Grande Conclusão

O artigo argumenta que não podemos mais dizer apenas "Olha como esse conjunto de slides é bonito e longo!" para julgar uma IA. Um deck bonito que entrega a um CEO uma palestra matemática de 50 páginas é um fracasso, mesmo que a matemática esteja 100% correta.

X+Slides prova que, para construir uma IA verdadeiramente útil para apresentações, precisamos parar de tratar todos os fatos como iguais. Temos que ensinar à IA que o que é importante para um cientista é inútil para um CEO, e vice-versa. O artigo fornece a régua para medir se a IA está finalmente aprendendo essa lição.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →