← 最新论文
💻 computer science

X+Slides: Benchmarking Audience-Conditioned Slide Generation

本文介绍了 X+Slides,这是一个全新的基准测试,它采用了一个动态的、以受众为条件的评估框架,包含四个互补的指标,用于评估大语言模型在生成幻灯片演示文稿时,如何在保持基于源文本的正确性与满足不同目标受众特定信息需求之间取得平衡。

原作者: Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一本关于特定主题的、厚重且密集的百科全书。现在,想象你需要将这本百科全书变成一份简短、精炼的幻灯片演示文稿。

问题在于,在看这份演示文稿,决定了一切。

  • 如果你是在向一位科学家做演示,他们想要的是细节、数学证明和微小的例外情况。
  • 如果你是在向一位 CEO 做演示,他们只关心底线、风险以及“下一步该做什么?”
  • 如果你是在向一名学生做演示,他们只需要大局观和一个简单的故事。

长期以来,试图制作这些幻灯片的计算机就像一个糟糕的侍者,给每个人提供的都是完全相同的餐点:一块未经切割的巨大牛排。它可能是“正确”的(牛排确实是真的),但对于素食者、孩子或只想吃个快餐的人来说,它是毫无用处的。

这篇论文介绍了 X+Slides,一种测试 AI 是否能成为更好侍者的新方法。

核心理念:“通用问题库”

研究人员并没有让 AI 去猜测观众想要什么,而是基于源文档构建了一个庞大的、中立的“问题库”。你可以把这想象成百科全书中每一个可能的事实清单。

  1. 中立列表: 首先,他们针对文档生成了数千个问题(例如,“实验方法是什么?”或“主要结论是什么?”)。这些问题是中立的;它们还不知道谁在观看。
  2. 观众过滤器: 然后,他们根据观众应用一个“过滤器”。
    • 对于科学家,过滤器会说:“‘方法’类问题价值 100 分。‘大局观’类问题价值 10 分。”
    • 对于 CEO,过滤器会反转:“‘大局观’类问题价值 100 分。‘方法’类问题价值 0 分。”
  3. 评分: AI 制作一份幻灯片演示文稿。研究人员随后检查:“AI 是否包含了针对这一特定观众的高价值问题?”

四个评分维度

X+Slides 不仅仅提供一个分数。它使用四种不同的方式来对演示文稿进行评分,就像老师使用评分标准一样:

  1. 观众覆盖度(是否抓住了重点?): 这衡量了观众关心的“高价值”问题中有多少实际上在幻灯片中得到了回答。如果 CEO 想要风险分析,而 AI 只给了他们历史背景,那么这个分数就会下降。
  2. 领域覆盖度(是否选择了正确的类型?): 这进一步细分。AI 是否在观众想要“影响/意义”时,过多地关注了“方法”?这就像是在检查厨师是否提供了过多的装饰,而忽略了主菜。
  3. 效率(是否太长了?): 这在问:“我在单位时间内获得了多少有用信息?”如果幻灯片有 50 页,但其实可以用 5 页讲完,那么效率得分就很低。
  4. 正确性(是否撒谎了?): 这是安全护栏。它检查幻灯片上的每一个主张是否确实得到了原始文档的支持。这可以防止 AI 编造一些听起来很酷但并不真实的事实。

研究发现(结果)

研究人员使用这个新系统测试了三种流行的 AI 幻灯片生成器(DeepPresenter、SlideTailor 和 NotebookLM)。

  • 好消息: AI 并不糟糕。它能够抓取大量重要信息。
  • 坏消息: 它仍然没能精准对标其“对话对象”。
    • 当被要求向科学家讲话时,AI 经常遗漏深层的技术细节(即“第 3 级和第 4 级”事实)。
    • 当被要求向 CEO 讲话时,AI 有时会陷入过多的技术术语中。
    • NotebookLM(谷歌的一款工具)在为 CEO 和学生挑选正确信息方面表现得相当出色,但在处理科学家的深层技术细节方面稍显吃力。

核心启示

该论文认为,我们不能再仅仅通过说“看,这个幻灯片演示文稿多么漂亮、多么长!”来评判一个 AI。即使一个精美的演示文稿内容 100% 正确,但如果它给 CEO 展示的是一场 50 页的数学讲座,那也是失败的。

X+Slides 证明了,要构建一个真正实用的 AI 演示工具,我们不能再把所有事实都视为同等重要。我们必须教会 AI:对科学家重要的东西对 CEO 来说是毫无用处的,反之亦然。 该论文提供了一把尺子,用来衡量 AI 是否终于学会了这一课。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →