← 最新论文
💬 NLP

Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness

本文介绍了 GAMUT,这是一个新颖的基准测试和两级元评分标准框架,旨在通过将结构化内容需求转化为机器可评分的检查清单,来评估长篇开放式生成的的事实完整性,并揭示了当前的尖端模型在跨越多样且有证据支持的领域实现全面覆盖方面仍面临困难。

原作者: Xilun Chen, Zhaleh Feizollahi, Ross Goodwin, Seungwhan Moon, Scott Yih, Pinar Donmez, Babak Damavandi, Luna Dong

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Xilun Chen, Zhaleh Feizollahi, Ross Goodwin, Seungwhan Moon, Scott Yih, Pinar Donmez, Babak Damavandi, Luna Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

追求完整的答案

想象一下,你正在教一个机器人成为一名得力的助手。你不仅希望它避免撒谎,更希望它能真正发挥作用。在人工智能的世界里,这就是**精确度(Precision)召回率(Recall)**之间的区别。把“精确度”想象成一位严厉的老师,只有当你写错东西时,她才会给你打上红色的“X”。如果你说“天空是绿色的”,老师会判定错误。但如果你说“天空是蓝色的”,老师会给你一颗金星,即便你忘了提到天空也是蓝中带白云,或者在日落时会变换颜色。这就是精确度:检查你所说出的内容是否真实。

现在,把召回率想象成另一种类型的老师,她会问:“你把关于天空的所有知识都告诉我了吗?”如果你只说了“天空是蓝色的”,这位老师可能会说:“这没错,但你漏掉了云朵和日落。你没有给我一个完整的画面。”长期以来,AI研究人员在第一种老师(精确度)方面表现出色,确保机器人不会产生虚假事实的幻觉。但他们在应对第二种老师(召烈率)时却遇到了困难。他们一直缺乏一种好的方法来衡量机器人的回答是否具有“完整性”,尤其是当答案不仅仅是一个事实列表,而是一个包含步骤、关系和开放式细节的复杂故事时。这篇论文填补了这一空白,提出了这样一个问题:“我们如何评价一个 AI,不仅看它是否正确,还要看它是否详尽?”

走进 GAMUT:“你漏掉了什么吗?”测试

Meta AI 的研究人员构建了一个名为 GAMUT(基于多模态事实性的评估)的新基准测试。把 GAMUT 想象成一场极具挑战性的益智游戏,旨在测试 AI 究竟是一个“深度研究员”还是仅仅一个“事实复读机”。

以下是设定:想象你戴着一副智能眼镜。你看到面包店里一个奇特的、带有碎屑的糕点,或者一个奇怪的汽车引擎,或者一种特定的植物。你问你的眼镜:“这是什么,它是怎么制作出来的?”AI 必须观察图片,去互联网上搜寻信息,从多个来源挖掘资料,然后写出一个长篇且详细的答案。

以往测试的问题在于,它们将答案视为简单的清单。它们会问:“你提到大米了吗?”是的。“你提到西红柿了吗?”是的。“通过!”但现实生活并非平铺直叙的列表。有时你需要知道步骤的顺序(你不能在洗米之前就去炒米)。有时你需要知道存在许多有效的成分,而你只需要列出足够多的成分来提供帮助,而不是列出世上所有的成分。有时你需要解释某事为什么会发生,将两个事实联系在一起。简单的“是/否”清单无法捕捉这些细微差别。

两层结构的魔力
为了解决这个问题,作者发明了一个巧妙的两步评分系统,他们称之为两层元量表(Two-Level Meta-Rubric)

  1. 第一层:总体计划(元量表)。 首先,人类专家(在智能 AI 的辅助下)创建一个关于完美答案的详细“总体计划”。这个计划不仅仅是一个列表,它是一个结构化的地图。它会说:“好吧,对于这个问题,你必须识别出这道菜(关键要素)。你必须列出核心配料(关键要素)。你应该至少提到以下可选香料中的两种(灵活要素)。并且你必须按正确的顺序描述烹饪步骤(过程)。”这一层捕捉到了一个优秀答案中复杂且混乱的现实情况。
  2. 第二层:清单(二元量表)。 这是一个技巧。随后,计算机会将那个复杂的“总体计划”机械地转化为一个长长的、扁平的、由简单的“通过/失败”问题组成的列表,以便机器人裁判能够轻松评分。它将“你需要涵盖足够的可选香料”转化为一个具体的检查项:“是否提到了这 6 种特定香料中的至少 2 种?”它将“按顺序进行步骤”转化为一个检查项:“是在‘炒’之前还是在‘炖’之前?”

通过这种方式,人类可以设计出丰富、细腻的测试,但评分工作则由机器人通过勾选简单的方框来完成,这比要求一个机器人去“猜测”一个答案的感觉要更加可靠和一致。

游戏规则:1,813 个问题与真实图像

团队构建了一个包含 1,813 个问题 的庞大数据集,名为 GAMUT。这些问题并非凭空捏造,而是基于人们佩戴智能眼镜拍摄的真实照片。照片展示了日常生活中的事物:一种特定款式的鞋子、一个当地的地标、一种奇怪的蔬菜或一个汽车零件。这些问题的设计初衷是“日常深度研究”——即一个好奇的人在看到某物时会实际提出的问题,但这些问题需要深入挖掘互联网才能得到完整的回答。

他们在该基准测试上测试了 14 种不同的 AI 模型(包括科技巨头的大型模型和开源模型)。结果令人警醒。

研究发现:

  • 难度很大。 即便是最聪明的模型 Gemini 3.1 Pro,也只得到了 58.7% 的分数。这在高中水平中仅仅是勉强及格!这意味着世界上最优秀的 AI 在提供完整信息方面仍有巨大的缺口。
  • 缺失 vs. 错误。 最大的问题不是 AI 在撒谎(矛盾于事实),最大的问题是遗漏(Omission)。模型们跳过了重要的细节。它们就像是在老师要求写一本书时却只写了一篇短文的学生。它们掌握了主要事实(精确度),但没有给出完整的故事(完整性)。
  • “视觉”的税收。 研究人员还测试了在没有图片(仅有文本)的情况下模型的表现。在这种情况下,所有模型的得分都上升了约 10 到 20 分。这表明,部分难度来自于“看清”物体的过程。但即使在移除视觉部分后,模型仍然存在知识缺口。模型的排名保持不变,这证明了该测试衡量的是 AI 的“知识量”,而不仅仅是它的“视觉能力”。
  • 鲁棒性。 他们使用三种不同的“裁判”AI 测试了结果。无论谁在进行评分,排名都保持一致,这意味着该测试是公平且可靠的。

为什么这很重要

这篇论文并不仅仅是在说“AI 正在变得更好”。它是在说:“我们有了衡量 AI 是否真正有用的新方法。”通过从简单的“这个事实是否正确?”转向“你是否覆盖了整个主题?”的检查,GAMUT 揭示了即使是最先进的模型,也常常“只见树木,不见森林”。它们可以告诉你一个事实是真的,但它们经常忘记告诉你整个故事。

作者认为,为了让 AI 在我们的日常生活中成为真正有用的助手——帮助我们烹饪、修理物品或了解世界——它需要掌握事实完整性(Factual Completeness)。GAMUT 为我们提供了衡量这种进步的尺子,而目前的进度显示,我们还有很长的路要走。目前最好的模型也只完成了大约 60%,这为下一代 AI 学习如何变得真正详尽留下了充足的空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →