← 最新论文
💬 NLP

Beyond Questions: Evaluating What Large Language Models (Actually) Know

本文介绍了“超越问题”(BeQu),这是一种新的开放知识评估范式,它通过开放式诱导而非预设问题来评估大语言模型所自然表达的知识,从而揭示了模型在规模、推理努力等不同因素下的能力方面的重大见解。

原作者: Luca Giordano, Simon Razniewski

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Luca Giordano, Simon Razniewski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚一名学生实际上对一位著名的历史人物(例如马丁·路德·金)了解多少。

旧方法(“问答竞赛”式)
多年来,研究人员一直像严格的问答节目主持人那样测试人工智能模型。他们提出具体而狭窄的问题:“他的出生日期是什么?”或者“他的妻子是谁?”

  • 问题所在: 这就像只通过要求厨师制作烤奶酪三明治来评判一位厨师。如果这位厨师是糕点大师,但做三明治很糟糕,那么这次测试就会判定他是个糟糕的厨师。这种测试仅衡量了测验设计者想到要问的内容。如果设计者从未问及厨师最喜欢的颜色,那么人工智能对该事实的知识就依然不可见。这被称为可得性偏差

新方法(“展示与讲述”式)
这篇论文介绍了一种名为开放知识评估的新方法。与其进行问答测试,不如想象你要求人工智能:“告诉我你所知道的关于马丁·路德·金的一切。”

  • 目标: 我们不仅仅检查人工智能是否答对了某个具体问题。我们要审视它讲述的整个故事。我们要检查:
    1. 精确性: 它是否编造了事实(幻觉)?
    2. 召回率: 它是否记住了它所知道的一切,还是遗漏了重要细节?

工具:BeQu(超越问题)
为了测试这一点,作者构建了一个名为BeQu的大型游乐场。

  • 他们从维基百科中挑选了10,000 个随机事物(人物、地点、事件)。
  • 他们为每一个事物建立了一个“参考图书馆”,从维基百科和网络上收集事实。
  • 他们要求 20 种不同的人工智能模型“讲述它们所知道的关于这 10,000 件事物的所有情况”。
  • 然后,他们使用一个超级智能的人工智能裁判,将模型讲述的故事与参考图书馆进行对比,以辨别哪些是真实的,哪些是虚假的,哪些是缺失的。

他们的发现(结果)

  1. 大模型依然胜出(但开源模型正在追赶):
    将人工智能模型想象成学生。“商业”学生(付费的大型模型,如 Claude Opus)仍然获得最高分。然而,一些“开源”学生(免费模型)的得分非常接近,证明它们极具竞争力。

  2. 深入思考帮助不大:
    你可能会想:“如果我告诉人工智能在回答前‘更深入地思考’或‘进行更多推理’,它会知道得更多。”但论文发现,对于这项特定任务,这主要是一个迷思。无论人工智能是花了 1 秒还是 10 秒“思考”,它提取的事实数量并没有太大变化。知识本来就在那里,只是需要被表达出来。

  3. “严厉的老师”与“富有创造力的作家”:
    研究人员尝试强制人工智能以严格的格式回答(例如具有特定列的电子表格)。

    • 结果: 人工智能变得非常准确(高精确性),但停止分享许多事实(低召回率)。这就像一个只回答老师确切提问、拒绝添加任何额外背景的学生。
    • 相反,当允许其自由开放时,人工智能分享了更多的事实,即使它偶尔会犯一个小错误。
  4. 要求更多会得到更多(直到不再如此):
    当研究人员要求人工智能列出"5 个事实”与"100 个事实”时,收到更大请求的人工智能通常会分享更多知识。然而,如果他们逼迫人工智能列出数百个事实,它就开始为了凑足配额而编造内容(产生幻觉)。

  5. “虚构人物”测试:
    他们要求人工智能谈论不存在的事物(例如“安道尔国际机场”)。最好的模型 simply 说:“我对那件事一无所知。”而较弱的模型则开始编造虚假细节,表明它们是在猜测而非真正了解。

核心结论
这篇论文认为,我们需要停止将人工智能视为多项选择题机器。要真正理解人工智能知道什么,我们需要让它自由表达,观察它能描述多少现实世界、描述的准确度如何,以及它选择省略什么。新的"BeQu"基准是一个衡量这种“展示与讲述”能力的工具,它揭示出:虽然人工智能正变得更聪明,但它仍有许多隐藏的知识,并不总是选择分享出来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →