← 最新论文
💬 NLP

SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

本文介绍了 SAGE,这是一个搜索增强型框架,它通过主动检索并综合外部证据,来评估大语言模型在自由形式问题上的事实性,为静态基于参考资料的方法或不可靠的 LLM-as-a-judge 评估方法提供了一种可扩展且具适应性的替代方案。

原作者: Sher Badshah, Ali Emami, Hassan Sajjad

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Sher Badshah, Ali Emami, Hassan Sajjad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

论文解析:SAGE —— 基于搜索增强的大语言模型自由格式问答评估

问题所在:“只会纸上谈兵”的学生

想象一下,你有一个非常聪明的学生(即大语言模型,简称 LLM)正在参加考试。老师问了一个刁钻的问题,比如:“谁演唱了剧集《Half & Half》的主题曲?”

学生回答道:“Erica Campbell。”

现在,你该如何评分呢?

  1. 旧方法(词法匹配): 你寻找与预设答案库的精确匹配。如果学生写的是“Erica Campbell”,而答案库里是“Melonie Daniels”,即使学生是对的,你也会判错。如果学生写了一段优美且长篇大论的文字,意思虽然一样但用词不同,你可能会漏掉正确答案。这就像是在批改数学卷子时,只盯着数字“42”看,却忽略了“Forty-Two”这个词。
  2. “裁判”法(以 LLM 作为裁判): 你请另一位聪明的学生来给第一个学生评分。但问题在于:这位第二个学生也只是根据他在学校里背诵的内容在进行猜测。如果第一个学生撒谎了,第二个学生可能会相信他,因为他们学习的是同样过时的事实。甚至,第二个学生为了让自己显得很聪明,还会编造一个理由来解释为什么那个谎言是正确的。这就像是请一个考试不及格的学生来给标准答案评分。

核心问题: 对于开放式问题,我们无法为每一种可能的答案都编写一份答案库。而让一个不进行任何查证的 AI 来给另一个 AI 评分是不可靠的,因为 AI 可能会自信地犯错,或者受限于陈旧的信息。

解决方案:SAGE(“侦探”框架)

作者提出了 SAGE(搜索增强评估)。SAGE 不再依赖记忆或静态的答案库,而是将“裁判”变成了一名侦探

想象一名正在试图破案的侦探。他们不会仅仅靠直觉猜测;他们会外出搜集线索、核对笔记,并不断提出新问题,直到确定真相为止。

以下是 SSage 的工作步骤:

  1. 初始线索(查询生成): 侦探(SAGE)观察问题和学生的答案。它不会直接接受答案,而是会思考:“我该如何证明这一点?”并写下一个搜索查询,例如“谁演唱了 Half & Half 的主题曲?”
  2. 收集证据(网络搜索): 侦探前往图书馆(互联网),并取出三本书(搜索结果)。
  3. 总结线索(摘要生成): 侦探阅读这些书并写下一份简短的摘要:“书 1 说 Melonie Daniels。书 2 也说 Melonie Daniels。”
  4. “等一下”时刻(反思): 这是最关键的部分。侦探对比了学生的答案(“Erica Campbell”)和新发现的证据(“Melonie Daniels”)。侦探心想:“这两者不匹配。学生错了。但是等等,是否有其他来源?也许我需要专门搜索一下‘Erica Campbell’,以确保万无一失。”
  5. 优化搜索: 由于证据存在冲突或不完整,侦探会写出一个更精准、更好的搜索查询,以进行深度挖掘。
  6. 最终裁决: 在完成这个循环几次(通常为三次)后,侦探会汇总所有的笔记,并做出最终决定:正确错误,并附上原因说明。

为什么这种方法更好

论文声称 SAGE 表现更优越,主要基于三个原因:

  • 它不仅仅是记忆: 与仅依赖记忆的“裁判”不同,SAGE 会外出寻找最新的事实。如果世界在 AI 训练之后发生了变化(比如新建了一栋大楼或发布了一首新歌),SAGE 能找到最新的信息。
  • 它能识破谎言: 如果学生捏造了一个事实,SAGE 会去搜索它,发现找不到相关证据,从而标记出来。没有搜索功能的“裁判”往往会落入这些谎言,因为这些谎言听起来很有道理。
  • 它能处理歧义: 有些问题很棘手(例如,“这家医院什么时候开业的?”可能指原始开业时间,也可能指装修后的重新开业)。SAGE 的“反思”步骤能帮助它意识到自己可能在看错误的时间,从而提出更好的问题来进行澄清。

结果:侦探胜出

研究人员在多个数据集(如常识问答和复杂推理问题)上对 SAGE 进行了测试。他们将 SAGE 与以下对象进行了对比:

  • 标准评分:(精确匹配/F1 分数)
  • “仅凭记忆”的裁判:(不进行搜索的 AI 评分)
  • 人类专家:(真人评分)

研究发现:

  • SAGE vs. 人类: SAGE 与人类专家的意见几乎完全一致(具有高度一致性或完美一致性)。
  • SAGE vs. 仅凭记忆的裁判: 仅凭记忆的裁判经常出错,甚至在学生撒谎时仍与其保持一致。SAGE 通过核实事实解决了这个问题。
  • 成本: 虽然 SAGE 耗时稍长(每个问题约 27 秒),且每题产生极少量的费用(约 0.004 美元),但与雇佣人类来批改每一份答案相比,它的成本仍然低了数千倍。

局限性(侦探也会卡壳的地方)

论文承认 SAGE 并非万能。它在以下情况下仍可能失败:

  • 问题过于模糊: 如果问题本身很混乱,侦探可能会提出错误的问题。
  • “图书馆”是空的: 如果答案涉及的是极其近期、且尚未在网上有相关记载的事件,侦探将无法找到证据。
  • 线索冲突: 有时互联网会给出两个不同的答案,侦探可能会感到困惑并选错。
  • 侦探的大脑: SAGE 仍然需要一个聪明的“裁判”模型来进行思考。如果“裁判”本身不够聪明,SAGE 就无法发挥作用。

总结类比

把评估 AI 的回答想象成在派对上核实一个传闻。

  • 旧方法: 你检查一份宾客名单(静态答案库)。如果名字不在上面,你就说“不是”。
  • 仅凭记忆的裁判: 你问另一位宾客:“你听说过吗?”对方说:“嗯,我觉得是。”因为他们想表现得乐于助人,即便他们其实并不确定。
  • SAGE: 你拿起电话,打给三个不同的人,查看他们的短信,对比彼此的笔记,然后决定这个传闻是否属实。如果前三个人提供的说法互相矛盾,你甚至会再次回访。

论文表明,这种“打电话核实”的方法(SAGE)比单纯靠猜测或查表要准确得多,并且其判断结果非常接近人类的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →