LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?
本文揭示,当前基于大语言模型的搜索代理往往依赖其内在知识而非真实的网络搜索,为此提出了 LiveBrowseComp,这是一个利用近期非显著事实的动态基准,旨在有效评估真正基于证据的发现能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和富有创意的类比,对论文《LiveBrowseComp:搜索代理究竟是在搜索,还是仅仅在验证它们已知的内容?》的解释。
核心问题:它们是在探索,还是仅仅在检查作业?
想象一下,你雇佣了一位超级聪明的侦探(一个 AI 代理)去寻找一个具体而冷门的知识点。你给了它一张图书馆卡(互联网访问权限),并告诉它:“去找到答案。”
这篇论文提出了一个令人怀疑的问题:这位侦探是真的在图书馆里搜索新信息,还是仅仅打开了一本它早已背熟的书,在脑海中找到答案,然后只利用图书馆卡来说一句:“看吧?我早就告诉过你是对的”?
作者将这种行为称为内在知识依赖(Intrinsic Knowledge Dependence, IKD)。这就像一个学生已经背熟了练习题的答案。当参加正式考试时,它不需要学习;它只需写下记忆中的内容,并利用“开卷”规则来双重确认自己的记忆是否正确。
当前测试的缺陷(“静态”基准)
目前,我们使用“静态基准”(如 BrowseComp)来测试这些 AI 侦探。你可以把它们想象成陈旧、积灰的常识问答测验。
- 问题所在: 因为这些测验存在已久,AI 模型很可能在训练期间就已经“阅读”过这些问题了。
- 结果: AI 获得了高分,但这并非因为它擅长搜索,而是因为它擅长记忆。它从记忆中猜测答案,然后仅仅利用互联网来增强信心。
三个“测谎仪”测试
为了证实他们的怀疑,研究人员在现有的 AI 模型上进行了三个简单的实验:
- “无工具”测试: 他们移除了互联网。
- 结果: AI 仍然答对了大约 44% 的问题。这证明它们依赖的是内部记忆,而非搜索工具。
- “破损图书馆”测试: 他们允许 AI 使用互联网,但秘密地移除了所有包含正确答案的页面。AI 只能看到无关的垃圾信息。
- 结果: AI 的分数暴跌。它们没有忽略垃圾信息并坚持依靠记忆,而是变得困惑并给出了错误答案。这表明它们并非利用搜索来发现真相,而是利用它来确认自己已经猜测的内容。
- “线索追踪”测试: 他们观察了 AI 的搜索历史。
- 结果: 他们发现,AI 提出的搜索问题中,超过 50% 是基于它自己的猜测,而非基于它在网络上实际找到的内容。它只是在追逐自己的尾巴。
解决方案:引入"LiveBrowseComp"
为了解决这个问题,研究人员构建了一个名为 LiveBrowseComp 的新测试。
类比:
如果旧的测试就像去年的 《危险边缘》(Jeopardy!) 节目(AI 可能已经在电视上看过),那么新测试就像正在此时此刻发生的现场新闻直播。
- 新鲜度: 问题基于过去 90 天内发布的事实。AI 不可能背下这些内容,因为在 AI“出生”(训练)时,这些事实还不存在。
- 冷门性: 这些事实不是著名的头条新闻(比如“谁赢得了超级碗?”)。它们是“长尾”事实,例如“三周前秘鲁某小镇发生的具体地震震级是多少?”或者“昨天发布的一款小众电子游戏叫什么名字?”
- 目标: 迫使 AI 真正去搜寻信息,而不是仅仅依靠记忆猜测。
运行新测试后发生了什么?
结果令人震惊:
- 记忆失效: 当 AI 尝试在不使用互联网(闭卷)的情况下回答这些新问题,其得分降至 2% 以下。对于这些新鲜事实,它们几乎一无所知。
- 搜索得分下降: 即使允许使用互联网,与旧测试相比,AI 的得分也下降了 25–40 分。
- 排名变化: 在旧测试中凭借良好记忆成为“赢家”的 AI 模型,在新测试中突然变得平庸甚至糟糕。而那些真正擅长搜索的模型则跃居榜首。
与人类的对比
研究人员还让真实的人类来解答这些问题。
- 发现: 人类解决“旧”问题和“新”问题所花费的时间大致相同。
- 含义: 新问题并不“更难”或“更聪明”。它们仅仅是新的。AI 之所以挣扎,唯一的原因就是它无法依赖记忆的捷径。
核心结论
该论文得出结论:当前的 AI 评估存在缺陷,因为它们奖励的是记忆,而非搜索。
- 旧方式: “你能猜出答案,然后找到一个网站来支持它吗?”(AI 得 A)。
- 新方式(LiveBrowseComp): “你能找到一个你从未见过的答案吗?”(AI 得 F)。
作者认为,要真正测试一个 AI 是否是一个优秀的“搜索代理”,我们必须测试那些它原本不知道的事物,迫使它进行艰难的发现工作,而不仅仅是验证。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。