← 最新论文
💻 computer science

OpenBioRQ: Unsolved Biomedical Research Questions for Agents

本文介绍了 OpenBioRQ,这是一个新颖的检索增强型智能体基准测试,包含 12,553 个未解决的生物医学研究问题,它揭示了当前模型中存在的关键失效模式——例如引用幻觉和工具崩溃——同时也证明了即使是前沿智能体在解决这些开放式、非饱和任务时也面临着巨大的困难。

原作者: Minbyul Jeong

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Minbyul Jeong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在参加一场非常困难考试的学生。在当今大多数医学考试中,老师会给你一个问题和一个隐藏的答案解析。如果你答对了,你就通过了;如果你答错了,你就不及格。但如果老师问了一个目前还没有人知道答案的问题时,会发生什么呢?当没有答案解析时,你该如何给学生评分?

这篇论文介绍了 OpenBioRQ,一种新的测试 AI “智能体”(即能够搜索互联网并阅读论文的智能计算机程序)在这些未解医学之谜上表现的方法。

以下是研究人员发现的内容,使用了简单的类比:

1. 问题所在:“伪链接”陷阱

想象一下你正在写一份报告。你提出了一个观点,比如“这种新药可以治疗头痛”,并在后面附上了一个著名医学期刊文章的链接来证明这一点。

  • 旧有的担忧: 人们曾认为 AI 会编造虚假链接(例如链接到一个不存在的网站)。
  • 新的发现: 研究人员发现,AI 其实非常擅长寻找真实的链接。它提供的几乎 100% 的链接都是可以正常访问的。
  • 真正的陷阱: AI 经常会链接到一个真实的文章,但却是错误的文章。这就像是在试图证明“香辣塔可可以治疗头痛”时,却链接到了“巧克力蛋糕”的食谱。链接是有效的,文章也确实存在,但它与你的观点毫无关系。

研究人员称之为 “错文引用”(Wrong-Paper)失败。大约有 16% 的情况下,AI 给出了一个真实的、可用的链接,但该链接完全无法支持它刚刚所说的观点。这很危险,因为它在第一眼看上去非常可靠。

2. 新的测试:“未解之谜”盒子

大多数针对 AI 的医学测试都像是填字游戏,答案是预先已知的。AI 只需要记住正确的单词即可。

  • OpenBioRQ 则不同。它就像一个装有 12,500 个未解医学之谜的盒子。
  • AI 必须扮演侦探的角色:它必须使用工具去搜索数据库、阅读数千篇论文,并尝试找出答案。
  • 因为没有答案解析,研究人员并不根据 AI 是否得到了正确答案 来评分,而是根据它的诚实度和严谨程度来评分。
    • 它是否承认:“我们目前还不知道”?(这是好事)。
    • 它是否编造了一个充满自信的答案并附带一个虚假链接?(这是坏事)。
    • 它是否找到了一个真实的链接,但该链接并不能证明它的观点?(这就是“错文引用”陷阱)。

3. “工具崩溃”(Tool Collapse)现象

研究人员给了 AI 一套“工具”(比如放大镜、图书证和搜索引擎)来帮助它解决这些谜题。

  • 他们原本预期 AI 会利用这些工具来寻找最佳证据。
  • 令人惊讶的是: 在面对最难的问题时,AI 有时会放弃使用这些工具。它停止了搜索,转而根据它在训练阶段记忆的内容进行猜测。
  • 这就像一名侦探在面对一个极其棘手的案件时,决定不再寻找线索,而是直接猜出凶犯的名字。
  • 研究人员发现,对于某些模型来说,给它们提供工具并不能帮助它们获得更高的分数。它们出现了“崩溃”现象,开始忽略那些它们本该使用的工具。

4. “清单”解决方案

如何为一个没有标准答案的测试评分?

  • 研究人员为每一个问题都创建了一个固定的清单
  • 他们不是问 AI“这是一个好的答案吗?”(这太模糊了),而是给它一个具体的检查清单,例如:
    • “你是否提到了特定的蛋白质?”
    • “你是否承认我们目前还没有治愈方法?”
    • “你是否避免了编造虚假的临床试验?”
  • 这将模糊的判断转化为了简单的“是/否”清单,使得评分更加公平且具有一致性。

5. 结果:谁通过了?

研究人员测试了几种顶尖的 AI 模型(即“前沿智能体”)。

  • 难度: 即便是最聪明的 AI 模型,也只能解决这些未解问题中的 30% 到 60%。其余的部分仍然是谜团,这正是硬核测试所需要的(这意味着测试难度适中,并非过于简单)。
  • 引用问题: 即便是最好的模型,仍会在 10%–16% 的情况下掉入“错文引用”陷阱。它们找到了真实的论文,但这些论文并不能支持它们的论点。
  • 核心启示: 仅仅因为 AI 给出了一个可以打开的链接,并不意味着信息是正确的。在医学研究领域,“存在性”并不等同于“正确性”

总结

OpenBioRQ 是一个针对医学 AI 的全新、严苛的测试。它不再询问“你知道答案吗?”,而是开始询问“你能在面对未知时保持诚实而不撒谎吗?”

主要的教训是:AI 变得非常擅长寻找真实来源,但在确保这些来源确实能证明其观点方面,它仍然表现得很差。这就像一个学生虽然能找到图书馆里的书,但总是引用错误的页面。在 AI 学会停止这种行为之前,我们无法完全信任它来总结医学研究,尤其是针对那些我们目前尚无答案的问题。

重要提示: 作者明确指出,这是一个研究工具,旨在帮助科学家了解 AI 的运作方式。它不是供医生进行临床决策的工具。你不应使用这些 AI 生成的答案来治疗病人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →