OpenBioRQ: Unsolved Biomedical Research Questions for Agents
本文介绍了 OpenBioRQ,这是一个新颖的检索增强型智能体基准测试,包含 12,553 个未解决的生物医学研究问题,它揭示了当前模型中存在的关键失效模式——例如引用幻觉和工具崩溃——同时也证明了即使是前沿智能体在解决这些开放式、非饱和任务时也面临着巨大的困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在参加一场非常困难考试的学生。在当今大多数医学考试中,老师会给你一个问题和一个隐藏的答案解析。如果你答对了,你就通过了;如果你答错了,你就不及格。但如果老师问了一个目前还没有人知道答案的问题时,会发生什么呢?当没有答案解析时,你该如何给学生评分?
这篇论文介绍了 OpenBioRQ,一种新的测试 AI “智能体”(即能够搜索互联网并阅读论文的智能计算机程序)在这些未解医学之谜上表现的方法。
以下是研究人员发现的内容,使用了简单的类比:
1. 问题所在:“伪链接”陷阱
想象一下你正在写一份报告。你提出了一个观点,比如“这种新药可以治疗头痛”,并在后面附上了一个著名医学期刊文章的链接来证明这一点。
- 旧有的担忧: 人们曾认为 AI 会编造虚假链接(例如链接到一个不存在的网站)。
- 新的发现: 研究人员发现,AI 其实非常擅长寻找真实的链接。它提供的几乎 100% 的链接都是可以正常访问的。
- 真正的陷阱: AI 经常会链接到一个真实的文章,但却是错误的文章。这就像是在试图证明“香辣塔可可以治疗头痛”时,却链接到了“巧克力蛋糕”的食谱。链接是有效的,文章也确实存在,但它与你的观点毫无关系。
研究人员称之为 “错文引用”(Wrong-Paper)失败。大约有 16% 的情况下,AI 给出了一个真实的、可用的链接,但该链接完全无法支持它刚刚所说的观点。这很危险,因为它在第一眼看上去非常可靠。
2. 新的测试:“未解之谜”盒子
大多数针对 AI 的医学测试都像是填字游戏,答案是预先已知的。AI 只需要记住正确的单词即可。
- OpenBioRQ 则不同。它就像一个装有 12,500 个未解医学之谜的盒子。
- AI 必须扮演侦探的角色:它必须使用工具去搜索数据库、阅读数千篇论文,并尝试找出答案。
- 因为没有答案解析,研究人员并不根据 AI 是否得到了正确答案 来评分,而是根据它的诚实度和严谨程度来评分。
- 它是否承认:“我们目前还不知道”?(这是好事)。
- 它是否编造了一个充满自信的答案并附带一个虚假链接?(这是坏事)。
- 它是否找到了一个真实的链接,但该链接并不能证明它的观点?(这就是“错文引用”陷阱)。
3. “工具崩溃”(Tool Collapse)现象
研究人员给了 AI 一套“工具”(比如放大镜、图书证和搜索引擎)来帮助它解决这些谜题。
- 他们原本预期 AI 会利用这些工具来寻找最佳证据。
- 令人惊讶的是: 在面对最难的问题时,AI 有时会放弃使用这些工具。它停止了搜索,转而根据它在训练阶段记忆的内容进行猜测。
- 这就像一名侦探在面对一个极其棘手的案件时,决定不再寻找线索,而是直接猜出凶犯的名字。
- 研究人员发现,对于某些模型来说,给它们提供工具并不能帮助它们获得更高的分数。它们出现了“崩溃”现象,开始忽略那些它们本该使用的工具。
4. “清单”解决方案
如何为一个没有标准答案的测试评分?
- 研究人员为每一个问题都创建了一个固定的清单。
- 他们不是问 AI“这是一个好的答案吗?”(这太模糊了),而是给它一个具体的检查清单,例如:
- “你是否提到了特定的蛋白质?”
- “你是否承认我们目前还没有治愈方法?”
- “你是否避免了编造虚假的临床试验?”
- 这将模糊的判断转化为了简单的“是/否”清单,使得评分更加公平且具有一致性。
5. 结果:谁通过了?
研究人员测试了几种顶尖的 AI 模型(即“前沿智能体”)。
- 难度: 即便是最聪明的 AI 模型,也只能解决这些未解问题中的 30% 到 60%。其余的部分仍然是谜团,这正是硬核测试所需要的(这意味着测试难度适中,并非过于简单)。
- 引用问题: 即便是最好的模型,仍会在 10%–16% 的情况下掉入“错文引用”陷阱。它们找到了真实的论文,但这些论文并不能支持它们的论点。
- 核心启示: 仅仅因为 AI 给出了一个可以打开的链接,并不意味着信息是正确的。在医学研究领域,“存在性”并不等同于“正确性”。
总结
OpenBioRQ 是一个针对医学 AI 的全新、严苛的测试。它不再询问“你知道答案吗?”,而是开始询问“你能在面对未知时保持诚实而不撒谎吗?”
主要的教训是:AI 变得非常擅长寻找真实来源,但在确保这些来源确实能证明其观点方面,它仍然表现得很差。这就像一个学生虽然能找到图书馆里的书,但总是引用错误的页面。在 AI 学会停止这种行为之前,我们无法完全信任它来总结医学研究,尤其是针对那些我们目前尚无答案的问题。
重要提示: 作者明确指出,这是一个研究工具,旨在帮助科学家了解 AI 的运作方式。它不是供医生进行临床决策的工具。你不应使用这些 AI 生成的答案来治疗病人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。