AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation
本文表明,在药物资产估值中,虽然推理支架能提高人工智能代理的校准度和自律性,但专有证据的可获得性才是决定事实准确性和决策效用上限的决定性限制因素。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一支侦探团队来解决一个复杂的案件:一项新的药物构想是否值得投入数百万美元进行投资?
为了回答这个问题,侦探需要了解三件事:
- 科学性: 生物学原理是否成立?
- 竞争对手: 还有谁也在尝试做这件事?
- 历史背景: 此前是否有类似的药物成功或失败过?
你提供的这篇论文是对三种不同类型的 AI 侦探进行的“压力测试”,旨在看看哪一个才是解决此案的最佳人选。研究人员想要弄清楚:是侦探的智能(AI 模型)最重要,还是他们被允许阅读的证据质量才是真正的瓶颈?
以下是实验的分解以及他们的发现,使用了简单的类比。
三位侦探(实验设计)
研究人员设置了三个版本的 AI 智能体,它们都使用完全相同的“大脑”(相同的底层 AI 模型)。唯一的区别在于它们可以使用哪些工具和信息。
- 侦探 A(“冲浪者”):
- 工具: 只能使用标准的网络搜索(如 Google),没有特殊训练。
- 类比: 这是一个聪明的实习生,去公共图书馆阅读开放书架上的任何书籍。他们很聪明,但只能找到其他人能找到的东西。
- 侦探 B(“受训分析师”):
- 工具: 拥有同样的网络访问权限,但获得了一套严格的剧本(一份规则清单)、一个“红队”(用于检查其工作的批评者)以及访问公共数据库(如临床试验注册库)的权限。
- 类比: 这还是同一个实习生,但现在有一位资深导师在提供一份清单、一本编写报告的规则手册,并可以访问公共政府记录。他们更有纪律且更有条理,但仍然无法看到“秘密文件”。
- 侦探 C(“内幕人士”):
- 工具: 拥有侦探 B 的所有工具,外加访问一个庞大的私人付费数据库(Noah AI)的权限,该数据库包含经过人工筛选的药物试验、交易和竞争对手记录,这些信息在公开网络上是隐藏的。
- 类比: 这是资深调查员,他们拥有进入机密保险库的钥匙。他们可以看到私人邮件、未发表的试验结果以及从未出现在新闻中的“长尾”交易。
结果:他们发现了什么?
研究人员在 13 个不同的药物案例上测试了这些侦探。以下是判决结果:
1. “剧本”有帮助,但作用有限(侦探 B 对比 A)
当侦探 B(受训分析师)与侦探 A(冲浪者)进行比较时,结果很有趣:
- 更好的纪律性: 侦探 B 撰写的报告更好。他们不太可能做出荒唐的猜测,并且更严格地遵守规则。
- 问题所在: 侦探 B 仍然遗漏了 60% 到 75% 的重要竞争对手和交易。
- 类比: 想象侦探 B 是一个非常礼貌、有条理的图书管理员,遵循每一条规则。但如果他们要找的书锁在私人保险库里,再好的组织能力也无法帮他们找到那本书。他们是“经过校准的”(思考清晰),但也是“盲目的”(缺失事实)。
2. “私人保险库”改变了一切(侦探 C)
当侦探 C(内幕人士)介入时,结果发生了戏剧性的变化:
- 完整性: 侦探 C 找到了 96% 的关键信息。而侦探 A 和 B 仅找到了约 25% 到 38%。
- “长尾”效应: 最大的差距在于寻找“长尾”数据——即那些从未出现在公开网络上的小型、偏僻或区域性的药物试验。侦探 C 几乎找到了所有此类数据;而其他两人几乎一个也没找到。
- 类比: 侦探 C 不仅仅是写了一份更好的报告;他们看到了整个棋局。当其他人在只拿着一半棋子的棋盘上玩国际象棋时,侦探 C 看到了整场比赛。
3. “知情决策”得分
这是最重要的发现。
- 原始质量: 如果你在不知道缺失了哪些事实的情况下直接阅读最终报告,侦探 A 和 B 听起来几乎和侦探 C 一样好。他们听起来既自信又合乎逻辑。
- 真实质量: 但因为 A 和 B 遗漏了大量事实,他们的决策是基于不完整信息的。
- 数学计算: 研究人员创建了一个名为**“知情决策质量”**的评分。
- 侦探 A/B 得分:~2.0(他们听起来不错,但遗漏了 75% 的事实)。
- 侦探 C 得分:~7.4(他们听起来不错,并且掌握了所有的事实)。
- 天花板: 论文指出,即使你给侦探 B 一个“完美”的大脑和一份完美的报告,他们的得分仍会被限制在一个较低的水平,因为他们物理上无法接触到缺失的证据。你无法通过推理来抵达一个你无法看见的真相。
核心启示
论文得出了一个关于构建 AI 科学家的简单教训:
“技能和数据都有用,但数据是极限。”
- 推理技能(剧本): 这些是必要的。它们能阻止 AI 变得鲁莽,帮助它组织思路,并确保它遵循规则。它们让 AI 成为一个更好的作者和更有纪律的思想者。
- 证据基质(数据): 这是限制因素。如果 AI 没有权限访问私有的、经过筛选的“长尾”数据,它就真的无法得知完整的真相。任何巧妙的提示词或推理技巧都无法填补信息缺失造成的鸿沟。
简而言之: 你可以拥有世界上最聪明的侦探和最好的规则手册,但如果他们不被允许进入证据室,他们永远无法正确破案。为了让 AI 在药物研发等高风险领域真正发挥作用,它需要接触到私有的、经过筛选的证据,而不仅仅是公开的网络信息。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。