← 最新论文
💬 NLP

Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries

这项研究表明,一种人机协同的 AI 智能体可以有效地为临床学者自动完成转化影响摘要的收集与起草工作,在保持高准确度并捕捉常规流程中常被遗漏的非学术证据的同时,将每位学者的报告工作量从估计的 15 小时缩减至 14 分钟。

原作者: Mohammad Arvan, Amber E. Osterholt, Bailee Rue, Yuvaneswaren Ramakrishnan Sureshbabu, Krishna Riteshkumar Patel, Rebecca T. Feinstein, Bethany C. Bray, Niranjan S. Karnik

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammad Arvan, Amber E. Osterholt, Bailee Rue, Yuvaneswaren Ramakrishnan Sureshbabu, Krishna Riteshkumar Patel, Rebecca T. Feinstein, Bethany C. Bray, Niranjan S. Karnik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,医学研究的世界就像一座巨大且繁忙的图书馆,科学家们在这里不断撰写关于如何治愈疾病、帮助社区和节省开支的新书。但问题在于:图书管理员(管理这些研究项目的人)面临着一项极其艰巨且几乎不可能完成的任务。他们需要证明图书馆里的每一位科学家是否真的对现实世界产生了影响,而不仅仅是写了一些华丽的论文。通常情况下,为了做到这一点,图书管理员需要为每位科学家花费大约15个小时,在互联网上搜寻、查阅资助记录并阅读新闻文章,只为写下一句关于其功绩的总结。这就像是在草堆里寻找一根特定的针,然后还要亲手为这根针写一首诗。如果一位科学家搬到了新城市或更换了工作,图书管理员就必须重新开始搜索。这既缓慢又令人精疲力竭,当需要追踪数百名科学家时,这种方法根本行不通。

这正是另一种新型助手发挥作用的地方:AI智能体(AI agent)。请不要把这个AI仅仅看作一个无所不知的魔法机器人,而要把它看作一名超快、不知疲倦的研究实习生。这个实习生可以在几秒钟内扫描数千个网站、数据库和新闻源,收集关于一位科学家成就的线索。但转折点在于:AI不被允许直接提交最终报告。相反,它扮演的是初稿撰写者的角色。它收集所有证据,并起草一份“影响力总结”的初稿。然后,人类图书管理员会介入进行审核。人类不需要从零开始;他们只需要阅读AI的草稿,修正一些错误,然后说:“是的,这是事实”或者“不,这是错的”。这个大问题在于:这种“人机协作”的团队能否比单纯依靠人类完成得更快、更好?

超级实习生的故事

在这项研究中,伊利诺伊大学芝加哥分校的研究人员构建了这个“超级实习生”AI智能体,并将其投入到现实场景中使用。他们对10位参与特殊职业发展计划的科学家(称为“学者”)进行了测试。目标是观察AI是否能够收集证据并撰写其影响力总结的初稿,从而将人类工作人员从那可怕的15小时马拉松中解救出来。

这个AI智能体像一名带着特定工具的侦探一样工作。它从一个“种子”(仅包含科学家的姓名和工作单位)开始,然后在互联网上展开一场“疯狂的追逐”。它检查官方医学数据库,查看资助记录,扫描新闻网站,甚至挖掘政策文件。它并不止步于那些容易获取的信息;它还会尝试寻找“非学术性”的证据,例如科学家如何帮助当地社区或影响了一项新法律。一旦收集齐所有线索,它会将这些信息整理成一个整洁的文件(“档案”),并为每项发现写下一句简短的总结,解释其具体是如何造福世界的。

但AI并没有被完全放任自流。两名身为该领域专家的真人工作人员充当了编辑。他们会查看AI发现的每一项内容。对于每一项发现,他们有三个选择:

  1. 接受: “完美!完全正确。”
  2. 编辑: “接近了,但请修正这个细节。”
  3. 拒绝: “不对,这不准确或不重要。”

他们也有权添加AI遗漏的内容,尽管AI的设计初衷是如此彻底,以至于很少会有遗漏。

他们的发现

结果非常令人兴奋。人类编辑发现,AI发现的内容中有 81.7% 是可以直接使用或仅需微调的。这意味着对于AI发现的每100件事,人类保留了82件。这意义重大,因为这意味着AI完成了繁重的搜集工作。

这里是最重要的一部分:时间。

  • 之前: 一名人类工作人员估计,从头开始构建一位科学家的影响力记录需要 15小时
  • 之后: 有了AI撰写初稿,人类工作人员每位科学家仅需中位数 14分钟 即可完成审核和修正工作。

这是一个巨大的转变!人类从“猎人与作者”变成了“编辑与审核员”。他们不再需要花费数小时去搜索,而只需花费几分钟来核实AI的工作。

AI在寻找正确的人选方面也表现得相当出色。在一次侧面测试中,AI寻找科学家主页面的能力几乎与人类手动搜索不相上下。它找到正确人物的概率约为82%,表现得就像人类一样。

小瑕疵与规则

当然,AI并非完美无缺。大约有18%的时间,人类不得不拒绝某项发现。原因如下:

  • 来源薄弱: 有时AI会在不太可靠的网站(如随机的目录页面而非官方新闻网站)上找到信息。
  • 非影响力事件: 有时AI找到了科学家做过的事,但这并不属于真正的“重大影响”(例如,科学家做了一场演讲,这很好,但可能不算是一项救命的发现)。
  • 找错人: 偶尔,AI会将名字相似的两个人搞混。

人类必须运用自己的判断力来决定一项发现是否“足够好”。论文指出,AI的设计是“慷慨的”——它会发现过多的内容,以便人类可以剔除其中的坏部分,而不是让AI错过好的内容。这是一种聪明的策略,因为修改一份长长的清单比寻找遗漏的部分要容易得多。

结论

这篇论文表明,人机协作的团队可以共同解决此前因速度太慢而无法处理的问题。AI作为第一轮作者,承担了枯燥、耗时的搜索和起草工作。随后,人类介入进行事实核实并做出最终裁决。

这项研究并未证明AI是完美的,或者它可以完全取代人类。事实上,论文认为人类的判断力仍然绝对必要,因为AI可能会在来源或理解何为“真实影响”方面出错。但研究显示,通过这种新的分工模式,追踪一整组科学家的影响力变得切实可行。与其每人花费15小时,现在工作人员只需几分钟即可完成,这使得追踪科学家对科学和社会贡献的记录变得可行。这就像是从自行车升级到了带电动机的自行车:你仍然需要转向和踩踏,但你会到达得更快、更远。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →