← 最新论文
🤖 machine learning

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

本文提出了一种针对 ChatInvent 智能体药物发现系统的符合人类对齐的 LLM-as-a-Judge 评估框架,该框架定义了特定的质量维度,通过专家标注验证并优化评判模型以实现高度对齐,并揭示了非正式措辞并不会阻碍性能表现。

原作者: Emma Granqvist, Rocío Mercado, Samuel Genheden

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Emma Granqvist, Rocío Mercado, Samuel Genheden

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在药物研发这一高风险领域,科学家们花费数年时间设计分子、在实验室中构建它们,并进行测试以观察它们是否能够治愈疾病。这个过程缓慢、昂贵且充满了复杂的决策。最近,一种新型的人工智能进入了这一领域:这些系统不仅能回答问题,还能采取行动。它们被称为“代理式系统”(agentic systems)。与仅仅生成文本的标准聊天机器人不同,一个代理可以规划多步骤的实验,调用专门的软件来计算化学性质,并从庞大的科学数据库中检索数据。它更像是一个数字研究助手,能够实际开展工作,而不仅仅是空谈。然而,随着这些数字助手变得越来越强大,一个关键问题出现了:我们如何知道它们做得好不好?传统的计算机答案评分方式通常依赖于将词汇与正确答案进行匹配,但在面对开放式和创造性的任务时,这种方式会失效。此外,要求人类专家对每一个输出结果进行评分,速度太慢,无法跟上这些新机器的步伐。科学界需要一种既快速又可靠的方式来评估这些代理。

来自阿斯利康(AstraZeneca)和哥德堡大学的研究小组通过构建一个由一个人工智能充当另一个人工智能“裁判”的系统,解决了这一挑战。他们专注于一个名为 ChatInvent 的特定工具,这是一个旨在帮助科学家应对药物开发各个阶段的代理式助手。研究人员意识到,仅仅让一个 AI 对自己进行评分是有风险的,因为这些模型可能会产生偏见或表现出不一致性。为了解决这个问题,他们设计了一个严谨的测试框架,以确保“裁判”AI 与人类专家保持一致。他们定义了衡量一个优秀答案应具备的四个特定特质:回答是否完整、信息是否与问题相关、文本是否清晰且组织良好,以及代理是否坚守其分配的角色,没有尝试去做它不该做的事情。他们还加入了一项严格的检查,以查看代理是否使用了正确的计算机工具来完成任务。

为了找到最佳的裁判,该团队测试了四种不同的强大 AI 模型,包括来自主要科技公司和开源项目的选项。他们让五位化学和人工智能领域的专家对 35 个问题及答案进行评分。这些专家获得了与 AI 裁判相同的指令和信息。随后,研究人员将人类给出的分数与每个 AI 模型给出的分数进行了对比。他们发现,虽然人类专家之间并不总是能完美达成共识,但 AI 模型表现得惊人地一致。其中一个模型表现得尤为出色,其判断与人类的多数意见高度契合。研究人员随后利用一组由人类专家标注的小型示例对这个表现最好的 AI 裁判进行了微调。这一被称为“优化”的过程提升了裁判匹配人类思维的能力,将其一致性得分从 80% 提高到了 86%。

有了可靠的裁判后,团队对 ChatInvent 系统从未见过的 70 个新问题进行了评估。结果揭示了该代理表现中的优势与不足。该系统在保持主题一致性、组织答案清晰度以及使用正确工具收集信息方面表现出色。然而,它在“完整性”方面遇到了困难。在近 40% 的案例中,该代理提供了部分答案,经常遗漏一些具体细节,例如生成文件的存放位置或请求的某种化学性质。研究人员发现,这并非因为代理误解了问题,而是因为它有时未能执行工作流中的最后一步。有趣的是,提问的方式也会产生影响。团队测试了从非常正式到非常随意的各种问题。他们发现,过于正式的措辞并不能帮助代理表现得更好;事实上,稍微非正式或中性的措辞有时反而能带来更好的结果。这表明,该代理可能会受益于拥有一个内部系统,在开始工作前,先将用户生硬或复杂的提示词重写为一个更清晰的版本。

研究结论指出,尽管这些代理式系统在加速药物研发方面具有巨大潜力,但它们目前尚不完美。研究人员证明,只要裁判经过精心调整以符合专家意见,构建一个能够模拟人类判断的稳健自动化评估系统是完全可能的。这种方法使开发人员能够快速识别代理在哪些地方失败——例如缺失文件路径或数据不完整——而无需为每一次测试都聘请一支人类评分团队。这项工作为未来提供了一份蓝图,表明如果人工智能要在科学领域真正发挥作用,我们必须首先教会它如何以人类专家所使用的那种细致与精准,来对自己完成的工作进行评分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →