✨ 要点🔬 技术摘要
在药物研发这一高风险领域,科学家们花费数年时间设计分子、在实验室中构建它们,并进行测试以观察它们是否能够治愈疾病。这个过程缓慢、昂贵且充满了复杂的决策。最近,一种新型的人工智能进入了这一领域:这些系统不仅能回答问题,还能采取行动。它们被称为“代理式系统”(agentic systems)。与仅仅生成文本的标准聊天机器人不同,一个代理可以规划多步骤的实验,调用专门的软件来计算化学性质,并从庞大的科学数据库中检索数据。它更像是一个数字研究助手,能够实际开展工作,而不仅仅是空谈。然而,随着这些数字助手变得越来越强大,一个关键问题出现了:我们如何知道它们做得好不好?传统的计算机答案评分方式通常依赖于将词汇与正确答案进行匹配,但在面对开放式和创造性的任务时,这种方式会失效。此外,要求人类专家对每一个输出结果进行评分,速度太慢,无法跟上这些新机器的步伐。科学界需要一种既快速又可靠的方式来评估这些代理。
来自阿斯利康(AstraZeneca)和哥德堡大学的研究小组通过构建一个由一个人工智能充当另一个人工智能“裁判”的系统,解决了这一挑战。他们专注于一个名为 ChatInvent 的特定工具,这是一个旨在帮助科学家应对药物开发各个阶段的代理式助手。研究人员意识到,仅仅让一个 AI 对自己进行评分是有风险的,因为这些模型可能会产生偏见或表现出不一致性。为了解决这个问题,他们设计了一个严谨的测试框架,以确保“裁判”AI 与人类专家保持一致。他们定义了衡量一个优秀答案应具备的四个特定特质:回答是否完整、信息是否与问题相关、文本是否清晰且组织良好,以及代理是否坚守其分配的角色,没有尝试去做它不该做的事情。他们还加入了一项严格的检查,以查看代理是否使用了正确的计算机工具来完成任务。
为了找到最佳的裁判,该团队测试了四种不同的强大 AI 模型,包括来自主要科技公司和开源项目的选项。他们让五位化学和人工智能领域的专家对 35 个问题及答案进行评分。这些专家获得了与 AI 裁判相同的指令和信息。随后,研究人员将人类给出的分数与每个 AI 模型给出的分数进行了对比。他们发现,虽然人类专家之间并不总是能完美达成共识,但 AI 模型表现得惊人地一致。其中一个模型表现得尤为出色,其判断与人类的多数意见高度契合。研究人员随后利用一组由人类专家标注的小型示例对这个表现最好的 AI 裁判进行了微调。这一被称为“优化”的过程提升了裁判匹配人类思维的能力,将其一致性得分从 80% 提高到了 86%。
有了可靠的裁判后,团队对 ChatInvent 系统从未见过的 70 个新问题进行了评估。结果揭示了该代理表现中的优势与不足。该系统在保持主题一致性、组织答案清晰度以及使用正确工具收集信息方面表现出色。然而,它在“完整性”方面遇到了困难。在近 40% 的案例中,该代理提供了部分答案,经常遗漏一些具体细节,例如生成文件的存放位置或请求的某种化学性质。研究人员发现,这并非因为代理误解了问题,而是因为它有时未能执行工作流中的最后一步。有趣的是,提问的方式也会产生影响。团队测试了从非常正式到非常随意的各种问题。他们发现,过于正式的措辞并不能帮助代理表现得更好;事实上,稍微非正式或中性的措辞有时反而能带来更好的结果。这表明,该代理可能会受益于拥有一个内部系统,在开始工作前,先将用户生硬或复杂的提示词重写为一个更清晰的版本。
研究结论指出,尽管这些代理式系统在加速药物研发方面具有巨大潜力,但它们目前尚不完美。研究人员证明,只要裁判经过精心调整以符合专家意见,构建一个能够模拟人类判断的稳健自动化评估系统是完全可能的。这种方法使开发人员能够快速识别代理在哪些地方失败——例如缺失文件路径或数据不完整——而无需为每一次测试都聘请一支人类评分团队。这项工作为未来提供了一份蓝图,表明如果人工智能要在科学领域真正发挥作用,我们必须首先教会它如何以人类专家所使用的那种细致与精准,来对自己完成的工作进行评分。
技术摘要:通过人类对齐设计用于药物发现中智能体 AI 的鲁棒性 LLM 评估系统
问题陈述
基于智能体的语言大模型(LLM)系统正通过集成外部工具和数据库,日益广泛地编排化学与药物发现领域的科学工作流。然而,评估这些系统面临着根本性的瓶颈。传统的基于参考指标(如 BLEU、ROUGE)的方法无法捕捉智能体输出的语义正确性和开放性特征。相反,依赖专家人工评估无法满足现代智能体开发所需的迭代速度。虽然“LLM 作为评委”(LLM-as-a-Judge)范式提供了一种可扩展的替代方案,但药物发现领域的现有基准测试往往在未验证其与人类专家对齐的情况下部署 LLM 评委,从而面临传播偏见和不可靠评估的风险。
方法论
作者提出了一个用于设计和验证 LLM 评委系统的框架,专门针对部署在阿斯利康(AstraZeneca)的智能体药物发现助手 ChatInvent 。该方法论通过以下四个主要阶段进行:
1. 评估框架设计
作者定义了一个多维评估模式,包含:
确定性检查: 工具调用正确性(Tool Call Correctness),通过将实际工具序列与预期或接受的序列进行对比来验证。
LLM 评判维度: 通过 LLM 评委评估的四个标准:
完整性(Completeness): 所需信息的召回率。
相关性(Relevancy): 信息相对于用户请求的精确度。
结构清晰度(Structural Clarity): 格式、组织和可读性。
范围遵循度(Scope Adherence): 智能体是否在其预定能力范围内运行。
评分: 各维度按 0(未达标)、0.5(部分达标)和 1(完全达标)进行评分。
2. 人类对齐研究
为了验证评委系统,研究人员与五位专家标注员(面向化学研究人员的 AI 专家)进行了一项研究。
数据集: 35 个问题(30 个唯一问题,5 个重复问题用于一致性检查),涵盖各种工具工作流和正式程度。
协议: 标注员使用与通过 Web 应用程序提供给 LLM 评委相同的评分细则和上下文。
指标: 使用 Cohen's 加权 kappa 系数(包括评分者内和评分者间一致性)以及精确匹配率来衡量一致性。
3. 评委选择与优化
模型比较: 测试了四个候选模型作为评委:Gemini 3.1 Pro、Claude Opus 4.7、GPT-5 和 Llama 3.1 70B。
优化: 使用 DSPy 框架对表现最佳的模型进行进一步优化。具体而言,采用了 LabeledFewShot 优化器,将 20 个经过人类标注的示例整合到评委的提示词签名(prompt signature)中,以最大限度地实现与人类多数投票的对齐。
4. 大规模评估
将优化后的评委应用于包含 70 个问题的留出集(held-out set),以评估 ChatInvent 在不同功能(单工具 vs 多工具工作流)和不同问题正式程度(从高度正式到非正式)下的表现。
关键结果
人类对齐与评委性能
人类一致性: 人类标注者之间的一致性为中等(Fleiss's kappa 为 0.54),其中在“完整性”上的协议最高,在“范围遵循度”上的协议最低。
LLM 一致性: 所有候选模型都表现出较高的模型内一致性,其中 Claude Opus 4.7 和 Gemini 3.1 Pro 表现出最高的稳定性。GPT-5 的一致性较低,尤其是在“范围遵循度”方面。
人类-LLM 对齐: Gemini 3.1 Pro 实现了最高的与人类多数投票的对齐度(整体 Cohen's kappa 为 0.76)。值得注意的是,LLM 评委与人类多数投票之间的协议超过了单个人类标注者之间的一致性。
优化影响: 使用 LabeledFewShot 优化器将 Gemini 3.1 Pro 评委与人类投票的对齐度从 0.80 提升至 0.86 。
智能体系统性能(ChatInvent)
整体性能: ChatInvent 在相关性(86%)、结构清晰度(90%)、范围遵循度(84%)和工具调用正确性(90%)方面表现出色。
识别瓶颈: 完整性 是最薄弱的维度,仅有 43% 的输出被评为“完整”。人工检查显示,13 个不完整案例中有 9 个是由于系统错误导致的,其余则是因为缺乏特定组件(例如 CSV 文件路径、分子描述符)。
复杂度影响: 与单工具查询相比,复杂的多工具工作流在“完整性”和“工具调用正确性”方面的得分显著降低。然而,即使复杂度增加,“相关性”、“清晰度”和“范围遵循度”依然保持稳健。
正式程度影响: 研究发现,非正式措辞并未系统性地降低输出质量。事实上,最正式的问题(以及手动编写的参考问题)生成的得分有时反而低于中性或非正式的变体。这表明,在向智能体发起查询前,先用 LLM 重写用户提示词可能会是有益的。
意义与主张
本文声称提供了一个用于科学领域智能体系统进行人类对齐评估的可复用模板 。其主要贡献包括:
验证评委: 不同于以往将 LLM 评委视为真值的基准测试(如 SciToolEval, MolBench),本研究显式地通过人类专家验证评委,并对其进行优化以缩小对齐差距。
诊断能力: 该框架成功识别了智能体系统中的特定失效模式(例如多步工作流中缺失 CSV 路径),而这些模式是确定性指标可能无法捕捉到的。
关于提示词的洞察: 研究结果挑战了“正式科学语言对于智能体交互总是更优”的假设,表明非正式或中性的措辞可能会产生相当甚至更好的结果。
作者将这项工作定位为构建可靠、自主评估循环的概念验证 。他们承认,随着模型的快速演进,特定的模型排名可能会发生变化,但人类对齐和少样本优化的方法论对于确保药物发现领域自动化评估的可信度至关重要。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。