Large language models do not replace chemists in a closed-loop catalysis experiment
尽管大语言模型在处理复杂的闭环催化实验过程中展现出了卓越的速度和成本效率,但由于存在隐性错误和逻辑不一致性,它们未能超越人类专家以发现活性最高的催化剂配方,这表明大语言模型目前最适合作为需要专家监督的补充工具,而非独立的替代品。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场高风险的烹饪大赛,目标是发明世界上最高效的产氢“汤”。你有一个拥有25种不同食材的海量储藏室:四种特殊的纳米蛋糕(nanoCOFs)、十二种不同的矿物粉末、三种燃料添加剂、三种肥皂、酸、碱,以及一种珍贵的铂金香料。挑战在于,要在机器人厨房中进行混合,找到那份能产生最多气泡(氢气)的完美食谱。
在这场实验中,两组厨师展开了对决:一组是人类专家团队,另一组是超级快速且聪明的 AI 厨师(一个名为 GPT-5.1 的大语言模型)。机器人厨房嘈杂且混乱,测量数据有时会发生漂移或产生混淆,这使得工作变得异常困难。
AI 厨师的极速赛跑
AI 厨师是个速度达人。它品尝、思考并下达下一批实验指令的速度比人类团队快 35 倍。运行 AI 大脑的成本大约只有支付人类时间成本的 1/1900。AI 非常擅长阅读食谱书、发现数据模式,并建议某种特定的肥皂(SDS)可能有助于食材更好地混合。它是正确的!当它加入这种肥皂后,氢气的产量显著跳升。
然而,AI 也出现了几次“大脑短路”:
- 数学错误: 在早期,由于忘记检查铂金香料瓶的重量,它误算了铂金香料的使用量。这浪费了它一些宝贵的实验机会。
- 记忆故障: 后来,当实验发生变化时(烹饪时间缩短了),AI 被自己的笔记搞糊涂了。它忘记了新数据不能直接与旧数据进行比较,导致它在死胡同里徘徊了一段时间,直到人类介入并重置了它的记忆。
- 隧道视野: AI 倾向于反复尝试那几种固定的食谱,为了稳妥而重复实验,而人类则更愿意尝试大胆、新颖的组合。
人类厨师的深度探索
人类团队移动得较慢,但他们是更细心的探索者。他们不仅仅观察气泡,还观察了罐子里“汤”本身的变化。他们注意到混合物在颜色和质地上的变化(相行为)——这些都是 AI 看不到的线索,因为 AI 只能看到数字化的气体读数。
由于拥有这些额外的感官输入,并能捕捉到 AI 沉默的错误,人类团队最终发现了一个平均活性略高于 AI 独立发现的最佳食谱的配方。他们不仅是在微调 AI 的想法,而是回归基础,尝试了不同的纳米蛋糕,并以 AI 未曾充分优化的方式调整了铂金水平。
最终裁定
那么,AI 替代了人类化学家吗?没有。
论文明确排除了这样一种观点,即 AI 可以不经帮助就接管复杂的、充满噪声的实验室工作。虽然 AI 是一个出色的、不知疲倦的助手,能够快速且廉价地处理数据并提出构想,但它并不完美。它会做出自信但错误的猜测,陷入循环,并且忽略了就在其“眼睛”面前的物理线索(如果它有眼睛的话)。
作者认为,未来的出路不是在机器人和人类之间做选择,而是将他们组合在一起。AI 可以承担大量繁重的工作,快速且廉价地运行数千次实验,而人类专家则充当飞行员,负责观察错误、解释物理变化,并在 AI 陷入混乱时掌舵。在这间高风险的厨房里,机器人是最快的副厨,但它仍然需要一位人类主厨来确保汤不会烧焦。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。