Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning
本文介绍了 ChemCost,这是一个用于评估大语言模型估算化学反应成本能力的严格基准,该基准通过确立反应物身份、检索供应商报价并执行算术运算来实现,结果表明,即使是先进的智能体也因解析脆弱、证据整合无效以及噪声鲁棒性差而难以胜任该任务。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位厨师,正试图算出为晚宴制作某道特定菜肴的确切成本。你拥有食谱(即化学反应),但你没有食材的价格,也不知道需要购买哪个品牌或哪种包装规格才能获得正确的用量。
本文介绍了一种名为CHEMCOST的新“测试”,旨在考察先进的人工智能计算机(称为大型语言模型或 LLM)能否像智能购物助手一样解决这一问题。
以下是该论文主要发现的分解说明,使用了简单的类比:
1. 挑战:这不仅仅是“谷歌搜索”
作者希望考察人工智能能否充当科学采购代理。这不仅仅是写诗或回答 trivia 问题。这是一个涉及多步骤的数学与购物谜题:
- 名称游戏:食谱中可能写着"TEA"。这是三乙胺(Triethylamine,一种化学物质)还是三乙醇胺(Triethanolamine,另一种化学物质)?人工智能必须准确判断指的是哪种分子。
- 购物搜寻:人工智能必须从一个包含 23 万多个供应商报价的“冻结”数据库中查询价格。它不能凭空猜测;它必须找到符合食谱的具体“包装”(例如,1 克装瓶子与 100 克装瓶子)。
- 数学计算:它必须将"1.5 当量”转换为克数,计算每种单一食材的成本,然后除以最终产品的总量,得出每克价格。
类比:想象人工智能是一名参加期末考试的学生。老师给出一份食谱、一本锁起来的标价图书馆目录以及一台计算器。学生必须找到正确的食材,购买正确的规格,完成计算,并提交一个数字:总成本。
2. 测试:CHEMCOST
研究人员构建了一个包含1,427 种不同化学配方的基准测试。
- “答案键”:他们没有让人类来给人工智能评分。相反,他们创建了一个包含真实价格的“冻结”数据库和一套严格的规则。计算机预先计算出确切的正确答案。这意味着评分是 100% 客观的——没有人为偏见。
- “噪声”测试:为了考察人工智能是真正聪明还是仅仅在死记硬背模式,他们故意搞乱了食谱。他们更改了名称(例如,将"Na2CO3"写成"Na2C03",用数字 0 代替字母 O),移除了产率百分比,或者将说明写成杂乱无章的非结构化文本。
3. 结果:“工具访问”并不足够
研究人员测试了许多不同的人工智能模型,从最大的“前沿”模型到专门的化学模型。以下是发生的情况:
- 天花板:即使是最聪明的人工智能模型,在处理干净、简单的输入时,也只有约50% 的答案正确(在 25% 的误差范围内)。它们远非完美。
- “工具”陷阱:研究人员赋予了人工智能模型“工具”(如化学名称搜索引擎和价格查询工具)。论文发现,拥有工具是必要的,但还不够。
- 类比:给学生一台计算器和一张借书证,并不能保证他们能正确解出数学题。他们仍然需要知道哪些数字输入计算器,以及哪本书需要打开。
- “脆弱”问题:当输入稍显杂乱(如化学名称中的拼写错误或奇怪的格式错误)时,人工智能模型往往完全放弃,或者给出大错特错的答案。
- 类比:如果人类厨师看到"Na2C03"(带数字 0),他们可能会猜测这是"Na2CO3"的拼写错误。然而,人工智能往往会惊慌失措,找不到该物品,并停止尝试。
4. 它们在哪里失败?
论文详细分解了人工智能在哪里卡住:
- 解析:它们无法阅读杂乱的文本以找到食材。
- 证据整合:它们能找到价格,但无法将其与食谱用量正确结合。
- 包装选择:它们选错了瓶子规格(当只需要 1 克时购买了 100 克装,反之亦然)。
- 放弃:当文本杂乱时,它们往往拒绝回答,而不是试图弄清楚。
5. “人类”基准
研究人员还让真正的人类化学家参加了测试。
- 结果:人类的表现优于人工智能(在干净输入下准确率约为 67%),但他们仍然会犯错。这证明该任务确实很难,即使是专家也不例外。
- 启示:人工智能不仅仅是“愚蠢”;该任务本身是一个复杂的杂耍表演,涉及阅读、搜索和计算,这对人类和机器来说都很困难。
总结
论文得出结论,虽然人工智能在使用工具方面正在进步,但它尚不可靠,不足以被信任用于现实世界的化学成本估算。当信息格式不完美时,它会陷入困境,并且经常无法将找到价格与计算最终总额这两点联系起来。
简而言之:人工智能就像一个非常快速、知识渊博的实习生,可以访问整个互联网和计算器,但仍然需要人类来复核他们的工作,特别是当说明书写得稍显杂乱时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。