ContractBench: Can LLM Agents Preserve Observation Contracts?
本文介绍了 ContractBench,这是一个确定性基准测试,它揭示出当前前沿的大型语言模型智能体经常无法保持观察合约(例如会话令牌和 URL)的时间有效性和字节级完整性,而这一能力并不随模型规模单调提升,且需要针对特定失败情况的训练才能改善。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和生动的类比对论文《CONTRACTBENCH:大语言模型智能体能否遵守观察契约?》的解释。
核心概念:“数字交接”难题
想象一下,你雇佣了一位非常聪明但略显笨拙的机器人助手为你跑腿。你告诉机器人:“去银行,拿一把临时钥匙,然后用这把钥匙打开保险箱。”
在现实世界中,如果机器人把钥匙弄丢了、改变了钥匙的形状,或者在钥匙过期后试图使用它,保险箱就打不开。机器人失败了,不是因为它不知道要“做什么”,而是因为它未能处理好交接过程中的具体细节。
这篇论文将这些细节称为“观察契约”。
- 契约内容:当一个工具(例如银行 API)向机器人提供一段数据(例如临时密码或签名链接)时,该数据附带两条看不见的规则:
- 有效期:你必须“立即”使用它,否则它将失效。
- “勿动”规则:你必须逐字逐句地原样复制它。如果你改变了一个逗号或一个空格,它就会失效。
作者发现,即便是当今最先进的人工智能智能体,也极不擅长遵守这些规则。它们经常弄丢钥匙、把钥匙“融化”掉,或者试图在第二天使用它。
新测试:CONTRACTBENCH
为了证明这一点,研究人员构建了一个名为CONTRACTBENCH的新测试。你可以把它想象成人工智能智能体的“驾驶考试”,只不过它们不需要开车,而是要穿越一个数字障碍赛,其中每一步都需要将一个脆弱且对时间敏感的包裹传递给下一个人。
- 赛道:包含 33 种不同的场景(例如,下载一个 10 秒后失效的链接中的文件,或者输入必须完全准确的登录代码)。
- 规则:测试由一个严格的计算机程序运行(没有人类评委)。它使用“虚拟时钟”来检测智能体是否太慢,并使用“数字指纹扫描仪”来检测智能体是否更改了代码中的任何一个字母。
- 评分:如果智能体超出时间限制或拼错代码,则判定为失败。
研究发现
研究人员测试了 38 种不同的人工智能模型(包括来自 OpenAI、Anthropic、Google 以及开源团队最新、最著名的模型)。以下是他们的发现,已转化为日常用语:
1. 即使是“最聪明”的机器人也会失败
发现:没有一种模型通过了 80% 的测试。表现最好的模型(Claude Opus 4.6)仅获得了约 78% 的分数。
类比:想象一下世界上最聪明的学生参加数学考试。他们能解决复杂的微积分问题,但如果你让他们完美地抄写一个 10 位数字而不犯任何拼写错误,他们仍然有 22% 的概率出错。“聪明”并不意味着“细心”。
2. “魔法悬崖”(Qwen 3.5)
发现:在 Qwen 3.5 这一特定模型家族中,能力出现了突然的飞跃。40 亿参数的小模型正确率为0%。而稍大的 90 亿参数模型则跃升至56%。
类比:这就像视频游戏中的一个角色,在达到 9 级之前毫无用处。在 8 级时,他们甚至拿不住钥匙。到了 9 级,他们突然学会了如何轻柔地握住钥匙。这不是缓慢的进步,而是一种特定技能——克制(知道“不”去修改数据)的突然“觉醒”。
3. 更大并不总是更好(GPT-5 的过山车)
发现:随着 GPT-5 系列模型的演进,它们的性能先上升,然后暴跌,接着又回升。
类比:想象一位厨师得到了一本新食谱。
- 厨师 A(GPT-5):做出了完美的蛋糕。
- 厨师 B(GPT-5.1):得到了一本“更聪明”的食谱版本,但开始加入过多的糖,破坏了食谱(具体来说,他们开始修改配料而不是原样复制)。
- 厨师 C(GPT-5.2):修正了食谱,重新做出了完美的蛋糕。
论文指出,让人工智能变得更“聪明”或更“善于交谈”,有时反而会让它在遵守严格、枯燥的规则方面变得更差。
4. “基座”模型做不到
发现:未经过“训练”以进行对话或遵循指令的模型(基座模型)在测试中得分为 0%。只有经过指令遵循训练(Instruct 模型)的模型才能通过。
类比:一块未经塑形的黏土(基座模型)无法保持形状。你必须对其进行雕刻(后训练),才能让它盛住一杯水。遵守这些契约的能力并非天生,必须经过教导。
5. “提示”有效
发现:当研究人员明确告诉人工智能它具体做错了什么(例如,“你更改了代码中的一个字母”)时,人工智能就能修正错误并通过测试。
类比:如果你告诉一个孩子“你把球弄掉了”,他们可能会再试一次并接住球。但如果你只是说“再试一次”,他们可能会再次弄掉球。具体的反馈是修正错误的关键。
为何这很重要(根据论文观点)
论文认为,我们一直在测试人工智能能否“解决谜题”或“编写故事”。但在现实世界中,人工智能智能体常被用于执行那些精确度至关重要的工作。
如果人工智能智能体在管理你的银行账户,它绝不能更改交易代码中的任何一个数字。如果它在管理服务器,它绝不能使用过期的密码。
结论:当前的人工智能智能体就像才华横溢但笨手笨脚的实习生。它们理解大局,却不断弄丢被递送给它们的脆弱工具。为了让它们胜任现实世界的工作,我们需要停止仅仅让它们变得更“聪明”,转而教导它们对接收到的数字契约更加谨慎和精确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。