← 最新论文
🤖 AI

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

本文介绍了基于代理状态的评估方法,这是一种由大语言模型驱动的模拟框架,通过从交互轨迹中推断结构化的代理状态,实现了对多轮工具调用代理的可扩展、可靠且高效的评估,从而为成本高昂的确定性后端提供了一种实用替代方案,同时支持模型排序与在线策略训练。

原作者: Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名新员工(即 AI 智能体)如何处理复杂的客户请求,比如寻找完美的鞋款或管理银行账户。为此,你需要一种方法来测试他们。

旧方法:构建一个完美但昂贵的模拟环境
传统上,为了测试这些 AI 智能体,公司会构建一个“完美世界”的模拟环境。这就像建立一个全尺寸、可实际运作的银行或商店模型,包含真实的资金、真实的库存以及严格的规则。

  • 问题所在:构建这个“完美世界”极其昂贵且缓慢。这就像雇佣一支工程师团队去建造一座假城市,仅仅为了测试一名送货司机。如果你想要更改测试内容(例如,“如果客户没有钱会怎样?”),你就必须重写整座假城市的代码。该论文指出,其中一个这样的系统仅为了让引擎运行起来,就需要近 10 万行代码和超过一年的工作量。

新方法:“代理状态”(智能脚本)
这篇论文的作者提出了一种更智能、更快速的方法,称为基于代理状态的评估。他们不再建造一座假城市,而是利用一支非常聪明的 AI“导演”团队来排演一出戏。

以下是这个类比的具体运作方式:

  1. 场景(剧本)
    他们不再使用数据库,而是编写一份详细的剧本。这份剧本规定:

    • 客户是谁?(例如:莎拉,她喜欢白色的鞋子。)
    • 目标是什么?(例如:找到她买得起的鞋子。)
    • 最终结果应该是什么样?(例如:莎拉账户里有 300 美元,但她尚未购买任何东西。)
  2. 演员(AI 模拟器)

    • 用户模拟器:一个 AI 扮演客户角色,与智能体进行对话。
    • 工具模拟器:其他 AI 假装是银行或商店。它们实际上并没有真实的银行账户;它们只是根据剧本扮演出拥有账户的样子。
    • 状态追踪器(记忆守护者):这是最重要的新部分。随着对话的进行,一个特殊的 AI 会监视一切并更新“心理记分牌”(即代理状态)。它会追踪:智能体是否询问了资金?“银行”是否同意了?现在的余额是多少? 它无需真实数据库,就能一步步构建出情境的全貌。
  3. 裁判(导演)
    在对话结束时,最终的 AI 裁判会查看“心理记分牌”和对话记录。它会问:“智能体是否实现了剧本中定义的目标?”

    • 如果智能体找到了鞋子,并在“心理记分牌”中正确更新了余额,则通过测试。
    • 如果智能体编造了信息(产生幻觉)或忘记检查余额,则测试失败。

为什么这更好?

  • 速度与灵活性:你不需要建造一座假银行。你只需编写一个新的剧本。如果你想测试不同的场景,只需更改文本,而无需更改代码。
  • 可靠性:作者通过让人类专家检查 AI 的评分来测试了这种方法。他们在90% 以上的情况下与 AI 裁判的意见一致。
  • 训练:由于该系统速度很快,它可以生成数千次练习对话。AI 智能体可以从这些练习中学习(无论是它自己参与扮演,还是观察更优秀的智能体扮演),从而更快地变得更聪明。

结果
该论文使用各种 AI 模型测试了这个系统。他们发现:

  • 更聪明的 AI 模型(或在回答前思考更长时间的模型)获得了更高的分数。
  • 使用该系统训练 AI,使其在解决问题方面显著变强,即使面对它从未见过的场景也是如此。
  • 该系统非常擅长识别 AI 何时在撒谎或犯错,模拟环境本身产生的“虚假”错误几乎为零。

总结
这篇论文介绍了一种通过“剧本化戏剧”(包含 AI 演员和记忆守护 AI)来测试和训练 AI 智能体的方法,而不是构建庞大、昂贵且基于现实世界的模拟环境。这种方法更快、更便宜,且同样准确,使公司能够更快速地迭代并改进其 AI 智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →