Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents
本文介绍了 Alipay-PIBench,这是一个包含九个项目中 18 个任务实例的真实基准测试,用于评估编程智能体处理复杂支付宝支付集成的能力,证明了获取特定的集成技能能显著提高性能,并为诊断模型在支付相关软件开发中的能力提供了一个结构化框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机不再仅仅是像机器人在键盘上打字那样编写代码,而是真正表现得像初级开发人员一样——能够打开项目文件夹,理解业务逻辑,并修复跨越多个文件的漏洞。这就是“编码智能体”(coding agents)令人兴奋的前沿领域。长期以来,我们一直在简单的、孤立的谜题上测试这些 AI 助手——比如要求它们解决一个单一的数学问题或编写一个微小的函数。但在现实世界中,软件并不是一系列孤立谜题的集合;它是一座巨大的、互联互通的城市。要构建一个真正的应用程序,AI 需要理解前门是如何连接到后勤办公室的,数据如何在房间之间流动,以及如何保护建筑免受入侵者的侵害。对于像处理金钱这样高风险的任务来说,情况尤其如此。如果 AI 把支付系统搞错了,那不仅仅是一个拼写错误,而是一场潜在的财务灾难。因此,研究人员正在追问:这些 AI 智能体真的能够处理将支付系统集成到真实业务应用中时那种混乱、危险且复杂的现实吗?
由此诞生了 Alipay-PIBench,这是一个由蚂蚁集团团队创建的针对编码智能体的全新“驾驶考试”。把它想象成一所专门为 AI 设计的驾驶学校,但它教的不是汽车如何侧方位停车,而是教它们如何处理一个非常特定且高压的情况:将支付系统(具体指支付宝)集成到真实的业务应用中。研究人员基于真实项目构建了一个拥有 18 个不同“驾驶场景”的游乐场。他们将这些场景分为两个等级:基础级(Basic),AI 只需要让资金从 A 点移动到 B 点;以及高级级(Advanced),AI 则必须应对交通拥堵、假票据和保安(处理诸如重复支付、退款和安全检查等风险)。
该团队让六种不同的 AI 模型接受了这项测试。他们想观察两个核心点:这些 AI 独立工作的能力如何,以及给它们一份“小抄”(一个被称为 alipay-payment-integration 的结构化指南)是否能帮助它们做得更好?结果非常有启发性。在没有这份小抄的情况下,AI 表现挣扎,经常写出看起来正确但在实际尝试消费时失败的代码。然而,当研究人员向 AI 提供这份结构化指南时,平均成功率提升了约 10.31 个百分点。表现最好的 AI —— Claude Opus 4.8,在有指南的情况下达到了 91.37% 的成功率,而表现最差的 MiniMax M3 则达到了 68.58%。
但这个故事中最有趣的部分在于:测试揭示了“看起来很好”并不等同于“实际可用”。研究人员使用了一个多层检测系统。他们检查代码是否“存在”(静态检查)、是否“能运行”(集成测试),以及是否“符合金钱规则”(安全与逻辑检查)。他们发现了一个巨大的差距:一个 AI 可能会在“它是否存在?”的检查中表现出色(结构得分超过 90%),但在实际尝试处理支付时却惨败(执行得分低于 40%)。这就像一个学生背诵了所有汽车零件的定义,但一上手开车就撞车了。这项研究表明,尽管这些 AI 智能体正在变得越来越强,但它们仍然需要帮助,以理解那些维持现实世界资金系统不崩溃的深层、隐形的安全性与逻辑规则。这份“小抄”不仅让它们变得更快,更帮助它们避免了最危险的错误,这证明了在编码智能体的世界里,拥有一张好的地图与拥有一台强劲的引擎同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。