← 最新论文
💬 NLP

APEX-Accounting

APEX-Accounting 是由 Mercor 和 Ramp 开发的一个新基准,用于评估前沿模型在现实世界会计任务中的表现,该基准揭示了当前顶尖模型仅取得了适度的成功率,并表现出一种辛普森悖论,即增加 Token 预算与更高的总分相关,但与特定高成本任务的性能下降相关。

原作者: Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens, Rene Sultan, Charis Ching, Hayley Popiel, Vaibhav Mittal, Felix Mercier, Brendan Foody, Bertie Vidgen

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens, Rene Sultan, Charis Ching, Hayley Popiel, Vaibhav Mittal, Felix Mercier, Brendan Foody, Bertie Vidgen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:APEX–Accounting

问题陈述

虽然大型语言模型(LLM)在通过专业认证考试(如 CPA、CMA)并提高一般工作质量方面已展现出卓越能力,但目前仍缺乏评估其执行会计师实际日常工作的基准测试。现有的基准测试(如 AuditBench、FinMaster 和 AccountingBench)通常依赖于合成交易、纯文本模拟器或单一公司的案例研究,无法捕捉到月结(month-end close)和簿记工作中重复性、程序化以及文档密集型的特性。作者认为,目前的评估未能充分测试会计师的“实际工作”,而这涉及在多样且复杂的业务背景下进行账户对账、计提费用、过账交易以及生成报告。

方法论

基准设计 (APEX–Accounting)

APEX–Accounting 是由 Mercor 与 Ramp 合作开发的封闭式基准测试,包含 160 个任务,分布在 10 个合成生成的公司世界中。

  • 世界构建: 每个“世界”代表一个在月结时状态冻结的独立公司,遵循美国公认会计原则(U.S. GAAP)的权责发生制。这些世界通过四个阶段构建:范围界定、详细规格说明(包括用于植入矛盾点的“陷阱寄存器”)、风格指南推导以及文件生成。所有文件(电子表格、PDF、会计软件导出文件)均为原创,并经过筛查以确保未包含公开来源的内容,从而防止模型记忆。
  • 任务类别: 160 个任务分为四类:
    1. 对账 (61 个任务): 将两个来源进行匹配,识别差异并解释/修正差异。
    2. 数据录入 (26 个任务): 过账交易、分录及发票。
    3. 差异分析 (28 个任务): 将实际值与预算或预期值进行比较。
    4. 明细表与计提 (45 个任务): 构建明细表、计算计提金额并结转余额。
  • 专家参与: 42 位会计专家(从业经验中位数为 11 年,其中 52% 来自四大会计师事务所)编写了这些任务,通过解决任务来创建“黄金响应”(golden responses),并编写了基于结果的二元评分细则。每个任务都包含一个提示词、所需的输入文件、一个黄金响应以及一个平均包含 13.7 项标准的评分细则。

实验设置

  • 评估模型: 测试了九种前沿模型,包括 Claude-Fable-5、Muse-Spark-1.1、GPT-5.6-Sol 等。每个模型对每个任务执行 8 次,共生成 11,520 条轨迹(trajectories)。
  • 控制框架(Harnesses): 使用了两种智能体控制框架:
    • Loop Harness: 一种标准的、带有工具调用的 canonical while-loop 架构。
    • Ramp Harness: 一个由 Ramp 开发的专门框架,具有重试感知、工具白名单、验证功能以及子智能体委派功能,旨在模拟现实世界的会计约束。
  • 评分: 使用经过 GEPA 提示词优化的 DeepSeek-v4-Flash 模型作为评判者。该评判者通过与人类专家真实标准(1,687 项标准)进行验证,实现了 97.1% 的准确率(F1 = 0.970)。评判者根据二元细则标准对最终输出进行评估,而不接触中间的轨迹日志。
  • 指标:
    • Mean Criteria@3: 主要指标,计算每个任务随机抽取 3 次运行后满足评分细则标准的平均百分比。
    • Pass@k / Pass^k: 衡量能力上限(Pass@8:在 8 次尝试中至少成功一次)和一致性(Pass^8:在 8 次尝试中全部成功)。
    • 成本消融 (Cost Ablation): 通过改变每个任务的 Token 预算(从 1 美元到 50 美元)来进行实验,以分析支出与性能之间的关系。

关键结果

排行榜表现

  • 顶尖表现: Claude-Fable-5 (Max) 取得了最高的 Mean Criteria@3,为 56.4%,紧随其后的是 Muse-Spark-1.1 (52.6%) 和 GPT-5.6-Sol (51.5%)。
  • 一致性差距: 尽管 Mean Criteria@3 得分较高,但一致性仍然极低。没有任何模型的 Pass^8 得分高于 2.6% (GPT-5.6-Sol)。最高的 Pass@8 为 21.5% (Muse-Spark-1.1),这表明虽然模型偶尔可以解决某个任务,但无法可靠地端到端完成任务。
  • 类别难度: “明细表与计提”被证明是最难的类别,所有模型的得分均比其他类别低 7–21 个百分点,反映了其多步骤、重判断的特性。

成本与预算分析

  • Token 预算影响: 将预算从 1 美元增加到 50 美元显著提高了昂贵模型(如 Claude-Fable-5)的得分(增加了 43.4 个百分点),而较便宜的模型(如 Muse-Spark-1.1)收益微乎其微。
  • 辛普森悖论 (Simpson's Paradox): 研究观察到了一个辛普森悖论的实例:虽然增加总预算提高了得分,但在固定预算内,模型消耗更多 Token 的任务反而关联着更低的得分。这归因于任务难度:较难的任务消耗更多 Token,但依然难以解决。
  • 框架影响: 从标准的 Loop Harness 切换到专门的 Ramp Harness 后,平均得分仅有微小的偏移(+1.2 个百分点),这表明对于这些任务而言,模型能力是驱动性能的主要因素,而非特定的智能体架构。

失败分析

对前三个模型中低分轨迹的分析揭示了极其相似的失败特征:

  • 推理主导: 推理失败占所有标注错误中的 59–79%
  • 具体失败模式: 最常见的子失败模式是非数值推理(将错误的逻辑应用于非数值数据)和数据处理错误(错误的过滤、连接或聚合)。
  • 信息 vs. 逻辑: 模型能够可靠地找到正确的输入文件(信息获取失败很少见)。主要的失败模式是在这些输入之上进行多步推理时的处理不当:例如,误用授权逻辑、丢失正确的中间结果,或未能将结论贯穿至最终答案。
  • 工具使用: 没有标注的失败涉及工具使用错误,这表明当前的智能体架构足以进行工具交互,但底层的推理能力才是瓶颈。

重要性与主张

论文声称,APEX–Accounting 提供了对前沿模型在现实世界会计工作流中进行严谨评估的首个基准,超越了单纯的认证考试,转向了实际应用。

  • 当前局限性: 结果表明,虽然前沿模型可以检索信息并执行孤立的步骤,但它们尚未能够在无人监督的情况下可靠地完成结账工作。极低的 Pass^8 分数(最高仅 2.6%)凸显了“能力上限”与“可靠部署”之间的巨大鸿沟。
  • 未来方向: 作者认为,进步将更多地来自于改进模型本身,而非改进智能体框架(后者显示出影响有限)。具体而言,需要进行会计领域的特定训练,以培养模型在处理多步结果时所需的严谨性、在文档中发现矛盾的能力,以及在证据不足时拒绝过账的能力。
  • 基准效用: 作为一个封闭式基准,APEX–Accounting 允许根据请求对任何前沿模型进行评估,为行业提供了一个标准化指标,以追踪自动化高技能知识工作的进展。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →