APEX-Accounting
APEX-Accountingは、MercorとRampによって開発された、最先端のモデルを現実世界の会計業務に基づいて評価するための新しいベンチマークであり、現在のトップクラスのモデルが控えめな成功率しか達成できていないこと、およびトークン予算の増加が全体のスコア向上には相関するものの、特定の高コストなタスクにおけるパフォーマンスは低下するというシンプソンのパラドックスを示すことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
テクニカル・サマリー:APEX–Accounting
問題提起
大規模言語モデル(LLM)は、専門資格試験(CPA、CMAなど)の合格や一般的な業務品質の向上において習熟度を示しているが、会計士の実際の日常業務を評価するベンチマークは不足している。AuditBench、FinMaster、AccountingBenchといった既存のベンチマークは、合成トランザクション、テキストのみのシミュレーター、あるいは単一企業のケーススタディに依存することが多く、月末決算における反復的、手順的、かつドキュメント集約的な性質を捉えきれていない。著者らは、現在の評価手法は、口座の照合、費用の未払計上、取引の転記、そして多様で複雑なビジネスコンテキストにわたるレポート作成といった、会計士の「実務」を十分にテストできていないと主張している。
メソドロジー
ベンチマーク設計 (APEX–Accounting)
APEX–Accountingは、MercorがRampと提携して開発したクローズドなベンチマークであり、160のタスクと10の合成生成された企業世界で構成されている。
- 世界の構築: 各世界は、米国GAAPの発生主義会計に従い、月末決算時に凍結された自己完結型の企業を表している。世界は、スコーピング、詳細な仕様策定(矛盾を仕込むための「トラップ・レジスター」を含む)、スタイルガイドの導出、およびファイル生成の4段階で構築された。すべてのファイル(スプレッドシート、PDF、会計ソフトウェアのエクスポート)は新規のものであり、記憶による回答を防ぐために公開ソースとの照合が行われている。
- タスクカテゴリ: 160のタスクは以下の4つのカテゴリに分類される:
- 照合 (61タスク): 2つのソースを紐付け、差異を特定し、その理由の説明または修正を行う。
- データ入力 (26タスク): 取引、仕訳、および請求書の転記を行う。
- 差異分析 (28タスク): 実績値を予算や期待値と比較する。
- スケジュールの作成と未払計上 (45タスク): スケジュールを構築し、未払計算を行い、残高を繰り越す。
- 専門家の関与: 42名の会計専門家(経験の中央値は11年、52%がBig Four出身)がタスクを作成し、それらを解いて「ゴールデン・レスポンス(正解)」を作成し、バイナリ形式の成果ベースの採点ルーブリックを作成した。各タスクには、プロンプト、必要な入力ファイル、ゴールデン・レスポンス、および平均13.7個の基準を含むルーブリックが含まれている。
実験設定
- 評価対象モデル: Claude-Fable-5、Muse-Spark-1.1、GPT-5.6-Solを含む9つの最先端モデルをテストした。各モデルはすべてのタスクを8回ずつ実行し、11,520の軌跡(trajectory)を生成した。
- ハーネス: 2種類のエージェント・ハーネスを使用した:
- Loop Harness: 標準的な、ツールを用いた標準的なwhileループ構造。
- Ramp Harness: 再試行への意識、ツールのホワイトリスト化、バリデーション、および実世界の制約を反映するためのサブエージェント委譲機能を備えた、Rampによって構築された特化型ハーネス。
- 採点: GEPAプロンプトで最適化されたDeepSeek-v4-Flashモデルが判定役を務めた。この判定役は、人間による専門家のグラウンドトゥルース(1,687個の基準)に対して検証され、97.1%の精度(F1 = 0.970)を達成した。判定役は、中間的な軌跡ログにアクセスすることなく、最終的な出力に対してバイナリのルーブリック基準に基づいて評価を行う。
- メトリクス:
- Mean Criteria@3: 1タスクにつきランダムに選択された3回の実行における、ルーブリック基準の充足率の平均。
- Pass@k / Pass^k: 能力の天井(Pass@8: 8回の試行のうち少なくとも1回成功すること)と一貫性(Pass^8: 8回の試行すべてで成功すること)を測定する。
- コスト・アブレーション: 支出とパフォーマンスの関係を分析するために、タスクあたりのトークン予算を50まで変化させた実験。
主な結果
リーダーボードのパフォーマンス
- トップパフォーマー: Claude-Fable-5 (Max) が最高の Mean Criteria@3(56.4%) を達成し、次いでMuse-Spark-1.1(52.6%)、GPT-5.6-Sol(51.5%)となった。
- 一貫性のギャップ: 高いMean Criteria@3スコアにもかかわらず、一貫性は極めて低い。どのモデルも Pass^8 スコアで2.6%(GPT-5.6-Sol)を超えることはなかった。最高値のPass@8は21.5%(Muse-Spark-1.1)であり、これはモデルが時としてタスクを解決できるものの、エンドツーエンドで確実に実行することはできないことを示している。
- カテゴリ別の難易度: 「スケジュールの作成と未払計上」が最も困難なカテゴリであることが判明し、すべてのモデルが他のカテゴリよりも7〜21ポイント低いスコアとなった。これは、このカテゴリが多段階的で判断を要する性質を反映している。
コストおよび予算分析
- トークン予算の影響: 予算を50に増やすことで、高価なモデル(例:Claude-Fable-5は+43.4ポイント)のスコアは大幅に改善したが、安価なモデル(例:Muse-Spark-1.1)の改善は最小限であった。
- シンプソンのパラドックス: 本研究ではシンプソンのパラドックスの事例が観察された。総予算を増やすとスコアは上昇する一方で、固定された予算内においては、モデルがより多くのトークンを消費したタスクほどスコアが低くなるという相関が見られた。これはタスクの難易度に起因する。困難なタスクほど多くのトークンを消費するが、解決自体は依然として困難であるためである。
- ハーネスの影響: 標準的なLoop Harnessから特化型のRamp Harnessに切り替えても、平均的な変化はわずか(+1.2ポイント)であり、これらのタスクにおいては特定のエージェント・アーキテクチャよりもモデル自体の能力がパフォーマンスの強力な推進力であることを示唆している。
失敗分析
トップ3のモデルにおける低スコアの軌跡を分析したところ、驚くほど類似した失敗プロファイルが明らかになった:
- 推論の支配: 推論の失敗が、注釈付きエラーの全エラーのうち**59〜79%**を占めた。
- 具体的な失敗モード: 最も一般的なサブ失敗は、非数値的推論(非数値データに対して誤った論理を適用すること)およびデータ処理エラー(不適切なフィルタリング、結合、または集計)であった。
- 情報 vs 論理: モデルは正しい入力ファイルを確実に発見していた(情報の収集に関する失敗は稀であった)。主な失敗モードは、それらの入力に対する多段階の推論の取り扱いミスであった。具体的には、誤った承認ロジックの代用、正しい中間結果の脱落、あるいは結論を最終回答まで持ち越せないことなどが挙げられる。
- ツール利用: 注釈付きの失敗の中にツール使用のエラーは含まれていなかった。これは、現在のエージェント・アーキテクチャはツールとの相互作用には十分であるが、根本的なボトルネックは背後にある推論能力であることを示唆している。
意義および主張
本論文は、APEX–Accountingが、資格試験を超えて、実世界の会計ワークフローにおける最先端モデルの厳格な評価を提供するものであると主張している。
- 現在の限界: 結果は、最先端のモデルが情報を取得したり孤立したステップを実行したりすることはできるものの、教師なしで帳簿を閉じる能力はまだ備わっていないことを示している。低いPass^8スコア(最大2.6%)は、「能力の天井」と「信頼できるデプロイメント」の間に大きな隔たりがあることを浮き彫りにしている。
- 今後の方向性: 著者らは、進歩は(最小限の影響しか示さなかった)エージェント・ハーネスの改善からではなく、モデル自体の改善からもたらされると主張している。具体的には、多段階の結果を最後まで保持する規律、文書内の矛盾を表面化させる能力、および十分な証拠なしに仕訳を転記することを拒否する能力を植え付けるための、会計特化型のトレーニングの必要性を提案している。
- ベンチマークの有用性: クローズドなベンチマークとして、APEX–Accountingは、要求に応じてあらゆる最先端モデルの評価を可能にし、熟練した知識労働の自動化に向けた進捗を追跡するための標準化された指標を業界に提供する。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。