← 最新の論文
🤖 AI

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

本論文は、Alipayの複雑な決済統合への対応能力を評価するために、9つのプロジェクトにわたる18のタスクインスタンスで構成される現実的なベンチマークであるAlipay-PIBenchを導入し、特定の統合スキルへのアクセスが性能を大幅に向上させることを実証するとともに、決済関連のソフトウェア開発におけるモデルの能力を診断するための構造化されたフレームワークを提供するものである。

原著者: Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピューターが単にロボットのようにキーボードを叩いてコードを書くのではなく、プロジェクトのフォルダを開き、ビジネスロジックを理解し、複数のファイルにまたがるバグを修正できる「ジュニアデベロッパー」として振る舞う世界を想像してみてください。これが「コーディングエージェント」という刺激的な最前線です。長い間、私たちはこれらのAIヘルパーを、単一の数学の問題を解かせたり、小さな関数を書かせたりといった、単純で孤立したパズルでテストしてきました。しかし、現実の世界において、ソフトウェアは孤立したパズルの集まりではありません。それは巨大で相互に連結した都市なのです。本物のアプリを構築するには、AIは「表玄関」がどのように「バックオフィス」へとつながっているのか、データがどのように部屋の間を流れるのか、そして建物を侵入者からどのように守るのかを理解する必要があります。これは、特にお金を扱うような、非常にリスクの高い事柄においては特に重要です。もしAIが決済システムを誤れば、それは単なるタイポ(打ち間違い)ではなく、潜在的な金融災害となります。そこで研究者たちは、問いを投げかけています。これらのAIエージェントは、実際のビジネスアプリに決済システムを統合するという、乱雑で危険で複雑な現実を、本当に扱うことができるのだろうか?

ここで、Ant Groupのチームによって作成された、コーディングエージェントのための新しい「運転免許試験」であるAlipay-PIBenchが登場します。これはAIのための専門的な教習所のようなものだと考えてください。ただし、車の縦列駐車を教えるのではなく、非常に特殊でプレッシャーのかかる状況、つまり、現実世界のビジネスアプリケーションに決済システム(具体的にはAlipay)を統合する方法を教えるものです。研究者たちは、実際のプロジェクトに基づいた18種類の「走行シナリオ」を持つプレイグラウンドを構築しました。これらは2つのレベルに分けられています。**Basic(初級)**では、AIは単にお金を地点Aから地点Bへ移動させる必要があります。一方、**Advanced(上級)**では、AIは渋滞や偽のチケット、セキュリティガード(重複決済、返金、セキュリティチェックなどのリスクへの対処)に対処しなければなりません。

チームは6つの異なるAIモデルをこのテストにかけました。彼らは主に2つのことを知りたかったのです。すなわち、これらのAIは単独でどれほど優れた仕事ができるのか、そして「カンニングペーパー」(alipay-payment-integrationと呼ばれる構造化されたガイド)を与えることが、彼らのパフォーマンス向上に役立つのかどうかです。結果は示唆に富むものでした。カンニングペーパーなしでは、AIは苦戦し、見た目は正しくても、実際に実際にお金を使おうとすると失敗するようなコードを生成することがよくありました。しかし、研究者が構造化されたガイドを与えると、平均成功率は約10.31パーセントポイント上昇しました。最も高いパフォーマンスを示したAIであるClaude Opus 4.8は、ガイドを用いて**91.37%の成功率に達しましたが、最も低かったMiniMax M3は68.85%**にとどまりました。

しかし、この物語で最も興味深い部分はここにあります。テストによって、「見た目が良いこと」と「動作すること」は別物であることが明らかになったのです。研究者たちは、多層的な検査システムを使用しました。彼らは、コードが「そこに存在するか」(静的チェック)、それが「実行可能か」(結合テスト)、そして「お金のルール」に従っているか(セキュリティおよびロジックチェック)を確認しました。その結果、大きな乖離が見つかりました。AIは「そこに存在するか?」というチェックでは満点に近いスコア(構造面で90%以上)を出せても、実際に決済を処理しようとすると惨敗する(実行面で40%未満)ということが起こり得たのです。それは、車のすべての部品の定義を暗記しているものの、いざ運転しようとした瞬間にクラッシュしてしまう学生のようなものです。この研究は、AIエージェントは進化しているものの、現実世界の決済システムを崩壊させないための、深く目に見えない安全とロジックのルールを理解するには、まだ助けが必要であることを示唆しています。「カンニングペーパー」は彼らを速くしただけでなく、最も危険なミスを回避させることにも貢献しました。これは、コーディングエージェントの世界において、優れた地図を持っていることは、速いエンジンを持っていることと同じくらい重要であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →