← 最新の論文
🤖 AI

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows

Enron 社を含む実世界の財務・会計データから構築された新しいベンチマーク「Finch」が、最先端の AI エージェントに複雑で多様な企業ワークフローを処理させる際の課題を浮き彫りにし、現状のモデルが依然として高い精度でのタスク遂行に苦戦していることを示しています。

原著者: Haoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Zikun Zhu, Adina Yakefu, Shuxin Zheng

公開日 2026-04-07
📖 1 分で読めます☕ さくっと読める

原著者: Haoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Zikun Zhu, Adina Yakefu, Shuxin Zheng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「FINCH(フィンチ)」**という新しいテスト(ベンチマーク)について紹介しています。

一言で言うと、**「AI に『完璧な事務作業』をさせて、本当に実務で使えるかどうかを厳しくチェックするテスト」**です。

これまでの AI のテストが「おままごと」や「きれいな教科書の問題」だったのに対し、FINCH は**「現実の会社で起こる、 messy(ぐちゃぐちゃ)で複雑な仕事」**を再現しています。

わかりやすく、3 つのポイントで説明しますね。

1. テストの内容:「きれいな教室」ではなく「荒れた現場」

これまでの AI 評価は、整然とした Excel シートに「A+B を計算して」というような、単純で綺麗な問題を出していました。

しかし、FINCH が使うのは**「現実のオフィス」**です。

  • ぐちゃぐちゃな資料: 数字がバラバラ、フォントが統一されていない、行と列が混在している。
  • 多様なファイル: Excel だけでなく、PDF の報告書、画像、メールのやり取り、ウェブ検索結果などが混ざり合っています。
  • 長い作業: 「データを入力して、計算して、グラフを作り、レポートをまとめて、メールで送る」というように、一つの仕事が何十段階にも分かれています。

【アナロジー】
これまでのテストは、**「整然とした調理台で、レシピ通りに卵を焼く」ようなものでした。
FINCH は、
「冷蔵庫の奥から古くなった食材を見つけ出し、レシピも曖昧なまま、他の人のメモを頼りに、汚れた包丁で複雑な料理を作り、最後に綺麗に盛り付けてお客様に渡す」**という、プロの料理人が直面する「荒れた現場」そのものです。

2. 作った方法:「過去のメールとファイル」から「物語」を復元

このテストは、人工的に作られた問題ではなく、**「実在する企業の過去のデータ」**から作られました。

  • エンロン社のメール: 有名な企業破綻事件のメールデータ(15,000 通以上)や、実際の銀行や政府の報告書を使っています。
  • 作業の痕跡: 「このメールで『予算表を直して』と言われ、その後、ファイルのバージョンが 3 回変わって、最終的にこうなった」という**「作業の流れ(ワークフロー)」**を、AI と専門家が協力して復元しました。

【アナロジー】
まるで**「探偵」が、散らかった部屋に残された手紙やメモ、書き換えられたノートを集めて、「一体、この人は何をしようとして、どんな手順で作業を進めたのか?」**という物語を推理し、それを「次の探偵(AI)」に解かせるようなものです。

3. 結果:AI は「まだ半人前」

最新の超高性能 AI(GPT-5.1 や Claude など)にこのテストをやらせましたが、結果は**「半分も正解できなかった」**という衝撃的なものでした。

  • 成功率: 約 38%(10 問中 4 問しか正解できない)。
  • 時間: 1 問あたり平均 17 分かかったのに、失敗することが多い。
  • 失敗の原因:
    • 長い作業: 手順が多くなると、途中でミスが積み重なって破綻する。
    • 複雑な表: 行と列がごちゃごちゃになっていると、どこに何があるか見失う。
    • 隠れた論理: 数式の中に「ビジネスのルール」が隠れていて、数字だけ見て計算すると間違える。

【アナロジー】
AI は**「優秀な新人」です。
「単なる計算」や「きれいな表」なら完璧にこなせます。しかし、
「先輩のメモが読みにくい」「ファイルが 10 個も散らばっている」「途中でルールが変わった」**といった、現実の「ぐちゃぐちゃな状況」になると、すぐにパニックになって失敗してしまいます。

まとめ:なぜこれが重要なのか?

この論文は、「AI はもうすぐ人間を追い抜く」という楽観的な見方に対して、**「いや、現実の複雑な仕事はまだ AI には難しい」**と警鐘を鳴らしています。

FINCH というテストは、AI が「おもちゃ箱」から出て、**「本物の社会で働けるか」**を測るための、新しい「卒業試験」のようなものです。これによって、AI が実際に企業で使えるようになるための、より良い開発の道筋が見えてくるはずです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →