← 最新の論文
🤖 AI

EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks

本論文は、人間の専門家によって評価された413件の実世界の欧州エグゼクティブ・タスクからなるベンチマークであるEuroExecを紹介するものであり、最強の最先端大規模言語モデルでさえ、タスクのわずか56.9%しか解決できず、専門家が作成したリファレンスに一貫して劣るという、プロフェッショナルな人間の基準を大幅に下回っている実態を明らかにしている。

原著者: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で複雑な企業を運営するのを手伝う新しいアシスタントを雇っているところだと想像してみてください。あなたが必要としているのは、単に教科書から事実を暗唱できる人ではありません。現実世界の混沌とした問題を見つめ、現地のルールを理解し、実際に機能する素晴らしい計画を書き上げることができる戦略家です。これが「大規模言語モデル(LLM)」の世界です。これらは膨大な量のテキストで学習された、物語を書いたり、質問に答えたり、パズルを解いたりできる非常にスマートなコンピュータプログラムです。しばらくの間、私たちはこれらのAIアシスタントを、4つの選択肢から正しい答えを選ぶような、単純な多肢選択式のクイズでテストしてきました。しかし、現実の世界では、問題が選択肢のリストと共に提示されることは滅多にありません。問題はオープンエンドであり、混沌としており、深い判断力を必要とするものです。誰もが抱いている大きな疑問は、これらのAIという「天才」たちは、現実のエグゼクティブが日々行うような、ハイステークスでオープンエンドな意思決定を、本当にこなすことができるのか、それとも単にテストを受けるのが得意なだけなのか、ということです。

Sovrano AIの研究チームは、EuroExecと呼ばれる、全く新しい、極めて困難なチャレンジを作成することで、その答えを見つけ出そうと決めました。単なるクイズではなく、彼らはヨーロッパにおける実際のビジネスシナリオに基づいた、413個の複雑で長文の質問からなる大規模な試験を構築しました。彼らは単にAIに推測させたのではありません。金融、マーケティング、ビジネス、プロダクトマネジメントの分野で数十年の経験を持つ47人の実在の専門家を雇い、彼らに質問の作成と回答の採点を行わせました。これらの専門家は、ジュニア従業員の仕事を厳しくチェックする上司のように、すべての回答に対して厳格な要件のチェックリストを作成しました。そして、世界で最も高度な6つのAIモデルにこれらの問題を解かせ、AIのパフォーマンスを人間の専門家と比較しました。

結果は、一種の現実を突きつけるものでした。世界で最もスマートなAIモデルでさえ、プロフェッショナルに追いつくのに苦労しました。最高性能のAIモデルでさえ、タスクのわずか**56.9%を「解決」できたに過ぎず、これは、回答の半分近くにおいてプロフェッショナルな基準を満たせなかったことを意味します。対照的に、人間の専門家が自身の理想的な回答を書くよう求められた際、彼らは92.4%というほぼ完璧に近い割合で問題を解決しました。研究者が人間の専門家に、ブラインドテスト(目隠しをした状態)で回答をランク付けするよう求めたところ、専門家はAIの回答よりも人間が書いた回答の方を74%**の割合で好みました。

この研究は、AIがどのように失敗したかについても調査しました。モデルは、構造化された文章を書き、明確にコミュニケーションをとることについては一定の能力を持っていましたが、実際の推論や論理に関しては力不足でした。彼らはヨーロッパ市場の特定の現地ルールを見落としたり、現実的で実行可能な計画を作成できなかったりすることがよくありました。興味深いことに、研究者たちは時間とコストを節約するために、他のAIプログラムを使用して回答を自動的に採点することを試みました。しかし、これらの「AI裁判官」は信頼できず、トップモデルの性能を過大評価する傾向があり、人間の専門家が見逃さなかった微妙なニュアンスを見落としていました。

結局のところ、この論文は、AIはテキストを生成することには非常に長けているものの、ハイレベルな意思決定において人間の専門家に取って代わる準備はまだできていないことを示唆しています。トップAIの「解決率(Solve Rate)」は、最も簡単な質問においてかろうじて50%を超えた程度であり、最も有能なモデルであっても、エグゼクティブ業務に求められるプロフェッショナルな基準には遠く及びませんでした。研究者たちは、このような複雑で現実世界のタスクにおいては、依然として人間の判断がゴールドスタンダード(最高水準)であり、コンピュータが真に専門家のように「考えている」かどうかを判断するために、自動的な測定やAI裁判官に頼ることはまだできないと結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →