コンピュータが人間のように読み、書き、そして推論することを学んでいる世界を想像してみてください。人工知能(AI)と呼ばれるこの分野は、チャットをしたり、数学の問題を解いたり、さらにはコードを書いたりできる新しいモデルの登場によって、近年爆発的な進化を遂げました。しかし、そこには落とし穴があります。これらの超スマートなコンピュータの多くは「ブラックボックス」なのです。それらが機能することは分かっていますが、どのように構築されたのか、あるいはそのコードの中にどのような秘密が隠されているのか、正確には分かっていません。最近、中国の研究所から、アメリカの大手テック企業による秘密の、鍵がかかったバージョンとは異なり、その設計図が誰にでも公開されている「オープンウェイト」のモデルという新しい波が現れました。誰もが抱いている大きな疑問は、これら公開されたモデルは、財務報告書を読み、真実を見つけ出すという、困難で退屈ながらも極めて重要な仕事を実際にこなせるのか、それとも単に賢そうに聞こえるのが得意なだけなのか、ということです。
この論文は、これら20のAIモデルに対する、大規模で非常に重要なテストのようなものです。研究者たちは「フィナンシャル・タッチストーン(金融の試金石)」チャレンジを立ち上げました。これは、世界中の企業の実際の年次報告書495冊と、それらに関する2,967のトリッキーな質問を組み合わせた、巨大な図書室のようなものです。これは、学生に495冊の教科書の束を与えて、「会社Xは2022年にどれだけの利益を上げましたか?」とか「主要な3つの事業セグメントは何ですか?」と尋ねるようなものです。目的は、どのAIが、作り話(「ハルシネーション」と呼ばれる問題)をすることなく、また、本の正しいページを見つけられずに立ち往生することなく、正しい答えを見つけ出せるかを確認することでした。
結果は、完全などんでん返しでした。長い間、複雑な財務計算を扱うには、特別な「推論」脳や、秘密の独占的モデルが必要だと考えられてきました。しかし、この研究は、オープンウェイトのモデルが急速に追いついていることを明らかにしました。実際、Kimi K2.6と呼ばれるオープンウェイトのモデルは、全体で3位に入り、いくつかの有名な秘密のアメリカ製モデルを打ち負かしたのです!トップの成績を収めたのは、実際にはClaude Opus 4.6というモデルで、正解率は88.4%でした。しかし、物語にはひねりがあります。いくつかのモデルは正解を見つけるのが得意でしたが、他のモデルは「嘘をつかないこと」において驚異的でした。GoogleのGemini 2.5 Proは、ハルシネーション率がわずか0.08%と、最も嘘をつかない率が低かったのですが、そもそも答えを見つけること自体は最高ではありませんでした。
研究者たちはまた、これらすべてのAIモデルにとって最大の課題は、彼らの「脳」ではなく、「目」であったことも発見しました。ミス全体のほぼ半分(48.9%)は、コンピュータが膨大な報告書の中から、読むべき正しいページを単に見つけられなかったために発生しました。それは、まるで本棚から本を見つけることができない天才がいるようなものです。もう一つの奇妙な発見は、一部の中国製モデルには「セーフティフィルター」があり、報告書が特定の政治的人物や出来事に言及していると、完璧に普通の財務上の質問に対して突然回答を拒否することがあるという点でした。これは、トピックが自分が破ってはならないルールを思い出させたために、テストを受けることを拒む学生のようなものです。
では、結論は何でしょうか?この論文は、オープンウェイトのモデルが、金融を理解することにおいて、世界最高の秘密のモデルと競えるほど強力になっていることを示唆しています。彼らは素晴らしい仕事をするために「推論」スーパーコンピュータである必要はなく、時には、よりシンプルなオープンなモデルが同様にうまく機能します。しかし、この研究は、私たちはまだ長い道のりを歩んでいることも警告しています。コンピュータは読むことは上手くなっていますが、巨大な文書の中から正しい情報を見つけ出すことに依然として苦労しており、時には敏感すぎる安全ルールによってブロックされてしまいます。著者は、金融の現実世界の報告書を扱えるAIアシスタントの実現には近づいているものの、私たちのお金を完全に任せられるようになる前に、情報の検索方法を修正する必要があると結論づけています。
テクニカル・サマリー:オープンウェイト・モデルは金融テキスト理解において競争力を持ち得るか?
問題提起
中国のAIラボによるオープンウェイト言語モデルは、一般的なベンチマークにおいてプロプライエタリな最先端モデルとの性能差を縮めてきているが、現実世界の金融タスクにおける信頼性は未だ検証されていない。2025年から2026年にかけての大規模言語モデル(LLM)評価における重大な課題は、公開データセットが学習コーパスに吸収されてしまう「ベンチマーク汚染」である。さらに、金融年次報告書は、その長さ(700ページ超)、異質性(記述、規制上の定型文、複雑な表の混在)、および管轄区域の多様性(22カ国および様々な会計基準をカバー)により、極めて要求水準の高い領域である。従来のベンチマークは短いコンテキストや単一の文書に依存することが多く、非構造化された多ページの報告書から特定の財務指標を抽出するという複雑さを捉えきれていなかった。
手法
著者は、Financial Touchstoneベンチマークを更新し、480の報告書にわたる2,878の質問から、495の国際的な年次報告書にわたる2,967の質問・コンテキスト・回答のトリプレットへと拡張した(v1.2)。このデータセットは、すべてのGICS(世界産業分類標準)セクターを網羅し、2021年から2023年の報告書を含んでいる。
- モデル評価: 本研究では、従来の11モデルから拡張し、10のプロバイダーによる20のモデルを評価した。これには、最新のオープンウェイト・モデル(例:Kimi K2.6、GLM 5、DeepSeek V3.2)およびプロプライエタリなフラッグシップ・モデル(例:Qwen3-Max、Claude Opus 4.6、Gemini 2.5 Pro)が含まれる。
- パイプライン: 報告書を1,000トークンのウィンドウに分割する検索拡張生成(RAG)パイプラインを採用した。上位5つのチャンクは、固定の埋め込みモデル(text-embedding-3-small)とFAISSを使用して抽出される。決定的な点として、検索ステップ自体がタスクの一部であり、関連するコンテキストの取得に失敗した場合は、上流の問題として免責されるのではなく、システム全体の失敗として扱われる。
- 評価指標: パフォーマンスは以下の指標で測定される:
- 正確性(Accuracy): 人間がキュレーションした「ゴールデン回答」に対する必要情報の再現率。
- ハルシネーション率(Hallucination Rate): ソーステキストによって裏付けられていない主張の割合。
- 失敗の分類(Failure Taxonomy): エラーは「検索失敗」、「モデルの理解エラー」、または「ハルシネーション」に分類される。
- 品質管理: モデル・イン・ザ・ループによるサニティチェックと二重アノテーション・プロセスを用い、不完全な回答67件とハルシネーションを含むゴールデン回答15件を修正した。人間のベースライン精度は82.8%、ハルシネーション率は2.8%である。
主な結果
- モデルのパフォーマンス: AnthropicのClaude Opus 4.6が最高の正確性(88.4%)を達成し、次いでClaude Sonnet 4.6(86.7%)となった。特筆すべきは、オープンウェイトのKimi K2.6が3位(83.5%)に入り、人間のベースラインを上回ったことである。非推論モデルであるGLM 5(82.0%)やMistral 3(81.3%)もトップ5に入っており、強力な金融理解のために推論アーキテクチャが必須であるという仮説に疑問を投げかけている。
- ハルシネーション vs 正確性: GoogleのGemini 2.5 Proは、人間のベースラインを大幅に下回る最低のハルシネーション率(0.08%)を維持したが、正確性では13位(76.6%)に沈んだ。逆に、Mistral 3は、まずまずの正確性を示しながらも高いハルシネーション率(13.0%)を記録した。Kimi K2.6は、正確性で3位に入りながら低いハルシネーション率(0.13%)を維持しており、優れたバランスを実現した。
- エラーの要因: **情報の検索(Information retrieval)が依然として主要なボトルネックであり、全失敗の48.9%**を占めている。モデルの理解エラーは44.7%、単独のハルシネーションは9.1%であった。検索が失敗すると、すべてのモデルにおいて正確性は77.9%から12.0%へと劇的に低下する。
- コンテンツ・フィルタリング: 新たな発見として、中国のモデルが正当な金融に関する質問を拒否する地政学的コンテンツ・フィルターを備えていることが記録された。23,736回の試行のうち、18件の拒否(0.08%)がベンチマーク・データ内で持続した。拒否は、中国の政治指導者への言及(例:貴州茅台の報告書内)、香港の抗議活動、または国有銀行への言及によって引き起こされた。決定的なことに、拒否挙動はルート依存であることが判明した。同一の要求であっても、サードパーティのプロキシを経由してルーティングされた場合は回答されることが多かったが、ネイティブなAPIコールでは拒否された。
意義と主張
本論文は、金融AIの展望における3つの実質的な変化を主張している:
- オープンウェイトの競争力: オープンウェイト・モデル、特に中国のラボによるモデルは、金融テキスト理解においてプロプライエタリな最先端モデルとの差を縮めており、一部のモデル(Kimi K2.6、GLM 5)は確立された推論モデルを凌駕している。
- 推論 vs 非推論: 「推論」アーキテクチャと金融パフォーマンスの相関関係は弱まっている。非推論モデル(Mistral 3、GPT-4o)やオープンウェイト・モデルは、この特定のタスクにおいて、専用の推論モデル(例:Magistral、Grok 4)と同等、あるいはそれ以上の競争力を持っている。
- デプロイメント・リスク: 本研究は、中国のモデルにおけるコンテンツ・フィルタリングを、グローバルな金融分析における測定可能なデプロイメント・リスクとして特定した。特定の管轄区域や実体に関する正当なクエリが、アクセス・ルートによって異なる挙動に基づきブロックされる可能性がある。
著者は、モデルの生成能力は向上しているものの、検索のボトルネックが依然として高精度な金融AIを実現するための最大の障壁であると結論付けている。彼らは、ジェネレーター(生成器)のみを入れ替えるよりも、RAGスタック(例:GraphRAGによる)を改善することの方が、パフォーマンス向上のためのより大きな潜在力を持つと示唆している。データセットおよび評価フレームワークは、再現性をサポートするために公開されている。
毎週最高の quantitative finance 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録