← 最新の論文
💰 quantitative finance

Can Open-Weight Models Compete on Financial Text Comprehension?

本論文は、更新されたFinancial Touchstoneベンチマークを用いて20のモデルを評価しており、情報検索のボトルネックや中国系モデルにおける地政学的な拒絶挙動の不一致が依然として存在するものの、Kimi K2.6のようなオープンウェイトモデルが金融テキストの理解においてプロプライエタリなシステムに匹敵し得ることを明らかにしている。

原著者: Jan Spörer

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Jan Spörer

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが人間のように読み、書き、そして推論することを学んでいる世界を想像してみてください。人工知能(AI)と呼ばれるこの分野は、チャットをしたり、数学の問題を解いたり、さらにはコードを書いたりできる新しいモデルの登場によって、近年爆発的な進化を遂げました。しかし、そこには落とし穴があります。これらの超スマートなコンピュータの多くは「ブラックボックス」なのです。それらが機能することは分かっていますが、どのように構築されたのか、あるいはそのコードの中にどのような秘密が隠されているのか、正確には分かっていません。最近、中国の研究所から、アメリカの大手テック企業による秘密の、鍵がかかったバージョンとは異なり、その設計図が誰にでも公開されている「オープンウェイト」のモデルという新しい波が現れました。誰もが抱いている大きな疑問は、これら公開されたモデルは、財務報告書を読み、真実を見つけ出すという、困難で退屈ながらも極めて重要な仕事を実際にこなせるのか、それとも単に賢そうに聞こえるのが得意なだけなのか、ということです。

この論文は、これら20のAIモデルに対する、大規模で非常に重要なテストのようなものです。研究者たちは「フィナンシャル・タッチストーン(金融の試金石)」チャレンジを立ち上げました。これは、世界中の企業の実際の年次報告書495冊と、それらに関する2,967のトリッキーな質問を組み合わせた、巨大な図書室のようなものです。これは、学生に495冊の教科書の束を与えて、「会社Xは2022年にどれだけの利益を上げましたか?」とか「主要な3つの事業セグメントは何ですか?」と尋ねるようなものです。目的は、どのAIが、作り話(「ハルシネーション」と呼ばれる問題)をすることなく、また、本の正しいページを見つけられずに立ち往生することなく、正しい答えを見つけ出せるかを確認することでした。

結果は、完全などんでん返しでした。長い間、複雑な財務計算を扱うには、特別な「推論」脳や、秘密の独占的モデルが必要だと考えられてきました。しかし、この研究は、オープンウェイトのモデルが急速に追いついていることを明らかにしました。実際、Kimi K2.6と呼ばれるオープンウェイトのモデルは、全体で3位に入り、いくつかの有名な秘密のアメリカ製モデルを打ち負かしたのです!トップの成績を収めたのは、実際にはClaude Opus 4.6というモデルで、正解率は88.4%でした。しかし、物語にはひねりがあります。いくつかのモデルは正解を見つけるのが得意でしたが、他のモデルは「嘘をつかないこと」において驚異的でした。GoogleのGemini 2.5 Proは、ハルシネーション率がわずか0.08%と、最も嘘をつかない率が低かったのですが、そもそも答えを見つけること自体は最高ではありませんでした。

研究者たちはまた、これらすべてのAIモデルにとって最大の課題は、彼らの「脳」ではなく、「目」であったことも発見しました。ミス全体のほぼ半分(48.9%)は、コンピュータが膨大な報告書の中から、読むべき正しいページを単に見つけられなかったために発生しました。それは、まるで本棚から本を見つけることができない天才がいるようなものです。もう一つの奇妙な発見は、一部の中国製モデルには「セーフティフィルター」があり、報告書が特定の政治的人物や出来事に言及していると、完璧に普通の財務上の質問に対して突然回答を拒否することがあるという点でした。これは、トピックが自分が破ってはならないルールを思い出させたために、テストを受けることを拒む学生のようなものです。

では、結論は何でしょうか?この論文は、オープンウェイトのモデルが、金融を理解することにおいて、世界最高の秘密のモデルと競えるほど強力になっていることを示唆しています。彼らは素晴らしい仕事をするために「推論」スーパーコンピュータである必要はなく、時には、よりシンプルなオープンなモデルが同様にうまく機能します。しかし、この研究は、私たちはまだ長い道のりを歩んでいることも警告しています。コンピュータは読むことは上手くなっていますが、巨大な文書の中から正しい情報を見つけ出すことに依然として苦労しており、時には敏感すぎる安全ルールによってブロックされてしまいます。著者は、金融の現実世界の報告書を扱えるAIアシスタントの実現には近づいているものの、私たちのお金を完全に任せられるようになる前に、情報の検索方法を修正する必要があると結論づけています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →