Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval
DS@GTチームは、BGE-M3埋め込みと重み付き相互ランク融合(Reciprocal Rank Fusion)、および次トークンの対数確率による直接的な選択肢スコアリングを組み合わせた、多言語金融QAのための言語ルーティング型検索拡張パイプラインを提案しており、最適なパフォーマンスには言語固有のモデル選択と、特定の言語における思考の連鎖(chain-of-thought)プロンプティングの慎重な回避が必要であることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
難しいパズルを解こうとしている自分を想像してみてください。ただし、自分の脳力だけで解くのではなく、すぐ隣に膨大な参照書籍のライブラリがある状態です。これが**検索拡張生成(RAG)**の世界です。これは、テストを受ける際に、答えを書く前に教科書で事実を調べることが許されている学生のようなものです。通常、コンピュータは質問が英語であればこの作業が得意ですが、質問がスペイン語やギリシャ語、あるいはヒンディー語になると、事態は複雑になります。「ライブラリ」は英語の本でいっぱいでも、他の言語については空っぽかもしれませんし、たとえ外国語の本を見つけたとしても、学生がその読み方を知らないということも起こり得ます。
この論文は、非常に具体的で、極めて重要な局面におけるこの問題に取り組んでいます。それは金融資格試験です。これらは単なるトリビアではありません。公認会計士や財務アナリストになるための複雑なテストであり、お金、法律、会計規則に関する深い論理的思考を必要とします。著者たちが投げかける大きな問いは、「コンピュータ・システムは、これら難解な金融試験を、英語と同じくらい高い精度で、5つの異なる言語(英語、スペイン語、ギリシャ語、中国語、ヒンディー語)でパスすることができるのか?」という点です。この答えが重要なのは、金融はグローバルであるにもかかわらず、ほとんどのコンピュータの「脳」は主に英語で訓練されており、他の言語での金融用語の扱いにおいて大きな空白が生じているからです。
チームの大きな実験:スマートで多言語に対応した名探偵
ジョージア工科大学の研究者たちは、自らのチームをDS@GTと呼び、これらの金融試験の問題を解決するためのデジタル探偵システムを構築しました。彼らのシステムは、ただ推測するのではなく、彼らが「パイプライン」と呼ぶ厳格な3ステップのプロセスに従います。
ステップ1:言語探偵
まず、システムは質問を見て、「この言語は何語か?」と問いかけます。それは、クラブの入り口でIDをチェックするドアマンのようなものです。もし質問がギリシャ語であれば、システムはライブラリの「ギリシャ語セクション」から本を取り出す必要があると認識します。もしライブラリがその言語に対して空である場合(ギリシャ語やヒンディー語のようなマイナーな言語で起こります)、たとえ異なる言語であっても、似たような概念を持つ「グローバル・セクション」から本を拾い上げます。彼らは、質問の意味を普遍的なコードへと変換するために、BGE-M3と呼ばれる特別なツールを使用しました。これにより、言語の壁を越えて関連する例を見つけることが可能になりました。
ステップ2:モデル・ルーター(適切な仕事のための「右脳」)
ここで、チームは驚くべき発見をしました。彼らは、あらゆることに対して一つの巨大なコンピュータの脳を使用していたわけではありません。彼らは、異なるコンピュータの脳が、異なる言語に適していることを発見したのです。
- 英語については、Qwen2.5-14Bというモデルを使用しました。
- ギリシャ語については、驚くべきことに、より小さなモデルであるLlama-3.1-8Bが実はスーパースターであり、より大きなモデルを大幅に(約19.5ポイント)上回ったのです!
- 中国語、ヒンディー語、アラビア語については、Qwen3-14Bを使用しました。
もし彼らが、全員に対して単に「最高」のモデルを使用していたら、英語やギリシャ語で惨敗していたでしょう。それは、マラソンランナーは長距離には適しているが、チェスをさせるには向いていないと気づくようなものです。それぞれのタスクに対して、異なるスペシャリストが必要なのです。
ステップ3:スコアラー(推測ゲームの終焉)
通常、コンピュータが質問に答えるとき、彼らは「答えはCです」のように、答えを「書こう」とします。これは、コンピュータが長い文章を書いてしまい、結局どの文字を選んだのかを言い忘れるというミスにつながくことがよくあります。DS@GTチームは、**検索拡張直接スコアリング(RADS)**と呼ばれる巧妙なトリックを使用しました。答えを「書く」代わりに、システムは単純に数学的な計算を行います。「『A』という次の単語が現れる確率はどのくらいか?『B』は?『C』は?」そして、最も高い数学的スコアを持つ文字を選びます。これは、コンピュータがエッセイを書く必要はなく、ただ正解のマークを指し示すだけの選択式テストのようなものです。この手法により、他の手法が苦戦した中国語の質問においても、ほぼすべての「パース失敗(解析失敗)」(コンピュータが自身の回答を読み取る際のミス)を排除し、100%の成功率を達成しました。
驚くべき発見
チームは数千回のテストを実施し、AIの常識を覆すいくつかのルールを見つけ出しました。
考えすぎることは悪となる: 多くの人々にとって、「思考の連鎖(Chain-of-Thought)」(AIに推論の過程をステップごとに説明させること)は助けになります。しかし、ギリシャ語の質問においては、これが実際にパフォーマンスを破壊しました。精度は、素晴らしい**90.7%から、ひどい20.9%**へと低下しました。これらの特定のギリシャ語の質問は、数学の問題を解くことよりも事実の分類に関するものであるため、「思考を声に出す」ようにさせると、AIを混乱させてしまうことが判明しました。AIは正しいカテゴリーを選ぶ代わりに、物語を書き始めてしまったのです。
「思考モード」の罠: モデルQwen3には、回答の前に「思考」セクションを書くデフォルト設定があります。チームは、これをオンにしたままにしておくと、アラビア語における文字選択(RADS)の能力が、ランダムな推測に近いレベルまで崩壊することを発見しました。システムを機能させるためには、この「思考モード」を手動でオフにする必要がありました。
翻訳は罠である: 彼らは、他の言語の質問を英語に翻訳し、それを解いてから元の言語に翻訳し戻すという試みを行いました。これは悲惨な結果でした。翻訳によって重要な金融の詳細が失われ、スコアは元の言語で解いた場合と比較して、20ポイント近く低下しました。
データも重要だが、モデルの方が重要である: ヒンディー語については、ライブラリにネイティブのヒンディー語の例を追加することは、わずかながら(約1パーセント)助けになりました。しかし、彼らのシステムとトップクラスの商用AI(Claude Opus 4.7)との間の差は巨大でした(17パーセント)。これは、低リソース言語における問題は、単にライブラリに本を増やすことではなく、コンピュータの脳自体が、その特定の言語の金融用語についてより深く訓練されている必要があることを示唆しています。
最終スコアカード
チームが公式のFinMMEval 2026コンペティションにシステムを提出したところ、良好な成績を収め、ほとんどの言語でトップ10に入りました。
- アラビア語: 76.0%(10位)
- ヒンディー語: 73.5%(7位)
- 英語: 69.5%(9位)
- 中国語: 64.5%(9位)
彼らは1位を獲得したわけではありません(トップのチームは90%を超えています)が、彼らの研究は極めて重要な教訓を証明しました:**「万能な解決策(One size fits all)は存在しない」**ということです。グローバルに機能する金融AIを構築するには、単一のモデルと単一の戦略を用いるだけでは不十分です。異なる言語を異なるモデルへとルーティングし、タスクに応じて異なる思考戦略を選択し、回答を文章として書くのではなく数学的にスコアリングする必要があります。グローバルな金融AIの未来は、単一のスーパーブレインではなく、正しい言語を話し、正しいツールを使うスペシャリストたちのチームなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。