A Multi-Model, Multi-Domain Benchmark of Large Language Model Agreement with Humans and with Each Other in Sentiment Classification
本論文は、5つの大規模言語モデル、ルールベースの辞書、および教師ありトランスフォーマーを人間の注釈に対して評価するマルチドメインのベンチマークを提示しており、Claude Opus 4.7やGPT-5.5のような最上位のモデルが人間と高い整合性を達成している一方で、モデル間および人間によるラベルとの間で、特に非公式なテキストにおいて重大な不一致が存続していることを明らかにしており、モデルの選択が感情分類の結果に実質的な影響を与えることを示している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語を読み、理解するコンピュータの世界には、インターネットの誕生と同じくらい古いタスクが存在します。それは、あるテキストが「嬉しい」のか、「悲しい」のか、あるいは単に「事実を述べている」だけなのかを見極めることです。これは「感情分析(センチメント分析)」と呼ばれます。長年、人々はこれらのツールを使い、ニュース報道に対して株式市場がどのように反応するかを予測したり、顧客が製品に対して怒っているかどうかを確認したり、あるいは健康危機における世論の動向を追跡したりしてきました。最近では、物語を書いたり、質問に答えたり、会話を行ったりできる、これらと同じ種類のシステムである「大規模言語モデル」として知られる新しい世代のコンピュータプログラムが登場しました。これらは人間言語を理解することに非常に長けているため、多くの人々が、人間のレビュー担当者の遅くて高価な作業をたった一つのコンピュータコマンドに置き換えることを期待して、テキストを感情によって分類する仕事にこれらを利用し始めています。
しかし、この新しいアプローチには問題があります。ある映画のレビューが皮肉なのか、それとも真実なのかについて、人によって意見が分かれることがあるように、これらの異なるコンピュータプログラムも互いに意見が一致しないことがあるのです。あるプログラムはある文章を「ポジティブ」と呼び、別のプログラムは全く同じ文章を「ネガティブ」と呼ぶかもしれません。もし銀行や病院が重要な意思決定を行うためにこれらのツールに依存しているならば、どのツールを選ぶかは極めて重要な問題となります。これまで、これら異なるプログラムが、同じテキストを見ているときに、どれほど上手く互いに一致しているのか、あるいは実際の人間の判定者とどれほど一致しているのかを、体系的にチェックした人は誰もいませんでした。
研究者のアニッシュ・K・サジャン(Aneesh K Sajan)氏は、この疑問を解決するために、大規模で制御された実験を行うことにしました。彼は、4つの異なるテクノロジー企業から提供された最も高度な5つの言語モデルと、ベースラインとして機能する2つの古い単純なツールを集めました。彼は、5つの異なるデータセットから抽出された合計8,872の文章を彼らに与えました。これらの文章は、フォーマルな財務報告書、カジュアルなソーシャルメディアの投稿、映画のレビュー、決算説明会など、さまざまなソースから集められたものです。目的は、コンピュータが人間のラベル付けと比較して、テキスト内の感情を正しく特定できるかどうかを確認することであり、さらに重要なのは、コンピュータ同士がどの程度一致しているかを見ることでした。
結果は、パフォーマンスの明確な分裂を明らかにしました。Anthropicという会社とOpenAIという会社のモデルの2つが、最も正確であるとして際立っていました。これら2つのモデルがフォーマルな財務テキストを見たとき、彼らは人間の判断とほぼ完璧に一致しました。また、彼らは分析した文章の90パーセント近くで互いに一致していました。OpenAIの第3のモデルもそのすぐ後ろに迫っており、世界を同じように捉える高パフォーマンスなツールのグループを形成していました。しかし、問題を「考えて」から回答するように設計されたGoogleのモデルは、衝撃的なほど低いパフォーマンスを示しました。このモデルは感情を誤る頻度が非常に高く、その結果はランダムな推測とほとんど変わりませんでした。研究者は、この失敗が、Googleのモデルが単純な質問に対して時間をかけすぎていることによるものか(「考えすぎ」と呼ばれる現象)という特定の理論を検証しました。彼はモデルに、より短い思考時間で回答するように強制しましたが、低いパフォーマンスは改善されませんでした。これにより、モデルが単にタスクを過剰に分析していたのではなく、その特定のモデルがこの設定においてどのように振る舞うかという性質自体に失敗の原因があることが判明しました。
研究者の自身のコンピュータ上で実行できるオープンソースのモデルは、中程度のパフォーマンスを示しました。それはトップクラスの商用モデルほど正確ではありませんでしたが、長年使用されてきた古いルールベースのツールよりは大幅に優れていました。また、研究ではテキストの種類が非常に重要であることも分かりました。すべてのモデルは、ツイートやテキストメッセージのようなカジュアルで非公式な言語よりも、フォーマルでプロフェッショナルな文章を理解することにずっと長けていました。非公式なテキストにおいては、最高のモデルであっても、一致度は「中程度」のレベルにまで低下し、人間や他のモデルとの間で依然として多くの文章で意見が食い違っていました。
おそらく最も驚くべき発見は、モデル同士が実際にどれほど一致していないかという点でした。研究者がこれら6つのツール全体を調査したところ、すべてのツールが全く同じ回答を出したのは、わずか14〜24パーセントの文章だけでした。残りの文章については、明確な多数派は存在しませんでした。これは、人々が日々分析している膨大な量のテキストにおいて、最終的な結果が「どのコンピュータプログラムを使用しているか」に完全に依存していることを意味します。もし金融アナリストが、あるレポートを読むために一つのモデルを使い、別のアナリストが別のモデルを使えば、彼らは同じニュースに対して正反対の結論に達する可能性があるのです。
この研究は、これらの新しいツールは強力ではあるものの、互換性があるわけではないと結論付けています。モデルの選択は、単なる些細な技術的詳細ではなく、データそのものを変えてしまう決定なのです。フォーマルな財務文書のタスクにおいて、トップクラスのモデルは信頼でき、一貫しています。しかし、非公式なテキストや、ポジティブとネガティブの差が微妙なタスクにおいては、モデル間の不一致は純粋な不確実性の兆候です。このような場合、単一のコンピュータに頼ることはリスクが高いと研究者は示唆しています。代わりに、複数のモデルを併用するか、コンピュータ間で意見が分かれた箇所については人間がレビューを行い、最終的な決定が単にどのソフトウェアが選ばれたかによるものではないことを確実にするのが最善のアプローチです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。