← 最新の論文
💬 NLP

Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

本論文は、従来の非構造化ベンチマークにおける因果的な曖昧さを克服するために、完全交差型要因実験とトークンレベルの確率分析を組み合わせることで、LLMの態度とバイアスを精密に測定する解析的に厳密なフレームワークを導入するものである。

原著者: Davood Wadi, Mohsen Ghodrat, Matthew Philp

公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Davood Wadi, Mohsen Ghodrat, Matthew Philp

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で見えないロボットが世界について何を考えているのかを解明しようとしているところだと想像してみてください。このロボットは車を作ったり洗濯物を畳んだりするものではありません。これは、人間がこれまでに書いたほぼすべての文章を学習した超スマートなコンピュータプログラム、「大規模言語モデル(LLM)」です。これらのモデルは会話が非常に上手くなっているため、企業はそのモデルに自律的なエージェントとして振る舞わせ、独自の判断を下したり人々と対話させたりし始めています。しかし、ここには落とし穴があります。私たちは彼らが実際に「何を信じているのか」を本当の意味では理解していません。隠れた偏見を持っているのでしょうか? 特定の国や人々を好む傾向があるのでしょうか? これを知るために、科学者たちは通常、ロボットにあらゆるランダムな質問を数千回投げかけ、その回答を見ていきます。それはまるで、ある見知らぬ人の性格を推測するために、何百万もの異なる質問をするようなものです。問題は、あまりにも多くのランダムな質問をしすぎると、ロボットの答えが深いレベルでの信念によるものなのか、それとも単に質問の仕方が変だったせいなのかを判別できなくなることです。それは、ピザへの愛を知ろうとするのに、ピザについての質問だけでなく、好きな色や靴のサイズ、天気についても混ぜこぜにして聞いているようなものです。大量のデータは得られますが、ピザへの愛と靴のサイズの区別をつけることができません。

ここで、この混乱を整理するための新しい論文が登場します。研究者のダヴード・ワディ、モフセン・ゴドラト、マシュー・フィルプは、無作為な質問を行うのをやめ、制御された科学実験を開始することにしました。彼らは予測に基づいた調査ではなく、AIを心理学クラスの実験被験者のように扱いました。彼らは、ロボットが言葉を発する前の「思考」を見る特殊な数学的手法を用いました。通常のテストは、ロボットが回答をタイピングして出力されるのを待ちますが(そこにはノイズやランダム性が含まれます)、このチームはロボットの内部にある確率スコア、つまり、あらゆる可能な単語を選択できる正確な数学的確率を直接観察しました。これにより、彼らは生成されるテキストから生じるノイズの影響を受けることなく、完璧な精度でロボットの「態度」を測定することができたのです。彼らはこの手法を、「消費者エスノセントリズム(自国中心主義)」という特定のテーマに対して検証しました。これは、基本的にはどれだけ自分の国を愛し、外国を嫌うかという概念です。彼らは、異なる国で作られたロボットたちが 실제로 異なる国家的なバイアスを持っているのか、あるいはそれらのバイアスが不適切なテスト方法によって引き起こされた錯覚なのかを調べたかったのです。

ロボットの人格テスト

AIをテストする従来の方法を考えるなら、それは混沌としたゲーム「ロバの尻尾付け」のようなものです。あなたはロボットをぐるぐると回転させ、ランダムな質問が入った大きな袋を手渡し、それが何を言うかを観察します。もしロボットが偏った発言をしたとしても、なぜそうなったのかまでは分かりません。女性を嫌っているからでしょうか? それともリーダーシップに関する質問だったからでしょうか? あるいは単なる偶然でしょうか? 古い方法はこれらの原因をすべて混ぜ合わせてしまうため、ロボットの核となるパーソナリティと、紛らわしいプロンプトに対する一時的な反応との違いを見分けることは不可能です。

本論文の著者たちはこう述べています。「ドンキーを回転させるのはもうやめましょう!」 彼らは代わりに、全てのマス目が特定のテストとなっている、巨大な数独パズルのような完全に組織化されたグリッドを設定しました。彼らは実験をレシピのように扱いました。「どのロボットか?」と「どの国について問われているか?」のあらゆる組み合わせを取り、それらを全てテストしたのです。彼らは5つの異なるロボット(アメリカ、中国、カナダ、フランス)を使用し、4つの異なる国について尋ねました。この「完全交差型」のデザインにより、彼らは何がバイアスの原因であるかを数学的に分離できました。それはロボット自体なのでしょうか? 話題になっている国なのでしょうか? あるいは両者の奇妙な組み合わせなのでしょうか?

ノイズなしでロボットの心を読む

ここが最も素晴らしいトリックの部分です。通常、私たちがAIに質問するとき、AIは次に言うべき単語を決めるためにダイスを転げるように、(サンプリングと呼ばれる)一つの単語を選び、次の単語を選び……と繰り返していきます。この「ダイス転がし」は、多くのノイズを生みます。同じ質問を10回しても、少しずつ異なる回答が得られる可能性があり、どれが「真の」回答であるかを知るのは困難です。

この論文はこのプロセス全体をスキップしています。ロボットが話し始めるのを待つのではなく、研究者はロボットの内部にある「確率マップ」(確率質量関数:PMFと呼ばれます)を分析しました。イメージとしては、ロボットの中に秘密のダッシュボードがあり、評価スケールの「1」「2」「3」……「7」と言う確率がそれぞれ何%であるかが表示されていると考えてください。研究者はロボットが一つを選ぶのを待つのではなく、そのダッシュボード全体を一気に見たのです。これは、ダイスを投げる前に、そのダイスがどのように重く作られているかを正確に把握している状態と同じです。この正確なマップを分析することで、彼らはすべてのランダムなノイズを除去することができました。彼らは、ギザギザで乱雑な線ではなく、滑らかで完璧な曲線として、ロボットの真の「意見」を見ることができたのです。

研究結果:ロボットには国民的なアイデンティティがある(程度による)

彼らがこの極めて精密な手法を「自国の愛着」というテーマに適用したとき、古い、乱雑な手法では見逃されていたであろう驚くべき発見がありました。

第一に、一部のロボットは非常に一貫していますが、他のロボットはある程度カオスであることを発見しました。例えば、「Ministral」(フランス製)という名前のロボットはルールを守るのが苦手で、しばしばバラバラな回答を示す傾向がありました。一方で、アメリカ製のロボット(LlamaおよびGemma)と中国製のロボット(Qwen)は、非常に集中しており、一貫していました。

第二に、ロボットには確かに「国家的バイアス」が存在するように見えますが、それは複雑です。アメリカ製のロボット(LlamaとGemma)は、北米諸国(米国とカナダ)を明確に好み、中国を嫌う傾向を示しました。これはいわゆる「内集団贔屓(イングループ・フェイバリズム)」と呼ばれるものです。しかし、それは単純な「我が国を愛する」という物語ではありませんでした。カナダのロボット(Aya)や中国のロボット(Qнам/Qwen)は、同様の強い「自国愛」のバイアスは見せませんでした。実際、中国のロボットはこのテストにおいて自国に対する特筆すべきバイアスをほとんど示さず、相互作用効果はゼロ付近を漂っていました。

しかし、最も重要な発見は、従来のメソッドがいかに我々に嘘をついていたかということです。もし旧来の手法を用いて全回答の平均を取っていたならば、すべてのロボットがフランスや中国を嫌っていると考えてしまったでしょう。ところが、研究者がこの新しい「厳密な数学」を用いたとき、それが間違いであることがわかりました。フランスのロボット(Ministral)は実はフランスを好きであり、カナダのロボット(Aya)は実は中国が好きであったのです。旧来の手法は、他のロボットのネガティブな感情と混ざり合うことで、こうした個別のポジティブな感情を隠してしまっていました。新手法は層を剥ぎ取り、バイアスとは画一的なものではなく、どのロボットをテストするか、そして具体的に何を問うかによって全く異なるものであることを明らかにしました。

なぜこれが重要なのか

また、この論文は、従来のテスト方法がいかに危険なほど信頼できないものであるかも示しました。ランダムな「ダイス転がし」のために、旧来の手法ではバイアスの方向性を間違えてしまうことがよくあります。時には、単なるランダムなノイズによって、本来はネガティブなのにポジティブであると判定してしまうこともあります。著者は、旧来の手法を用いると、偶然だけでバイアスの符号が逆転(プラスマイナスが入れ替わる)してしまう可能性があると算出しました。一方、彼らの新しい手法は、ロボット内部の正確な数学を注視するため、このようなミスを犯すことはありません。

要約すると、この論文は、もし私たちがこれらの強力なAIエージェントが本当に何を考えているのかを理解したいのであれば、彼らをランダムなテキストを吐き出すブラックボックスとして扱うのをやめるべきだと主張しています。私たちは彼らを科学的な計器として扱い、その内部の数学を見る必要があります。そうすることで、ようやくロボットの本物のパーソナリティをテストに伴うノイズから切り離し、彼らを現実世界へ導入する際に、どのようなバイアスを携えているのかを確実に把握することができるようになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →