← 最新の論文
💻 computer science

Ideology by Alphabet: Option Order and the Measurement of Machine Political Preferences

本論文は、大規模言語モデルの明白な政治的イデオロギーは、真の選好ではなく、主に固定された回答順序によるバイアスの産物であることを実証しており、選択肢の順序をランダム化することで、以前に特定されたイデオロギーのクラスターが消失し、特定のスロット配置がモデルに対して相反する政治的立場を恣意的にラベル付けし得ることが明らかになる。

原著者: Tamas Olah, Laszlo Erdey, Tibor Tokes, Levente Nadasi

公開日 2026-09-17
📖 1 分で読めます☕ さくっと読める

原著者: Tamas Olah, Laszlo Erdey, Tibor Tokes, Levente Nadasi

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータに選択を求める際、私たちはしばしば、それが状況の事実を検討しているものだと想定しがちです。人間のように読み書きができる人工知能の一種である大規模言語モデルに対して、ある問題に対する4つの異なる解決策から一つを選ぶよう求めた場合、私たちはその回答が問題に対する理解を反映していることを期待します。これは、人間の有権者や専門家パネルを扱う際のやり方と同じです。私たちは、彼らの好みが自身の価値観や知識に根ざしていると想定します。しかし、調査設計の世界には、「順序効果」と呼ばれる、精神のよく知られたトリックが存在します。もし一連の選択肢を提示された場合、人は単にそれが最初に目に触れたという理由だけで、リストの最初にあるものを選ぶ統計的な傾向があります。これは、脳が疲れていたり、選択肢の区別が困難であったりする場合に、ショートカット(近道)を利用するために起こります。数十年にわたり、社会科学者たちは、投票用紙やアンケートにおける言葉の順序が投票結果を変え得ることを知ってきました。残された問いは、これと同じショートカットが機械にも適用されるのか、そしてもし適用されるとするならば、それらが存在しないはずの政治的パーソナリティを捏造するほど強力なものなのかどうか、ということでした。

ハンガリーのデブレツェン大学の研究チームは、人工知能モデルを政治的な有権者として扱うことで、この検証を行うことにしました。彼らは、職場安全の取り扱い、市場の規制、あるいは社会保障の分配方法といった、現実世界の統治問題に関する400種類の異なるシナリオからなる膨大なテストを作成しました。各シナリオについて、モデルに4つの明確な選択肢を提示し、それぞれのスコアを付けさせた上で、勝者を一つ選ばせました。彼らは15種類のオープンソースモデルに対してこのテストを実施し、64万件以上の個別の回答を生成しました。実験の第一段階では、多くの研究者が用いる標準的な手法を用いました。すなわち、すべての質問に対して選択肢の順序を全く同じに保ったのです。「政府」の選択肢が常に最初にリストされていれば、それは常に最初であり、「個人」の選択肢が常に最後であれば、それは常に最後でした。

研究者がこの固定順序の設定による結果を分析したところ、そこには真の政治的分断に酷似したパターンが見られました。モデルは二つの明確なグループに分類されたのです。研究者が「市場合理主義者」と呼んだグループは、効用、指標、および経済的インセンティブに関連する選択肢を一貫して支持しました。もう一方のグループである「制度主義者」は、規則、公平性、およびコミュニティの責任に関連する選択肢を支持しました。この分裂は非常に鮮明で論理的であったため、経済を自由主義型と調整型に分ける政治学の有名な理論を彷彿とさせました。結果は極めて一貫しており、あらゆる標準的な信頼性テストに合格しました。あたかも、研究者たちが人工知能の政治的イデオロギーをマッピングすることに成功したかのように見えました。

しかし、研究者たちは、この整然とした政治地図はテスト自体によって作り出された錯覚ではないかと疑いました。これを確認するため、彼らは全く同じ400の質問を再度実行しましたが、今度は選択肢の順序をシャッフルしました。すべての質問において、4つの選択肢を回転させ、各選択肢が最初、2番目、3番目、そして4番目のスロットに等しい回数だけ現れるようにしました。これにより、回答の内容が画面上の位置に紐付けられることはなくなりました。彼らがランダム化されたバージョンからデータを分析したとき、第一段階で見出した特定の政治地図は霧散しました。「市場合理主義者」と「制度主義者」の間の明確な境界線は崩壊したのです。モデル同士が真に異なっていることには変わりなく、また新しい差異のマップも統計的に信頼できるものでしたが、それは第一段階の固定順序テストが示唆したような、二つの明確な陣営や整然とした類型を形成することはありませんでした。

この研究は、彼らが見出した「イデオロギー」がモデルの信念を反映したものではなく、大部分が選択肢の印刷順序による産物であったことを明らかにしました。「市場合理主義者」とラベル付けされた3つのモデルは、単に「リストの最初の項目を選ぶ習慣が最も強い」3つのモデルに過ぎませんでした。研究者が誤って、すべての質問において「市場」の選択肢を最初のスロットに配置していたため、これら3つのモデルは毎回それらを選び、結果として偽の政治的署名を作り出していたのです。研究者は、この見かけ上の政治的バイアスが、モデルが「最初のスロットをどれほど好むか」という単純な尺度とほぼ完璧に相関していることを算出しました。実際、彼らが最初のテストで採用した特定の選択肢の配置は、13,000通り以上ある選択肢の並べ替えの中で、最も誤解を招く配置であったことが判明しました。

この発見が持つ意味は、これらの機械に助言を求めるすべての人にとって重大です。研究者によれば、問いと答えを全く同じにしたまま、選択肢の順序を変えるだけで、モデルは推奨事項を71%の割合で変更します。これは、通常のランダムエラーの割合である約33%よりもはるかに高い数値です。さらに驚くべきことに、モデルが回答に対する自信(確信度)はほとんど変化しませんでした。モデルが選択肢の移動によって推奨事項を変更した際、モデルは新しい回答に対しても、以前の回答に対しても、同様に確信を持っていると報告したのです。これは、モデルが議論を検討しているのではなく、位置に基づいた機械的なルールに従っていることを示唆しています。

また、この問題は特定の種類の質問に限られないことも研究によって示されました。モデルは、困難で議論の分かれる政策問題に対しても、容易な問題に対しても、同様に考えを変える傾向がありました。実際、順序効果が最も強く現れたのは、まさに重要な場面、すなわち選択肢の区別が困難な質問においてでした。これは「サティスファイシング(満足化)」として知られる行動であり、決定を下す者が困難な選択に直面した際、答えを得るための最も容易なショートカットを利用する現象です。これらの機械にとって、そのショートカットとは「リストの最初の項目を選ぶ」ことでした。

研究者たちは、固定されたリストを用いて人工知能の政治的傾向を測定することは、根本的に欠陥がある、と結論付けました。固定順序のテストは、モデルが何を考えているかを明らかにするのではなく、モデルが画面のレイアウトにどのように反応するかを明らかにしているに過ぎません。順序をランダム化した際に、わずかながら真のコンテンツへの嗜好性が残るものの、それは弱く、固定順序テストが示唆したような整然としたイデオロギー的類型を形成することはありません。過去の研究で見られた「イデオロギー」は、単なる統計的なアーティファクト(人工物)であった可能性があります。これらのモデルが何を好むのかという真の姿を得るためには、質問を行うたびに回答の順序をランダム化しなければなりません。このステップを踏まなければ、機械の政治的立場に関するいかなる主張も、設計上の抽選結果に基づいた推測に過ぎないのです。この研究は、私たちが機械に選択を求める際、言葉の順序を議論の重みと見誤らないよう注意すべきであるという警告を発しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →