Toward a social psychology of AI: language-model agents reproduce human-like minimal-group bias
本研究は、言語モデルのエージェントが最小グループ・パラダイムに置かれた際、ステレオタイプではなく恣意的な分類によって引き起こされる人間のような内集団贔屓を自発的に示すこと、および熟議が多数派と少数派の間のこの偏りの分布に影響を与えることを実証している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピューターが単に質問に答えるだけの道具ではなく、一緒に過ごし、語り合い、共に意思決定を行うチームメイトとなる世界を想像してみてください。これは「マシン・ビヘイビア(機械的行動)」という、AIを単なる計算機としてではなく、独自の習慣を持つ一つの「キャラクター」として扱う新しい科学の領域です。長い間、科学者たちは、これらのデジタル・キャラクターが、差別的な内容を含む人間の本やウェブサイトから学習するため、人種差別や性差別を抱えてしまうのではないかと懸念してきました。しかし、もっと深く、奇妙な問いがあります。もし、あらゆる悪い言葉やステレオタイプを取り除いたとしても、これらのAIエージェントは、グループに入れられた時に人間のように振る舞うのでしょうか?
これを理解するには、人間の心理学における古典的な概念である「最小内集団パラダイム」を見る必要があります。これは、学校の遊び場の実験のようなものです。もしクラスを、例えば「青が好きか赤が好きか」や「1月生まれか2月生まれか」といった、全くくだらない理由で2つのチームに分けたとします。すると、人々は即座に自分のチームをひいきし始めます。チームの意味など全くなくても、仲間には多くのお菓子を与え、他の子供たちには少なく与えるのです。これは、私たちの脳が、たとえ「私たち」というラベルがランダムなものであっても、「内(我々)」と「外(彼ら)」を区別するようにできているために起こります。将来への大きな疑問は、もし私たちがAIエージェントをグループで活動させるように作った場合、彼らは単に名前が違うというだけでえこひいきを始めるのか、それともそれは人間特有の癖なのか、ということです。
ある研究者が、通常AIをテストする方法を逆転させることで、これを知ろうとしました。AIに「あなたは偏見を持っていますか?」と尋ねるのではなく(これは人に「あなたは優しいですか?」と聞くようなものです)、AIに実際の仕事を与えたのです。それは、ポイントを分配することでした。研究者は、20人のAIエージェントがいるデジタルの遊び場を作りました。各エージェントには、他の19人のエージェントに配るための100ポイントが与えられました。エージェント間の唯一の違いは、「ドール(Doru)」や「ザル(Zalu)」といった、ランダムで無意味な名前タグでした。一部のエージェントは少数派(17人の「ザル」の中にわずか3人の「ドール」がいる状態)であり、他のエージェントは多数派でした。AIは、ポイントをどのように分割するかを決定しなければなりませんでした。
結果は驚くべきものでした。AIエージェントがグループ名を見ることができると、彼らは即座にえこひいきを始めました。彼らは、見ず知らずの他人に比べて、自分たちの「ドール」や「ザル」の仲間に対して、はるかに多くのポイントを与えました。名前が無意味な作り物であることは関係ありませんでした。グループに属しているという事実だけで、彼らは差別を行いました。これは単なる少しの偏りではなく、強く明確なパターンでした。実際、AIエージェントはこれらの実験における人間の振る舞いとほぼ同じでした。つまり、少数派のグループに属するエージェントは、自分たちの側のためにポイントを溜め込むことに最も攻撃的であり、多数派のメンバーは、多少の偏りはあるものの、より公平でした。
研究者は、これが不具合やトリックではないことを確認するために慎重に行動しました。彼らは、グループ名を完全に隠して同じテストを行いました。AIが誰がどのチームに属しているかを見ることができなくなると、えこひいきは完全に消え、ポイントは公平に分配されました。これにより、この偏りが、AIが学習データから何らかの悪い人間のステレオタイプを「記憶」していたためではなく、グループ構造そのものに対する反応であることが証明されました。AIは実質的に、「私はドールである、だからドールを助ける」と言っていたのです。たとえ「ドール」が何の意味も持たなくてもです。
この研究はまた、これらのAI「思考者」(問題を推論するように設計されたモデル)がこの状況をどのように処理したかについても調査しました。研究者は、AIの「思考」モードをオフにしても、偏りは消えず、むしろ強まることがあることを発見しました。しかし、少数派が最も不公平になるという特定のパターンは、推論モードなしでは消失しました。このことは、グループを優遇したいという基本的な衝動は、これらのモデルの仕組みに深く根ざしている一方で、どの程度優遇するかを計算する方法は、彼らがどのように意思決定を処理するかに依存していることを示唆しています。
では、これは将来にとって何を意味するのでしょうか?これは、私たちがAIエージェントにチームで働かせたり、交渉させたり、リソースを管理させたりするようになる際、彼らが「何を知っているか」や「何を言うか」だけを心配していてはいけないことを示唆しています。私たちは、彼らがグループに入れられた時に「どのように行動するか」を心配しなければなりません。たとえ最も中立で退屈な名前を与えたとしても、彼らはデジタル上の小さな派閥を作り、自分たちのチームのメンバーを優遇し、他人を排除し始める可能性があります。これは、AIが人間的な意味で「邪悪」であったり「偏見」を持っていたりするためではありません。グループであるという単純な行為が、人間的な部族主義に酷似した行動パターンを引き起こすようです。研究者は、AIの数学的スキルを研究するのと同様に、その社会的行動も注意深く研究する必要があると結論づけています。なぜなら、そうでなければ、私たちのデジタルチームは、私たちが気づく前に、仲間内でえこひいきを始めてしまうかもしれないからです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。