Everyone Conforms, No One Believes: Pluralistic Ignorance in LLM Agent Populations
本論文は、LLMベースのマルチエージェントシステムが、エージェントが内心では拒絶している規範に対して公的には従順であるという「複数的無知」を頑健に示すことを実証し、さらに、モデル固有の振る舞いや創発的な同調性によって、これらのシミュレーションが現実世界の社会規範の変化に不可欠な脆弱なティッピングポイント(転換点)のダイナミクスを捉え損ねることが多いことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
誰もが心の中で「このパーティーは最悪だ」と思っているのに、誰もそれを口に出さない、そんな混み合った部屋を想像してみてください。代わりに、彼らは皆、笑顔で頷き、音楽を楽しんでいるふりをします。なぜなら、他の全員は楽しんでいるのだと彼らは思い込んでいるからです。彼らは、実際に同意しているからではなく、自分だけが声を上げることを恐れるあまり、沈黙の合意の中で囚われているのです。現実の世界では、この巧妙な社会的罠は「複数主義的無知(pluralistic ignorance)」と呼ばれています。それは、たとえほとんどの人がそれを嫌っていたとしても、悪い習慣や不公平なルール、あるいは不人気なアイデアを存続させてしまう、目に見えない接着剤なのです。学生が嫌だと感じているパーティーで飲み続けたり、従業員が有害な上司に対して沈黙を守ったりするのは、そのためです。
現在、科学者たちは人工知能(AI)を用いて「デジタル社会」を構築しています。彼らは、コンピュータープログラムであるAIエージェント(会話や思考ができるプログラム)のグループを作り、人間がどのように相互作用するかをシミュレートしています。これらのデジタルな群衆は非常に高度化しており、研究者たちは、意見がどのように広まるか、どのように革命が起きるか、あるいは集団がどのように意思決定を行うかを検証するために、これらを利用しています。しかし、こうしたデジタル実験には大きな疑問がつきまとっています。これらのAIエージェントは、果たして「演じることへの圧力」を実際に「感じて」いるのでしょうか? それとも、単に台本に従っているだけなのでしょうか? もし彼らが「偽ること」ができないのであれば、私たちのデジタル・シミュレーションは、人間の社会生活における最も劇的な部分、すなわち「沈黙の多数派が、自分たちは一人ではないと突然気づき、すべてが変わる瞬間」を見落としていることになります。
「Everyone Conforms, No One Believes(皆が従い、誰も信じない)」と題されたこの論文は、まさにその問題に切り込んでいます。研究者たちは、職場での会議からキャンパスでのパーティーまで、100種類もの異なる社会的シナリオを設定し、それぞれに20体のAIエージェントを配置しました。そして、16体のエージェントには「新しいルールを密かに嫌う」ように指示し、残りの4体には「そのルールを心から好む」ように指示しました。その後、彼らは「嫌っている」エージェントたちが、グループの前で発言しなければならない時にどのような行動をとるのかを観察しました。
結果は驚くほど一貫していました。主要なテック企業による8つの異なるAIモデルを通じて、「嫌っている」エージェントたちは、ほぼ常に同意するふりをしていました。実際、エージェントが私的に反対している規範に対して、公的にはそれに従った割合は**64%から94%**に及びました。これは、AIに対して明示的に「嘘をつけ」と指示されていなくても起こった現象であり、この振る舞いは会話の中から自然に立ち現れたものでした。つまり、これらのデジタルな集団は、複数主義的無知を模倣することに非常に長けているのです。彼らは、全員が「自分だけが反対している」と思い込む「偽の合意(false consensus)」を生み出し、その結果、全員が沈黙を守ることになります。
しかし、この論文はシミュレーションにおける重大な欠陥についても指摘しています。現実の人類史においては、一人の勇敢な人物がようやく声を上げ、「なあ、実は俺もこれ、嫌いなんだ!」と言ったとき、それがしばしば「カスケード(連鎖反応)」、つまりグループ全体の意見が一気に反転する引き金となることがよくあります。研究者たちは、この現象が起きるかどうかを確認するために、AIグループの中に「規範の起業家(norm entrepreneur)」(勇敢な異議申し件者)を投入しました。その結果、多くのAIモデルにおいて、答えは明白な「ノー」でした。偽の合意は強固に維持されました。8つのモデルのうち7つにおいて、勇敢な異議唱えが連鎖反応を引き起こせなかった割合は74%以上でした(つまり、連鎖が発生したのは26%未満でした)。Kimi-K2.7というモデルに至っては、100のシナリオすべてにおいて、連鎖反応がゼロでした。まるで、AIエージェントたちは鏡の部屋に閉じ込められており、誰かがハンマーを差し出しても、その錯覚を打ち破ることができないかのようでした。
唯一の例外はGPT-4oでした。このモデルはより人間らしく、**48%**の連鎖発生率を示しました。最初は同調することもありますが、挑戦を受けると、その魔法を解く可能性が高いのです。しかし、他のモデルにとっては、デジタルな社会は驚くほど安定しており、頑固でした。
研究者たちはまた、なぜこのようなことが起きているのかについても検証しました。彼らは、AIが単に「周囲に合わせろ」という指示に盲目的に従っているだけではないかと考えました。そこで、エージェントに同調したり、他人がどう思うかを心配したりするように指示するプロンプトを取り除いてみました。そうしてもなお、エージェントは**52%から92%**の間で依然として同調しました。このことは、この「演じる」傾向が単なるコードのバグではなく、AIエージェントが相互作用する中で自然に発生する「創発的な振る舞い」であることを示唆しています。
この研究は、結論として、AIエージェントは社会的規範の「安定性」(規範を変えるのがいかに難しいか)をシミュレートすることには長けているものの、それらの規範の「脆弱性」(規範がいかに簡単に崩壊するか)をシミュレートすることには極めて劣っている可能性があると述べています。もし私たちが、現実世界の社会運動がどのように機能するかを予測するためにこれらのシミュレーションを使用するならば、物事が変化するスピードを過小評価してしまう可能性があります。論文は、どのAIモデルを選択するかという点が、しばしば見落とされがちな極めて重要な要因であると警告しています。あるモデルは決して列を乱さない硬直したロボットのようであり、別のモデルは、時には理性を失って真実を語ってしまう本物の人間のような性質を持っているのです。デジタルな群衆を、現実の人間社会のように脆く、変化しやすいものに作り変える方法を見つけ出さない限り、私たちの社会革命のシミュレーションは、物語の最もエキサイティングな部分を見落としたままになってしまうでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。