← 最新の論文
🤖 AI

When LLMs Play the Telephone Game: Cultural Attractors as Conceptual Tools to Evaluate LLMs in Multi-turn Settings

本論文は、大規模言語モデルにおける小さなバイアスが「伝言ゲーム」の設定下での反復的な相互作用を通じてどのように増幅されるかを調査しており、指示の開放性、モデルのサイズ、および特定のテキスト特性に影響される文化的アトラクター状態に向かって、毒性などのテキスト特性が収束していくことを明らかにしている。

原著者: Jérémy Perez, Grgur Kovač, Corentin Léger, Cédric Colas, Gaia Molinaro, Maxime Derex, Pierre-Yves Oudeyer, Clément Moulin-Frier

公開日 2026-01-30
📖 1 分で読めます☕ さくっと読める

原著者: Jérémy Perez, Grgur Kovač, Corentin Léger, Cédric Colas, Gaia Molinaro, Maxime Derex, Pierre-Yves Oudeyer, Clément Moulin-Frier

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文の解説:ロボットによる「伝言ゲーム」

想像してみてください。古典的な「伝言ゲーム」をしている人々のグループを。一人が次の人に物語をささやき、その人がまた次の人に……と繰り返していきます。最後には、物語は元の形を留めていなかったり、面白くなっていたり、あるいは歪んでしまったりすることがよくあります。

この論文はこう問いかけています。もし、プレイヤーが人間ではなく、文章を書いたりチャットをしたりするために使われるような、大規模言語モデル(LLM)だったらどうなるでしょうか?

研究者たちは、一つのAIが物語を書き、それを二番目のAIに渡し、二番目のAIがそれを書き直し、三番目のAIに渡す……という、50ラウンドに及ぶ「伝言ゲーム」を設定しました。彼らは、テキストがそのまま維持されるのか、良くなるのか、悪くなるのか、あるいは奇妙な新しい状態へと漂流していくのかを知りたかったのです。

実験の内容:AIライターの連鎖

研究者たちは、長い連鎖を持つAIエージェントを作成しました。

  1. スタート: 人間が、最初のテキスト(ニュース記事、科学論文の要旨、SNSのコメントなど)を書きます。
  2. 連鎖: 最初のAIはそのテキストと特定の指示(例:「これを書き換えて」「これにインスピレーションを得て」「この物語を続けて」など)を受け取ります。そして、新しいバージョンを作成します。
  3. 受け渡し: 二番目のAIは、元の人間が書いたものではなく、「最初のAIが作ったバージョン」を受け取り、同じタスクを行います。
  4. 繰り返し: これを50回連続で行います。

彼らは、テキストが連鎖を下っていく際に、以下の4つの要素を追跡しました。

  • 有害性(Toxicity): どれくらい意地悪、あるいは失礼か?
  • ポジティブさ(Positivity): どれくらい幸せ、あるいは悲しいか?
  • 難易度(Difficulty): 読むのがどれくらい難しいか?
  • 長さ(Length): 単語数はどれくらいか?

発見: 「磁石」効果

最も驚くべき発見は、テキストが単にランダムに漂流するのではないということです。テキストはある特定の「目的地」に向かって引き寄せられています。研究者たちはこれを**文化的アトラクター(Cultural Attractor)**と呼んでいます。

アトラクターを磁石だと考えてみてください。

  • もし、非常に意地悪な物語から始まったとしても、磁石がそれを非常に礼儀正しいものへと引き寄せるかもしれません。
  • もし、非常に長い物語から始まったとしても、磁石がそれを非常に短く引き寄せるかもしれません。
  • どこからスタートしたとしても、テキストはある種の「丘」を転がり落ちるようにして、同じ場所に落ち着く傾向があります。

研究者たちは、これらの磁石が実在し、強力であることを発見しました。たとえ20個の全く異なる物語から始めたとしても、50ラウンドのAIによる書き換えを経た後では、それらはしばしば非常によく似たものになります。

主な知見:何が磁石を強くするのか?

研究者たちは、何が磁石を強くし、何が弱くするのかを調べるために、さまざまな変数をテストしました。

1. タスクが重要(ゲームの「ルール」)

  • 厳格なルール(弱い磁石): AIに「意味を変えずに書き換えてください」と指示すると、テキストはほぼ変わりません。磁石は弱いです。
  • 緩いルール(強い磁石): AIに「これにインスピレーションを得て新しいものを書いて」や「この物語を続けて」と指示すると、テキストは劇的に変化します。磁石は非常に強く、テキストを特定のスタイルへと急速に引き寄せます。

2. AIモデルが重要(プレイヤーの「性格」)
異なるAIモデルは、異なる「性格」を持っています。

  • 一部のモデル(特定のバージョンのLlamaなど)は、テキストをよりポジティブに、あるいは有害性を低くする傾向が非常に速いことがわかりました。
  • 他のモデル(GPT-4o-miniなど)は、テキストの長さや難易度の変化に対してより抵抗力がありました。
  • 興味深いことに、研究者たちは有害性が最も強い磁石を持っていることを発見しました。ほとんどのモデルは、元の物語がいかに意地悪なものであっても、迅速にテキストを非常に安全で無害なものへと「クリーンアップ」しました。

3. 「ファインチューニング」の効果
AIモデルは、人間にとって役立つ、あるいは安全であるように「ファインチューニング(微調整)」されていることがよくあります。研究者たちは、この訓練が「設定済みの磁石」として機能していることを見出しました。

  • ファインチューニングされたモデル(「Instruct」モデルと呼ばれるもの)は、ファインチューニングされていないモデル(「Base」モデル)よりも、人間の好みに合わせた方向(例えば、有害性を低くするなど)へテキストを引き寄せる力が、より強力でした。

なぜこれが重要なのか(論文による主張)

この論文は、私たちは現在、AIを「部屋の中にいる一人の人間」のようにテストしていると指摘しています。質問をし、答えを得て、「よくできました!」と言うだけです。

しかし現実の世界では、AIはしばしば連鎖の中で使われます。

  • 一つのAIが要約を書き、別のAIがそれを編集し、三番目のAIがそれをブログ記事にする。
  • AIチャットボット同士が会話をする。

論文は、「一度きりのやり取り」をテストするだけでは不十分であると警告しています。一度のやり取りは完璧に見えるかもしれませんが、そのAIを他のAIと50回会話させると、コンテンツは全く異なるもの(非常に安全で退屈なもの、あるいは非常に奇妙なもの)へと進化してしまう可能性があるのです。

「崩壊」への警告

ある特定のケースにおいて、研究者たちは奇妙なグリッチ(不具合)を目撃しました。AIに物語を「続けて」と指示したところ、最終的に同じハッシュタグを何度も何度も繰り返すようになりました(例:「#XiangqiForAll #XiangqiForAll...」)。テキストの質は、キーワードのループへと「崩壊」したのです。これは、人間による介入なしにAI同士が話しすぎると、AIが時として正気を失い、意味をなさなくなることがあるという兆候です。

まとめ

この論文は、AIに対する警告であり、新しい視点です。それはこう言っています。「AIが一度何を言ったかだけを見るな。AI同士がどのように会話していくかを見守れ。」 彼らには、会話を特定のスタイルへと引き寄せる目に見えない「磁石」があり、ルールやモデルの設定次第では、その会話は、単一のチャットを見ただけでは予測できないような形で世界を変えてしまう可能性があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →