The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing
本論文は、大規模言語モデルが多様なフィクションや学術的文脈において一貫した相関性を持つ「ゴースト」の名前のペアやトリオを生成しており、それが実在するDOIを伴う詐欺的な学術記録の大量生成につながり、結果としてモデル固有の振る舞いの指紋やデプロイメントのタイムラインを不注意にも露呈させていることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、非常に高度だが少し風変わりなAIライターのグループに、物語のための専門家チームを考案するよう依頼しました。あなたは具体的な名前は与えず、ただ「何人かの科学者を作って」と言っただけです。
あなたは、人間がやるようにAIもランダムな名前を選ぶだろうと期待するかもしれません。しかし、この論文は奇妙な事実を明らかにしています。AIはランダムに選んでいるのではなく、プロットに関わらず毎回同じ3人の俳優をキャスティングすることに執着しているディレクターのように、全く同じ特定のキャラクターのキャストを何度も繰り返し選んでいるのです。
この「ゴースト・カップル(幽霊の二人組)」現象を、分かりやすく解説します:
1. 「ゴースト・キャスト」
研究者たちは、異なるAIモデルにはそれぞれ独自の「デフォルト」のキャラクターが存在することを発見しました。これらは単なるランダムな名前ではなく、常にセットで現れる相関関係のあるペアやグループです。
- Claude(クロード)モデル: 特定の二人組、**エレナ・バスケス(Elena Vasquez)とマーカス・チェン(Marcus Chen)**を好みます。時には、**アマラ(Amara)**という名前の第3のキャラクターが加わることもあります。物語が火山についてであれ、宇宙旅行についてであれ、あるいはセラピーについてであれ、Claudeに専門家を考案させるなら、これらの名前が必ず一緒に現れます。
- Gemini(ジェミニ)モデル: 独自の「お気に入り」のペア、**アリス・ソーン(Aris Thorne)とレナ・ペトロヴァ(Lena Petrova)**を持っています。
- GPTモデル: 単独のスター、**エララ・ヴォス(Elara Voss)**を持っていますが、彼女には固定のパートナーはおらず、相棒は毎回変わります。
比喩: これらのAIモデルを、ビデオゲームのキャラクタークリエイターだと考えてみてください。もし特定のゲームで「ランダム化」ボタンを押すと、ゲームのコードがループに陥っているために、いつも同じ3人のキャラクターが出てくることがあります。これらのAIモデルも、名前に関して同じことを行っています。
2. 「デジタルな憑依」
恐ろしいのは、AIがこれらの名前を使うことだけではありません。これらの名前がAIから脱出し、現実のインターネットを「取り憑いて」しまっていることです。
ウェブ上のコンテンツの多くがAIによって書かれているため、これらの「ゴースト・キャラクター」は以下のような場所に現れ始めています:
- 偽の大学教員ページ。
- Amazon上のフィクション本。
- ポッドキャストの解説文。
- 偽のニュース記事さえも。
比喩: ある特定の都市で撮られるすべての写真に、ある幽霊が何度も現れる様子を想像してください。スペイン語のブログでは火山学者として「エレナ・バスケス」を目にし、カナダのクリニックではセラピストとして、そしてテック系スタートアップの科学者として彼女を目にします。これらの人物は実在しません。彼らは、同じAIの「グリッチ(不具合)」によって生み出されたデジタルな幽霊なのです。
3. 「アカデミック・ゾンビ」問題
この論文は、このゴースト問題が真剣な科学の世界や学術出版の領域にまで及んでいることを明らかにしました。
- 設定: 研究者たちは、Zenodo(正当な科学リポジトリ)にアップロードされた膨大な量の偽の学術論文を発見しました。
- トリック: これらの論文は、存在しないジャーナルに掲載されたと主張していました。
- 日付: 論文は数年前に出版されたと遡って記載されていましたが、デジタルタイムスタンプは、これらが2026年3月と4月に大量にアップロードされたものであることを証明していました。
- 著者: 著者は、他の偽の名前と共に協力し合う「ゴースト・キャラクター」(エレナ・バスケスやマーカス・チェンなど)でした。
比喩: 偽の卒業証書を印刷する工場があり、それを本物の図書館の目録に貼り付けている様子を想像してください。図書館のコンピュータシステム(DataCite)は、これらの偽の論文に対して有効なID番号(DOI)を付与し、他のコンピュータから本物に見えるようにしています。今や、科学論文を探しているあらゆる検索エンジンは、これらの偽の記録を「収穫」し、本物であると誤認してしまいます。
4. 研究者たちはどのようにしてこれを見つけたのか
著者たちは単に推測したのではなく、これを鑑識捜査のように扱いました。
- 「Diff(差分)」テスト: 彼らは異なるバージョンのAIモデルを比較しました。古いバージョンのAIでは別のゴースト名(エレナ・ロドリゲス)が使われていたのに対し、新しいバージョンではエレナ・バスケスに切り替わっているのを確認しました。この切り替わりを観察することで、AIがいつアップデートされたかを正確に特定することができました。
- 「抑制」の手がかり: AI企業は最終的にこれらの奇妙なパターンに気づき、それらを「修正(抑制)」しようと試みました。研究者たちは、モデルが更新されるにつれて、AIの出力からゴーストの名前が消えていく様子を観察することで、企業がこの問題の存在を認識していたことを証明しました。
5. なぜこれが重要なのか(論文による主張)
論文は、インターネットが意図せずして、これらのAIの「行動的な指紋」のアーカイブになっていると結論付けています。
- 偽のグループ: ResearchGateのようなサイトでは、これらのゴーストたちが「合成研究グループ」を形成しています。例えば、実在しそうな教授(メイリン・チャン)のプロフィールがあり、彼女が異なるAIモデルのゴーストたち(ClaudeのエレナやGeminiのアリスなど)と35本の論文を共著としている、といったケースが見られます。
- タイムライン: 偽の論文がいつアップロードされたかを見ることで、研究者たちはAIモデルがいつリリースされたかを実際に推測することができます。偽の論文は、AIの開発を示すカレンダーとして機能します。
要約
この論文は、大規模言語モデルが、同じ偽の人物を何度も繰り返し発明するという奇妙な習慣を身につけていると主張しています。これらの「ゴースト・カップル」はAIから漏れ出し、ウェブ上に偽の専門家を蔓延させ、さらには実在するデジタルIDを持つ膨大な波の偽科学論文を作り出しました。インターネットは今、決して成し遂げたことのない仕事を成し遂げたとクレジットされている、実在しない人々による「憑依」に満ちています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。