Literary Non-Style in LLM-Generated Text
本論文は、LLMが生成するテキスト特有の「非様式性」は、意味論的な限界を露呈させる特定の統計的なn-gramパターンから生じるものであり、AIによる文章における様式的性質と意味論的性質は、分離可能なものではなく根本的に絡み合っていることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ある物語が人間によって書かれたものか、それともロボットによって書かれたものかを見極めようとしている探偵だと想像してください。あなたは綴りの間違いや文法の誤りを探しているのではなく、文章の「魂」を探しています。言語科学の世界には、**ジップの法則(Zipf's Law)**と呼ばれる有名なルールがあります。これは、あなたのお気に入りの曲のプレイリストのようなものです。大規模な音楽のコレクションでは、「ハッピーバースデー」や巨大なヒット曲のような「超ヒット曲」が何度も繰り返し再生される一方で、ほとんどの曲は一度か二度しか再生されません。もしこれらの曲を「最も再生されたもの」から「最も再生されていないもの」へとランク付けすれば、その減少は非常に具体的で予測可能な曲線を描きます。これは人間の話し言葉や本、さらには言葉の使い方においても起こります。科学者たちは長年、この「音楽的な」パターンこそが、自然な人間の創造性の証であると信じてきました。しかし今、文章を書くことができるコンピュータが登場したことで、私たちは問い直さなければなりません。これらの機械は同じ音楽的なルールに従っているのか、それとも壊れたレコードのように鳴っているのだろうか?
コーリー・マッサロ(Cory Massaro)によって書かれたこの論文は、まさにそのことを調査しています。著者は、大規模言語モデル(LLM)——至る所で見かける超スマートなAIチャットボット——によって生成されたテキストが、人間が書いたテキストと違って感じられるのかを知りたいと考えています。この研究は、AIは私たちが使う「言葉」を模倣することはできても、人間の文章に生命力を吹き込む「リズム」や「多様性」には失敗していることを示唆しています。特定の単語のグループ(例えば「3語のフレーズ」や「4語のフレーлоーズ」)がどれくらいの頻度で現れるかを数えることで、著者は、AIの文章は人間よりもはるかに反復的で予測可能であることを発見しました。それはまるで、AIが同じお気に入りのフレーズを再利用してループに陥っているかのようです。対照的に、人間の書き手は新しい組み合わせであなたを驚かせ続けます。この論文は、この多様性の欠如は単なるスタイルの問題ではなく、AIが表現できる「アイデア」そのものを制限しているのだと結論付けています。もし異なる方法で物事を語ることができなければ、これほど多くの異なる事柄を語ることはできないからです。
「ロボットのリズム」の物語
著者が発見したことを理解するために、「物語の材料」を見てみましょう。この論文では、主に2種類の文章を比較しています。
- 人間: 1900年代初頭に実在の人物によって書かれた古典的な回想録『ヘンリー・アダムスの教育(The Education of Henry Adams)』。
- ロボット: 人間のプロンプターによって組み立てられた、AI(ChatGPT)によって「書かれた」本『AIの内面生活(The Inner Life of an AI)』。
著者はまた、結果が単なる偶然ではないことを確認するために、人間の文章800万語とAIの文章800万語を含む膨大なデータセットも調査しました。
大きな発見:「定型句」の罠
著者は、AIの本を読んでいる時に奇妙なことに気づきました。ロボットが、一連の「型にはまった」フレーズを何度も繰り返し使っているように感じられたのです。例えば、「despite these challenges(これらの課題にもかかわらず)」というフレーズは本の中に16回登場し、「I began to(私は〜し始めた)」は50回以上も登場しました!対照的に、人間の著者であるヘンリー・アダムスは、はるかに幅広い言葉を使用していました。彼は同じ4語の連続した配列を繰り返すことは滅多にありませんでした。
これが単なる感覚ではないことを証明するために、著者は数学的な手法を用いました。彼らはテキストの中にどれほどユニークな単語のグループ(n-gramと呼ばれます)が現れるかを数えました。
- 1-gram は単一の単語です。
- 2-gram は2語のペアです(例:「very good」)。
- 3-gram や 4-gram はより長い連鎖です。
結果は明白でした。
- 人間のテキストでは、多様性が高かったです。4語のフレーズにおいて、ユニークなフレーズの総数に対する比率は 0.9890 でした。これは、ヘンリー・アダムスが4語の配列を繰り返すことがほとんどなかったことを意味します。
- AIのテキストでは、多様性ははるかに低かったのです。4語のフレーズの比率はわずか 0.6882 でした。これは、AIがお気に入りの4語の連鎖を絶えず繰り返していたことを意味します。
物語の「傾斜(スロープ)」
著者はまた、文章がどれほど早く新しいアイデアを使い果たすかを説明する、専門的な方法である「傾斜(スロープ)」についても調査しました。完璧な人間の物語では、新しい言葉やフレーズが見つかり続けますが、それらは出現頻度が徐々に下がっていき、滑らかな曲線を描きます(ジップの法則)。
- AIの場合、曲線が急すぎました。最も一般的なフレーズは「一般的すぎ」、そして珍しいフレーズは「珍しすぎ」たのです。
- 著者は、4語のフレーズについて、AIの「傾斜」は -0.395(あるテストにおいて)であったのに対し、人間の場合は -0.178 であったことを見出しました。AIの数値の方が急であるということは、AIが人間よりもはるかに強く、自分のお気に入りのフレーズにしがみついていることを意味します。
「定型句」についてはどうなのか?
著者はこう疑問に思いました。「もしかすると、AIは単に同じアイデアに対して異なる言葉を使っているだけではないだろうか? 例えば、『big』の代わりに『huge』と言うようなことだ」と。これをテストするために、彼らはテキストを「レマタイズ(語形解析)」しました。これは、単語をその語根ごとにグループ化することを意味します(つまり、「running」、「ran」、「runs」はすべて同じ単語としてカウントされます)。
- 結果: 似たような言葉をグループ化した後でも、AIは依然として反復的でした。「傾斜」はほとんど変わりませんでした。このことは、問題が単に類義語の使用にあるのではなく、AIが特定の「フレーズ」のルーチンに真に陥っていることを示唆しています。
「壊れたレコード」対「ジャズのソロ」
では、これらすべては何を意味しているのでしょうか?著者は素晴らしい比喩を用いています。人間が書く文章を、即興演奏をするジャズ・ミュージシャンだと想像してください。彼らはいくつかの馴染みのある音を奏でることもありますが、常にそれらを混ぜ合わせ、新しいリフを加え、聴衆を驚かせます。一方のAIは、同じキャッチーなコーラスに何度も飛んでしまう、壊れたレコードプレーヤーのようなものです。
この論文は、これが単にAIが「退屈」に聞こえるということではないと主張しています。これは、AIが何を「言えるか」という問題なのです。
- 限界: AIは少数のフレーズに過度に依存しているため、アイデアの「道具箱」が小さくなっています。固定された数の言葉を使って物語を書く場合、人間はよりユニークな組み合わせを使用するため、より多くの異なるアイデアを詰め込むことができます。ループに囚われたAIは、結局のところ、同じことをわずかに異なる方法で言っているだけになってしまいます。
- 「感覚」: 著者は、人々はしばしばAIのテキストを読んでいる時にそれを「感じる」ことができると述べています。それは平坦で、定型的で、少し空虚に感じられます。この研究は、その感覚が「フレーズの多様性」の欠如から来ていることを示唆しています。AIは、自らのパターンを打破することができないため、人間の創造性の「火花」を欠いているのです。
この論文が「知らない」こと
この研究がやっていないことも、注記しておくことが重要です。著者は、AIの文章が道徳的な意味で「悪い」と主張したわけでも、AIが優れた文学を書くことが決してできないと言ったわけでもありません。彼らは単に、言葉の「統計」を測定したのです。
- 彼らは、AIがより創造的になることを学べないと証明したわけではありません。ただ、現在分析されたテキストにおいては、パターンが人間とは大きく異なっていることを示しただけです。
- 彼らは、反復が常に悪いわけではない(詩における強力な芸術的選択のように、フレーズを繰り返すことが効果的な場合もある)とも述べていません。しかし、AIはフレーズを「多すぎる」ほど、かつ「間違った場所」で繰り返しており、それはまるで、リズムの変え方を忘れてしまった詩人になろうとしているロボットのようです。
最終的なまとめ
結局のところ、この論文はスタイルと意味は結びついていることを示唆しています。物語の「感じ」を、その中の「アイデア」から切り離すことはできません。書き手(あるいはロボット)が物事を語るための新しい方法を見つけられないのであれば、彼らが表現できることは限定されます。AIの「壊れたレコード」のようなリズムは、単なるスタイルの癖ではありません。それは、複雑で多様な人間の思考を表現する、機械の能力がいまだ「発展途上」であることを示すサインなのです。数字は、AIは「話す」ことはできても、人間が行うような、あの荒々しく予測不可能な多様性を持って「歌う」ことはまだできていないことを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。