LLM generation novelty through the lens of semantic similarity
本論文は、LLMの生成における新規性を全事前学習コーパスに対して測定するための、スケーラブルな3段階のセマンティック検索フレームワークを提案しており、それによって、モデルが従来考えられていたよりも長いシーケンスにわたってデータを利用していること、ドメイン固有の新規性パターンを示すこと、そしてインストラクションチューニングを通じて新規性が向上することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ある学生がテストで内容を再現しているのかどうかを見極めようとしている探偵だと想像してください。もし学生が教科書の文章を一言一句そのまま書き写したとしたら、それは明らかな「再現」です。しかし、もしその学生が章全体を読み、概念を理解した上で、全く新しい文章を書き、それが全く同じ意味を持っていたとしたらどうでしょう?それは「再現」なのでしょうか、それとも「真の学習」なのでしょうか?これは、人工知能(AI)を研究する科学者たちが直面している大きな問いです。大規模言語モデル(LLM)と呼ばれるこれらのAIモデルは、インターネットのほぼすべてを読み込んだ超強力な学生のようなものです。彼らは物語を書き、数学の問題を解き、私たちとチャットをすることができます。しかし、時には以前に読んだ内容をただ繰り返しているだけであり、またある時には、何か新しいものを生み出しているようにも見えます。難しいのは、AIがソース(情報源)を隠すのが非常に上手いため、「コピー」と「創造」の違いを見分けることです。科学者たちは、AIが実際に思考し、一般化しているのか、それとも単に暗記したパターンを繰り返しているだけの、巧妙なオウムなのかを知りたいと考えています。
本論文は、その謎を解くための巧妙な新しい方法を紹介しています。単に(スペルチェッカーのように)単語の一致を探すのではなく、著者たちは言葉の背後にある「意味」を見るシステムを構築しました。彼らはこれを「意味的類似性(semantic similarity)」と呼んでいます。これは、二つの絵画を比較することに似ています。もし筆致(ブラシストローク)だけを見るなら、二つの絵は全く異なって見えるかもしれません。しかし、全体のイメージを見れば、どちらも同じ夕焼けを描いていることに気づくかもしれません。研究者たちはこの考え方を用いて、AIが学習した膨大なデータライブラリをスキャンしました。彼らは単に「AIはこの文章をコピーしたか?」と問うたのではありません。「たとえ異なる言葉を使っていても、AIはこの文章の『概念』をコピーしたのか?」と問うたのです。
この検証のために、チームはSmolLMと呼ばれるAIモデルのファミリーを使用しました。彼らは3段階の調査プロセスを設定しました。第一に、高速な検索ツールを使用して、学習ライブラリの中から最も類似した概念を見つけ出しました。第二に、単なる短くて簡単な一致ではなく、適切な種類の類似性を確実に捉えるために、それらの結果を再ランク付けしました。最後に、そしてこれが最も重要な部分ですが、AIの回答を実際の人間が書いた回答と比較しました。これは、味付けが正しいかどうかを確認するために、シェフが標準的なレシピに対して料理を試食する「校正(キャリブレーション)」ツールとして機能しました。これを行うことで、AIの出力が(派手な表現であれ単純な表現であれ)どれほど「新規性(novel)」があるのかを測定することができました。
結果は驚くべきものであり、これらのAIモデルに対する私たちの考え方を変えるものでした。第一に、AIモデルは、これまで考えられていたよりもずっと長いテキストの範囲にわたって、学習データを利用していることがわかりました。単に一つの文章をコピーしているのではなく、長い段落からアイデアを織り交ぜているのです。第二に、タスクの種類が大きく影響します。数学の問題を解くような非常に厳格なことが求められる場合、正解の言い方は一つしかないため、AIの新規性は低くなる傾向があります。しかし、物語を書いたり、トリッキーな質問に答えたりする場合、AIはより創造的になり、コピーキャット(模倣者)のような振る舞いは少なくなります。
おそらく最も興味深い発見は、「インストラクション・チューニング(指示チューニング)」についてです。これは、「役に立つアシスタントとして振る舞ってください」といった特定のコマンドに従うようAIに教えることです。研究者たちは、このトレーニングがAIのスタイルを変えるだけでなく、AIをより「新規的」にさせることを発見しました。指示チューニングされたモデルは、元の学習データとは異なる言い回しや構造を使い始めました。それはまるで、指示に従うことを学んだことで、AIが教科書を繰り返すのをやめ、自分自身の物語を書き始める自信を得たかのようです。
著者らはまた、小さなAIモデルの方が、巨大なモデルよりも「新規性」が高いことが多いことも発見しました。大きなモデルは、学習データにより密着しているようで、まるで暗記したことから逸脱することを恐れているかのようです。この研究は、これらのモデルが人間と同じ意味での「思考」をしていることを証明するものではありませんが、インストラクション・チューニングが単純な暗記を超えさせる助けになることを強く示唆しています。研究者たちは、この「新しさ」を測定する新しい方法が、これらのデジタル脳が何を学び、いつ真に新しいものを創造しているのかを理解する助けとなることを願い、すべてのツールとデータを公開しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。