← 最新の論文
💬 NLP

Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models

本論文は、言語モデルにおける短い出力への系統的なバイアスを軽減し、品質を維持しながら様々なクリエイティブなタスクにおける応答の多様性と表現力を大幅に向上させる、長さ制御型のデータ選択戦略であるDiverse-NSを導入する。

原著者: Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

公開日 2026-02-02
📖 1 分で読めます☕ さくっと読める

原著者: Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

問題点:「短くて退屈」という罠

非常に才能のある書き手(大規模言語モデル)が、役に立ち、安全で、礼儀正しいように訓練されている場面を想像してみてください。あなたは彼に物語を書くよう頼みます。

問題は、彼が「完璧」かつ安全であろうとするあまり、テストを受ける緊張した学生のように振る舞い始めてしまったことです。彼らは、短い回答の方が優れた回答であると考えているため、長く書くことを恐れています。

なぜでしょうか? それは、彼らの作品を採点するために使われるツール(多様性指標)が壊れているからです。これらのツールは、30語のパラグラフよりも、たった3語の文章の方が「創造的」だと判断してしまう審判のようなものです。書き手はこのことに気づき、良い成績を取るために、短くて安全で、反復的な回答を出すようになりました。

著者らはこれを**「簡潔性バイアス(Brevity Bias)」**と呼んでいます。これは、味見役がプレーンな味付けしか好まないために、シェフがスパイスを足すのをやめてしまうようなものです。その結果、AIは創造性や表現力を失い、最終的にはすべてのAIの出力が全く同じようになってしまいます(これは「モデル崩壊」と呼ばれる現象です)。

解決策:「短さではなく、多様性を(Diverse, not Short / Diverse-NS)」

著者らは、壊れた採点システムを修正するための新しいトレーニングプログラムである、**「Diverse, not Short (Diverse-NS)」**という新しい戦略を生み出しました。これは、書き手に対する新しい教育プログラムだと考えてください。

その仕組みは以下の通りです。

  1. 「二つの下書き」ゲーム:
    研究者たちは、AIに物語を2回書かせます。

    • 下書きA: AIが自然に書くもの(デフォルトの、しばしば退屈なスタイル)。
    • 下書きB: AIに対し、「より面白く、変化に富んだものにせよ。ただし、下書きAと全く同じ長さ(文字数)を維持せよ」という特定のルールを与えて書き直させます。
  2. 「公平な審判」フィルター:
    通常、創造性を求めると文章は長くなります。しかし、研究者たちは厳格なルールを設けました。もし下書きBが下書きAよりも長くなったら、その下稿は破棄する。
    彼らは、「よりクリエイティブな」バージョンが「退屈な」バージョンとほぼ同じ長さであるペアのみを残します。これにより、AIにこう教え込みます。「言葉数を増やさなくても、創造的になれるのだ」と。

  3. 「小さな先生」のトリック:
    研究者たちは驚くべき発見をしました。より小さく安価なAIモデル(例:70億パラメータのモデル)が、より大きく高価なモデル(例:130億パラメータのモデル)に対して「多様性の先生」として機能できるということです。

    • 比喩: 地元の小規模で勢いのあるアーティストが、有名な大作スタジオに、よりユニークな絵の描き方を教えている様子を想像してください。その小さなアーティストは、ルールを創造的に破る方法を知っており、大作スタジオは彼らから学びます。これにより、多大な費用と計算資源を節約できます。

結果:味はそのままに、ボリュームも維持

研究者たちは、これら4つの異なる創造的タスクでテストを行いました。

  • 拡散的連想(Divergent Associations): 互いに非常に異なる単語を列挙すること。
  • ペルソナ生成(Persona Generation): ユニークなキャラクター設定(名前、職業、都市)を作成すること。
  • 用途の転換(Alternate Uses): 一般的な物体(レンガなど)の奇妙な使い方を考えること。
  • クリエイティブ・ライティング(Creative Writing): 3つのランダムな単語を使って短い物語を書くこと。

何が起きたのか?

  • より高い多様性: 「Diverse, not Short」で訓練されたモデルは、より多様で興味深い出力を行いました。よりユニークな単語やアイデアを使用しました。
  • 品質の損失なし: 通常、多様性を高めようとすると、品質が低下します(例えば、めちゃくちゃで混沌とした物語になるなど)。しかし、ここでは品質が維持されました。場合によっては、むしろ向上しました。
  • 効率性: この新しいスキルを教えるために、わずか3,000の例しか必要としませんでした。これは、学生に数年かけて教える代わりに、数時間で教えるようなものです。

新しいツール:「ダイバーシティ・デシル(Diversity Decile)」

著者らはまた、従来の創造性を測定するツールは長い回答に対して不公平であることにも気づきました。そこで、彼らは**「ダイバーシティ・デシル(Diversity Decile)」**という新しい定規を発明しました。

  • 比喩: あるレースを想像してください。古い定規は、走る速さだけを測っていましたが、一部のランナーが重いバックパック(長いテキスト)を背負い、他のランナーは背負っていないことを無視していました。
  • 新しい定規: 「ダイバーシティ・デシル」は、同じサイズのバックパックを背負っている他のランナーと比較して、どれだけ速く走ったかを見ます。「この長い物語は、他の長い物語と比較して、どれほど創造的なのか?」と問いかけるのです。これにより、表現豊かな長い回答が正当に評価されるようになります。

まとめ

この論文は、AIモデルが短く反復的になってしまったのは、私たちが「創造性」を測定する方法が、図らずも簡潔さを報酬として与えてしまっているからだと主張しています。

Diverse, not Short という戦略を用いることで、著者らはモデルに対し、回答を長くすることなく創造的になる方法を教えました。彼らは以下の方法で行いました。

  1. 退屈なドラフトと、同じ長さのクリエイティブなドラフトを比較すること。
  2. より小さく安価なAIを使用して、より大きなAIに多様性を教えること。
  3. 長い回答を不利にしない、より公平な創造性の測定ルール(定規)を作ること。

その結果、AIはより表現力豊かで、より創造的になり、かつ高品質でありながら、訓練コストも低く、高速に動作するようになりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →