← 最新の論文
💬 NLP

LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models

LLM における出力長さ制御の課題を、モデルが自身の生成長を認識する能力(長さ認知)と行動の不一致に起因すると捉え、事後学習を通じてこの認知と行動を整合させる強化学習フレームワーク「LARFT」を提案し、既存手法を大幅に上回る精度で長さ指示に従う能力を実現したという論文です。

原著者: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

公開日 2026-03-23
📖 1 分で読めます☕ さくっと読める

原著者: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

LARFT:AI に「長さの感覚」を教える画期的な方法

この論文は、大型言語モデル(AI)が「100 語で書いて」という指示を、なぜか「50 語」や「200 語」で返してしまうという**「指示通りに文字数を合わせる」という難しい課題**を解決するための新しい方法「LARFT」を紹介しています。

これまでの AI は、文字数を「外側から無理やり制御」しようとしていましたが、LARFT は**「AI の内面にある『長さの感覚』そのものを育てる」**という、全く新しいアプローチをとっています。

以下に、難しい専門用語を使わず、日常の例え話を使って解説します。


1. 問題:なぜ AI は文字数を間違えるのか?

Imagine you are asking a chef to cook a soup that is exactly "one bowl" worth.
(想像してください。シェフに「お椀一杯分」のスープを作ってほしいと頼んだとします。)

  • これまでの方法(外からの制御):
    監督が「もういい、止まれ!」と叫んだり、お椀のサイズを測るメジャーを無理やり持たせたりする方法です。

    • 失敗点: シェフ自身に「お椀一杯」の感覚が育っていないため、監督が目を離すとすぐに量がおかしくなります。また、メジャーを使うと料理(文章の質)が台無しになることもあります。
  • LARFT の発見:
    問題の本質は、AI が**「自分が今、どれくらい話しているか(文字数)」という感覚(認知)を持っていない**ことにありました。
    「100 語」という指示を聞いても、AI は「100 語」のイメージを頭の中に描けていないのです。

2. 解決策:LARFT(長さ意識強化トレーニング)

LARFT は、AI に「長さの感覚」を身につけさせるための 3 つのステップからなるトレーニングです。

ステップ 1:目標に向かって走る(報酬に基づく学習)

まずは、AI に「100 語」を目指して文章を書かせます。

  • 仕組み: 100 語に近ければ「ご褒美(報酬)」を、遠ければ「罰」を与えます。
  • 例え: 目標のゴールラインに向かって走らせるトレーニングです。

ステップ 2:振り返りのトレーニング(Hindsight Length Awareness)

ここが LARFT の最大の特徴です。
AI が失敗して「150 語」書いてしまったとします。これまでの方法なら、そのデータは「失敗データ」として捨てられます。
しかし、LARFT はその失敗データを**「宝物」**に変えます。

  • 仕組み:
    1. AI に「さっき書いたこの文章、何語だった?」と自分自身に数えさせます
    2. 「150 語でした」と正解を教えます。
  • 例え:
    料理が「お椀一杯」より多くなってしまった時、シェフに**「さっきの料理、お椀に何杯分入った?」と自分で数えさせ、その感覚を脳に染み込ませる**ようなものです。
    これにより、AI は「自分の出力した文章の長さ」を客観的に把握する能力(認知)を身につけます。

ステップ 3:バランスの取れた練習(統一最適化)

「長さの感覚を磨くこと」と「指示通りに文章を書くこと」を、トレーニングの時期に合わせてバランスよく行います。

  • 初期: 長さの感覚(認知)を重視してトレーニング。
  • 後期: 指示通りに書くこと(行動)を重視してトレーニング。
  • 例え:
    最初は「お椀の容量を感覚で覚える練習」を徹底的に行い、慣れてきたら「実際に料理を作る」練習にシフトします。

3. 結果:「知ること」と「やること」のギャップを埋める

この方法(LARFT)を取り入れた結果、驚くべき変化が起きました。

  • 精度の向上:
    AI は「100 語」と言われたら、本当に 100 語前後で文章を出力できるようになりました。
  • 品質の維持:
    文字数に気を使いすぎたせいで、文章が不自然になったり、意味が通らなくなったりすることはありませんでした。
  • 他の能力への影響:
    文字数制御を学ぶことで、数学や一般常識を答える能力が落ちることもありませんでした。

まとめ:なぜこれがすごいのか?

これまでの AI は、「外側から無理やり制御」しようとしていました。
しかし、LARFT は
「AI の内面にある『長さの感覚』を育てる」ことで、AI 自身が「あ、今これくらいだから、もう少し書こう」と自発的に調整
できるようにしました。

「知ること(認知)」と「やること(行動)」のギャップを埋めたこの方法は、AI がより人間らしく、指示通りに振る舞うための大きな一歩です。


一言で言うと:
「AI にメジャーを持たせて無理やり測らせるのではなく、AI 自身に『長さの感覚』を教えることで、自然と指示通りに文章を書けるようにした」という画期的な研究です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →