← 最新の論文
💬 NLP

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

GoLongRL は、2 万 3 千の多様な RLVR サンプルからなる能力指向データセットと、異種マルチタスク最適化のための新規 TMN-Reweight アルゴリズムを通じて長文脈強化学習を強化するオープンソースフレームワークであり、最先端のクローズドソースモデルと同等の性能を達成します。

原著者: Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの集中力が短い生徒に、単一のページではなく膨大な図書館の書物をすべて読み、理解させる方法を教えることを想像してください。これが「長文脈」AI の課題です。論文「GoLongRL」は、これらの AI モデルを訓練するための新たなレシピを提示しており、主に「何を教えるか(データ)」と「宿題をどう採点するか(アルゴリズム)」の 2 つの課題に焦点を当てています。

以下に、簡単な比喩を用いて解説します。

1. 課題:従来の方法は狭すぎた

長い本を読む AI を訓練する従来の方法は、「干し草の山から針を見つける」というパズルだけを訓練するのと同じでした。

  • 問題点: 彼らは、AI に長いテキストに隠された特定の事実を探させることでデータを作成しました。これにより AI は針を見つけることは得意になりましたが、干し草の山全体を要約したり、最も重要な部分をランク付けしたり、複雑な物語を理解したりする方法は教えられませんでした。
  • 結果: AI は特定の事実を見つけることは得意になりましたが、小説を要約したり、散らかった報告書を整理したりするなどの他のスキルは苦手でした。まるで、辞書から特定の単語を見つけることはできるが、エッセイを書くことができない生徒のようです。

2. 解決策:「能力指向」のカリキュラム

GoLongRL の著者たちは、「針探し」だけを続けるのをやめ、賢い読者に必要な 9 つの異なるスキルに基づいた包括的なカリキュラムを構築することを決めました。

  • データセット(教科書): 彼らは 23,000 問の練習問題からなる新しいデータセットを構築しました。
    • 架空の話ではなく実在の本: 架空の物語を作る代わりに、実在する本、学術論文、法的文書を使用しました。彼らは AI にこれらの実在するテキストに関する質問を生成させました。これにより、AI は人間が書く messy(無秩序で自然な)書き方を扱うことを学ぶことができます。
    • 9 つのスキル: データセットは、以下のような多様なタスクを網羅しています。
      • 正確な検索: 特定の事実を見つける。
      • 要約: 長い章を数文に凝縮する。
      • ランク付け: 複数の検索結果のうち、どれが最も有用かを判断する。
      • 推論: 財務報告書内にある数学の問題を解く。
    • 比喩: 生徒に「赤いボールを見つけろ」という同じテストを 1 万回与える代わりに、1 万問のテストの混合を与えることを想像してください。中には赤いボールを見つけるよう求めるもの、ゲームを要約するよう求めるもの、選手をランク付けするよう求めるもの、スコアに関する数学の問題を解くよう求めるものがあります。

結果: 派手な新しい数学的トリックを使わなくても、この優れた「カリキュラム」を使うだけで、AI はトップクラスのクローズドソースの競合他社(QwenLong-L1.5)よりも優れたパフォーマンスを発揮しました。

3. アルゴリズム:「公平な採点」システム(TMN-Reweight)

多様なカリキュラムを持ったら、生徒を公平に採点する方法が必要です。標準的な採点方法(GRPO と呼ばれる)は、異なる種類の質問を扱う際に欠陥がありました。

  • 問題点: 数学のテストで正解すると 100 点、読解テストで正解すると 1 点というテストを想像してください。これらを混ぜると、数学の問題が生徒の脳を支配し、読解を無視するようになります。また、問題が非常に難しい場合、標準的な採点は混乱し、幸運な推測に対して過剰な評価を与えたり、あと一歩の失敗に対して過小評価したりする可能性があります。
  • 解決策(TMN-Reweight): 著者たちは、2 つのステップを持つ新しい採点システムを発明しました。
    1. 公平な競争環境の整備(タスクレベルの正規化): 彼らはスコアを調整し、数学の問題で「完璧」なスコアを取ることと、ランク付けの問題で「完璧」なスコアを取ることが同じ価値を持つようにしました。これにより、AI が数字が小さく見えるだけで難しいタスクを無視することを防ぎます。
    2. 苦闘への焦点(難易度適応型再重み付け):
      • 生徒が易しい質問に正解した場合、教師は「よくやったが、あなたはすでにこれを分かっていた」と言い、報酬を小さくします。
      • 生徒が難しい質問に正解した場合(これは稀です)、教師は「すごい、あれは難しかった!よく解き当てたね!」と言い、大きな報酬を与えます。
      • 生徒が難しい質問に間違えた場合、教師は怒らず、「もう一度試そう」と言い、生徒が落胆しないようにペナルティを軽減します。

比喩: これは単にポイントを数えるだけではないコーチのようなものです。コーチはプレイの難易度に基づいてスコアを調整し、実行が難しかったプレイに対して特に称賛を集中させます。これにより、AI はすべてのスキルにおいて、より速く、より均等に学習できるようになります。

4. 結果:バランスの取れた生徒

彼らはこの新しい方法をテストしたところ、以下の結果が得られました。

  • すべてにおいて向上: AI は「針探し」だけでなく、すべての 9 つのスキルで大幅に向上しました。
  • トレードオフなし: 通常、生徒をあること(例えば長い本を読むこと)に優れさせるために訓練すると、他のこと(一般的な論理や記憶など)が劣化します。しかし、この方法は、長文脈読解を教える一方で、AI の一般的な推論能力や記憶力を向上させました。
  • オープンソース: 著者たちは、誰でも使用できるように、完全な「カリキュラム」(データセット)、「指導計画」(コード)、そして「採点基準」(アルゴリズム)を公開しました。

まとめ

GoLongRL は、単調で反復的なドリル(針を見つけること)から、豊かで多様なカリキュラム(読書、要約、ランク付け、推論)へと AI の教育をアップグレードし、さらに、生徒をどのタイミングでさらに追い詰め、どのタイミングで休ませるべきかを知る、公平で賢明な採点システムを組み合わせるようなものです。その結果、単なる事実発見者ではなく、真の長文思考者となった AI が生まれました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →