EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics
本論文は、EvoLM という自己教師ありの事後学習手法を提案するもので、これは言語モデルがインスタンス固有の判別的評価基準を生成することと、それらの評価基準を報酬として活用して方策性能を最適化することを交互に行うことで反復的に改善を可能にし、外部の人間またはモデルによる監督に依存することなく優れた結果を達成するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが完璧なエッセイを書く方法を学生(ポリシーモデル)に教えようとしていると想像してください。従来の方法では、すべてのエッセイを読み、評価し、学生が何が悪かったかを伝えるために、厳格な教師(人間または超知能 AI)が必要でした。これは高価で遅く、その教師の知能によって制限されていました。
EVOLMは、学生が自分自身で教師になることを可能にする新しい方法ですが、巧妙なひねりを加えています。単に「良い」エッセイがどのようなものか推測するのではなく、学生は自分が書くすべてのエッセイに対して、特定のチェックリスト(ルーブリックと呼ばれるもの)を作成することを学びます。
このプロセスは、以下の簡単なステップに分解して説明します。
1. 2 つの役割:書き手とチェックリスト作成者
このシステムでは、同じ AI モデルが同時に 2 つの役割を果たします。
- 書き手(ポリシー): この部分が質問に対する回答を生成します。
- チェックリスト作成者(ルーブリック生成器): この部分が質問を見て、回答を評価するための具体的なルールセット(ルーブリック)を作成します。
これは、料理を作るだけでなく、料理をした後にレシピカードを書き、なぜその料理が良いのか、あるいは悪いのかを正確に説明するシェフのようなものです。
2. 「タイムトラベル」フィードバックループ
システムは、チェックリストが良いかどうかをどうやって知るのでしょうか?「よくやった!」と人間が言う必要はありません。代わりに、タイムトラベルを使用します。
- ステップ A: AI が今日、回答を書きます。
- ステップ B: 数日前に書いた回答(自分自身の「以前のバージョン」)を振り返ります。
- ステップ C: AI が学習を続けていると仮定し、新しい回答の方が優れていると想定します。
- ステップ D: チェックリスト作成者が、両方の回答を評価するためのルーブリックを作成します。
目標は単純です。ルーブリックは、「新しく、より良い」回答と「古く、より悪い」回答の間の違いを明確に区別できなければなりません。 ルーブリックが曖昧であれば、違いを見分けることはできません。ルーブリックが鋭く具体的であれば、新しい回答に高いスコアを与え、古い回答に低いスコアを与えるでしょう。
3. 共進化のダンス
ここで魔法が起きます。2 つの役割は、ループの中で互いに改善し合うために交代します。
- 書き手が向上する: チェックリストを使用して、書き手はより高いスコアを得るために、より良い回答を生み出すことを学びます。
- チェックリスト作成者が鋭くなる: 書き手が向上するにつれ、比較すると古い回答はさらに悪く見えます。「良い」ことと「素晴らしい」ことの区別を保つために、チェックリスト作成者はより具体的でより詳細なルールを書く必要があります。「文法が良い」だけでは不十分です。「導入句の後にはコンマを使用しなければならない」と言わなければなりません。
時間が経つにつれて、チェックリストは「面白くする」といった曖昧なラベルから、「答えは 48 の周囲長から導き出された 144 という数字を含んでいる必要がある」といった具体的で検証可能な指示へと進化します。
4. 「小さな判定者」のトリック
通常、複雑なエッセイを評価するには、巨大で超スマートな AI が必要です。しかし、EVOLM は実際の採点を行うために、小さく凍結された AI(小さな判定者)を使用します。
チェックリスト作成者が「『革新』という言葉が 2 回現れているか確認する」のような、非常に具体的で具体的なルールを書くことを学んでいるため、小さく単純な AI でさえ指示を完璧に実行できます。まるで、小さな子供に非常に具体的な宝の地図を与えるようなものです。彼らは探偵である必要はありません。地図に従うだけでよいのです。
なぜこれが重要なのか?
- 外部の教師は不要: このシステムは、何千ものエッセイを採点したり、高価な AI API の費用を支払ったりするために人間を必要としません。過去の自分のパフォーマンスから、独自のトレーニングシグナルを生成します。
- 天井を突破する: 人間の教師に依存すれば、AI はその人間を超えることはできません。特定の AI 教師に依存すれば、AI はその教師のレベルに留まります。EVOLM では、AI の「教師」(ルーブリック)が AI と共に進化するため、天井は上がり続けます。
- 機能する: この論文は、この自己学習型 AI(80 億パラメータの小さなモデルを使用)が、ルール生成に GPT-4(はるかに大きく高価なモデル)を使用したシステムよりも実際に優れていることを示しています。
要約すると: EVOLM は、AI が自分自身の詳細な採点ルーブリックを書くことを学ぶ自己改善ループです。現在の自分と過去の自分を絶えず比較することで、AI は自分自身にますます精密なルールを書くことを強要し、それによって人間が介入することなく、より良い回答を書くことを学ぶようになります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。