Chain-of-Experience for Continual LLM Improvement
本論文では、自己および環境からのフィードバックによる反復的な経験の痕跡を蓄積することで、推論中に大規模言語モデルが継続的に向上することを可能にするフレームワークであるChain-of-Experience(CoE)を紹介するが、これは数学、コーディング、および知識タスクにおいてゼロショットのベースラインを一貫して上回りつつ、APIコストを削減するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人間は、間違いから学ぶようにできています。困難な問題に直面し、失敗し、そして何が間違っていたのかという知識を持って再び挑戦するとき、私たちは単にゼロからやり直しているわけではありません。私たちはその教訓を持ち越し、成功するまでアプローチを洗練させていくのです。この「行動、フィードバック、調整」という継続的なループこそが、人間の知性の原動力です。数十年にわたり、大規模言語モデルとして知られる最も高度なコンピュータプログラムは、これとは全く異なる形で動作してきました。これらのシステムは、一度トレーニングされると固定された状態でデプロイされ、あらゆる新しい問いを孤立したイベントとして扱います。彼らは答えを生成して終了してしまい、問題解決のプロセス自体の中に存在する豊かなフィードバックを無視してしまうのです。彼らは、その瞬間の経験から学ぶことはありません。
人間が学ぶ方法と、現在の機械が動作する方法との間にあるこの隔たりは、研究者に一つの根本的な問いを投げかけました。これらのデジタルな精神は、作業中に、つまりリアルタイムで収集した経験を用いて学ぶことを教えられるのだろうか? その答えは、「Chain-of-Experience(経験の連鎖)」と呼ばれる新しいアプローチにあります。この手法は、モデルによる問題への試行の全履歴を、一つの進化する物語として扱います。失敗した試行を単に破棄するのではなく、システムはその結果をモデルにフィードバックし、モデルが自身の過去の誤りと受け取ったフィードバックを読み取り、それに基づいて新しい、より優れた応答を生成できるようにします。これは、モデルが自身の旅から学び、一歩進むごとに理解を更新していく、継続的なサイクルなのです。
最近の研究において、研究者たちはこの概念が、幅広い困難なタスクにおいて実際に機能するかどうかをテストすることに乗り出しました。彼らは、主要なテクノロジー企業によるシステムを含む、現在利用可能な最も強力な8つの言語モデルを取り上げ、数学、プログラミング、および複雑な知識に関する一連の挑戦的な環境に配置しました。目的は、これらのモデルが、基礎となるトレーニングを変更することなく、テスト中のフィードバックとの相互作用によってパフォーマンスを向上させることができるかどうかを確認することでした。研究者たちは、モデルが異なる種類のガイダンスを受け取れるシステムを設計しました。時には、モデル自身が批判者として振る舞い、自身の論理の欠陥を指摘するフィードバックが行われました。またある時には、コードが正常に実行されたか、あるいは数学の答えが正しいかを即座に判定できるコンピュータプログラムのような、外部環境からのフィードバックが行われました。
結果は驚くべきものでした。これらのモデルが、この反復的な学習プロセスを用いることが許されたとき、間違いを振り返ることができなかった標準的なバージョンよりも一貫して優れたパフォーマンスを示しました。その改善はわずかなものではありませんでした。モデルは全体的に大幅な精度の向上を達成しました。フィードバックが正確かつ即時的であるコンピュータコーディングの領域では、モデルの成功率は平均で8.6パーセントポイント上昇しました。数学の複雑な問題を解くような、フィードバックがより間接的な抽象的なタスクにおいても、モデルは依然として5パーセント以上のスコア向上を実現しました。これは、経験から学ぶ能力が、モデルの核となる脳を再学習させることなくさえ、解き放つことができる強力なツールであることを示唆しています。
さらに驚くべきは、この新手法の効率性でした。研究者たちは、これらのモデルが単に良くなっただけでなく、より少ない費用と計算資源で向上したことを見出しました。思考を導くためにフィードバックを使用することで、モデルはより少ない試行回数と短い応答で、より高いレベルの正確性に到達しました。実際、この研究は、このフィードバックループを使用しない従来の方法と比較して、モデルを実行するコストを19パーセント削減しながら、最高の精度を達成できることを示しました。これは、モデルが単に何度も推測を繰り返しているのではなく、収集した情報を使用して行き止まりを回避し、正しい道に集中するという、より効果的な思考を行っていることを示しています。
また、この研究は、モデルの能力に関する興味深いパターンも明らかにしました。研究者たちは、あるタスクにおいてすでに最も強力なモデルが、経験から学ぶ機会を与えられたときに最も大きく向上することも観察しました。モデルが自身の履歴から学ぶ能力は、その初期の知能と結びついているようです。つまり、モデルが賢ければ賢いほど、フィードバックを消化し戦略を進化させるのが上手くなるのです。この相関関係はテストされた異なるタスク全体で強く、経験から学ぶ能力は独立したスキルではなく、強力な推論システムの創発的な特性であることを示唆しています。
たとえフィードバックが不完全であったり、誤解を招くものであったりした場合でも、モデルは驚くべき回復力を見せました。研究者が、誤った答えが正しいと伝えるなど、意図的に誤った情報をモデルに与える実験を行った際、モデルは崩壊することはありませんでした。パフォーマンスはわずかに低下したものの、最強のモデルは回復し、しばしば正しい解を見つけ出しました。この堅牢性は、これらのシステムが指示に盲目的に従っているのではなく、受け取った情報を自身の内部論理と照らし合わせ、積極的に推論していることを示唆しています。また、学習の大部分は非常に迅速に行われることも判明しました。モデルは、最初の数回のフィードバックの段階で、向上の大部分を達成しており、その後はパフォーマンスが横ばいになる傾向がありました。これは、最初の数瞬の省察が、学習において最も重要であることを意味しています。
研究者たちはまた、異なる種類のフィードバックを組み合わせることで、さらに良い結果が得られるかどうかについても探究しました。モデルが自身の内部的な批判と、答えの正当性を確認する外部信号の両方を受け取ったとき、これら2つの情報源が共に作用して最高スコアを生み出すことを見出しました。この組み合わせにより、モデルは自己省察による広い視点と、外部チェックによる精密な検証の両方の恩恵を受けることができました。しかし、過去の経験を短いメモリへと要約してプロセスを簡略化しようとしたところ、モデルのパフォーマンスは低下しました。これは、モデルの試行のステップバイステップの詳細な履歴には、過度に圧縮してしまうと失われてしまう極めて重要な情報が含まれていることを示唆しています。
結局のところ、この研究は、大規模言語モデルが、再学習なしでは不可能と考えられていた形態の学習が可能であることを証明しています。経験を蓄積し、問題解決のプロセスの中でフィードバックと相互作用させることにより、彼らはリアルタイムで進化し、向上することができるのです。この研究は、このアプローチが効果的であるだけでなく効率的でもあることを裏付けており、従来のトレーニングに伴う膨大な計算コストをかけることなく、これらの強力なツールからより多くの成果を得る方法を提示しています。これらのシステムが発展し続けるにつれ、経験から学ぶ能力は標準的な機能となり、機械の思考方法と人間の学習方法の間の溝を埋めることになるでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。