A New Evolutionary Strategy: Learn From the Best
本論文は、高次元ニューラルネットワークの学習を強化するために、集団がエリート個体から学習するように反復的に誘導することで、OpenAI-ESやCMA-ESといった古典的な手法と比較して優れた収束性と精度を実現する、新しいブラックボックス最適化手法であるLearn From the Best Evolution Strategy (LFB-ES)を提案する。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能という広大な風景の中に、最も高度な学習システムでさえも立ち往生してしまうような、特定の種類のパズルが存在します。ロボットに歩き方を教えようとしたり、コンピュータプログラムに複雑な気象パターンを予測させようとしたりする場合を想像してみてください。ただし、途中で一切のヒントを与えることは禁止されています。「左足が高すぎます」とか「火曜日の予測が少し外れています」といったことは言えません。あなたはタスクの最後まで待って、たった一つの数字、すなわち「スコア」を提示することしかできません。これは、疎な報酬(sparse rewards)を伴うブラックボックス最適化問題として知られています。システムは、ステップごとのフィードバックを受けることなく、その最終的な成績のみに基づいて、自身の内部設定をどのように改善すべきかを判断しなければなりません。このシナリオは、新しいエンジンのパラメータ調整から、ノイズの多いデータへの数学的曲線の適合に至るまで、現実世界のエンジニアリングにおいて一般的ですが、改善への道筋が見えないため、依然として最も困難な課題の一つであり続けています。
長年、科学者たちはこれらのパズルを解決するために進化戦略に頼ってきました。これらの手法は自然選択を模倣しています。つまり、それぞれがわずかに異なる内部設定を持つデジタルエージェントの集団を作り、彼らにタスクを実行させ、最も高いスコアを得たものを選別するというものです。最も有名な手法であるOpenAI-ESとCMA-ESは、この作業における標準的なツールとなってきました。しかし、タスクが非常に複雑になり、調整すべき設定の数が増大すると、これらの手法は苦戦します。彼らはしばしばローカルループ(局所的なループ)に陥り、進展が遅くなり、問題の詳細を捉え損ねてしまいます。それはまるで、山の頂上を見つける代わりに、同じ小さな開けた場所をぐるぐると回り続けている、深い森の中を彷徨うハイカーのようです。
Lenovoの研究チームは、「最良の進化戦略から学ぶ(Learn From the Best Evolution Strategy)」、すなわちLFB-ESと呼ばれる新しい前進策を提案しました。ランダムな偶然によってより良い解決策に辿り着くのを待つのではなく、この新しい手法は、集団の中に構造化された学習形態を導入します。実験の各世代において、単独で最も優れたパフォーマンスを示したエージェントが「教師」として選ばれます。残りのグループは「生徒」として、その教師の振る舞いを研究します。彼らは単に教師の最終スコアを模倣するだけではありません。教師がタスク中に生み出した具体的な一連のアクションや出力を模倣しようとするのです。数学的なプロセスを用いて、自分自身の出力と教師の出力との差を最小化することで、生徒たちは教師に近づくように自身の内部設定を急速に調整していきます。これにより、集団が盲目的に彷徨うのではなく、現在のチャンピオンに導かれながら、より良い解決策へと集団で登っていくサイクルが生まれます。
研究者たちは、このアプローチを困難な曲線適合の課題を用いてテストしました。彼らはアルゴリズムに対し、非常に複雑で急速に振動する波のパターンを予測するよう求めました。これは、数千もの微細なピークと谷を捉える必要があるタスクです。アルゴリズムが受け取る情報は、実行終了時の予測全体の総誤差のみでした。結果は驚くべきものでした。新しいLFB-ES法は、従来のメソッドよりもはるかに速く正解に収束し、他の手法では到達できなかったレベルの精度を達成しました。古いアルゴリズムが複雑な詳細を見逃した平坦で不正確な線を描いた一方で、新しい手法は、実際のデータとほぼ完璧に一致する、驚くほど正確な複雑なパターンを再現しました。
この成功の重要な要素は、コンピュータが情報を処理するために使用する内部的な「スイッチ」、すなわち活性化関数(activation function)の選択でした。研究者たちは、サイン波のように周期的に上下に繰り返す特定のタイプのスイッチが、現代のほとんどのAIで使用されている標準的なスイッチよりもはるかに優れた結果をもたらすことを発見しました。彼らが標準的なスイッチをこの周期的なタイプに置き換え、新しい学習フレームワーク内に組み込んだところ、システムの探索能力と最適解を見つけ出す能力は劇的に向上しました。しかし、この優位性が普遍的なものではないことも発見されました。エージェントが左に動くか右に動くかを選択しなければならないビデオゲームのような、離散的な選択を含む別のタイプの問題にこの手法を適用したところ、新しい手法は、先ほどの圧倒的な優位性を示すことはありませんでした。古いランダムな手法よりもわずかに優れた性能は見せたものの、曲線適合タスクで見せたような支配的な力は発揮できませんでした。
この研究では、この新しいアプローチのコストについても調査が行われました。この手法は、生徒エージェントが教師から学習するための一連の計算を必要とするため、最も単純なランダム手法よりも実行に時間がかかります。しかし、研究者たちは、この追加時間は管理可能であり、調整すべき設定の数が増えても合理的にスケールアップできることを示しました。対照的に、より複雑な古い手法の一つは、大規模な問題に対して実行しようとするとコンピュータのメモリ不足に陥るため、実行不可能になってしまいました。新しい戦略は中間的な選択肢を提供します。つまり、最も単純なランダム探索よりも計算量は多いものの、メモリを大量に消費する重い代替手法よりもはるかに効率的であり、最終的なスコアのみが利用可能な高次元の問題を解決するための実用的なツールとなります。
結局のところ、この研究は、中間的なガイダンスが全く与えられない完全に閉鎖された環境であっても、集団が最高のパフォーマンスを示す者から学ぶことができれば、迅速に改善することを証明しています。この社会的学習のダイナミクスを適切な数学的ツールと組み合わせることで、研究者たちは、ブラックボックス最適化の霧の中を以前よりもはるかに明快かつ迅速にナビゲートできるシステムを作り上げました。この手法はあらゆる問題に対する魔法の解決策ではありませんが、ゲームの内部ルールを知ることなく複雑なシステムを調整する必要があるエンジニアや科学者にとって、強力な新しいツールを提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。