NeuroSynth: A Biologically Inspired Continual Reinforcement Learning Architecture for Mitigating Catastrophic Forgetting
本論文は、生物学的な着想に基づいた継続的強化学習アーキテクチャであるNeuroSynthを紹介するものであり、二重経路の統合メカニズムを通じて破滅的忘却を軽減し、逐次的なナビゲーションタスクにおいて標準的なPPOおよびEWCのベースラインと比較して、既知のタスク知識の保持を大幅に向上させることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
脳が忘れないための秘密(そしてなぜロボットは苦戦するのか)
新しいビデオゲームを学ぼうとしているところを想像してみてください。最初のレベルではとても上手になりますが、第2レベルを開始した瞬間に、脳が「リセット」ボタンを押したかのように、第1レベルの遊び方を忘れてしまうのです。これは単なる人間の癖ではありません。人工知能(AI)にとっての大きな悩みでもあります。機械学習の世界では、これを「破滅的忘却(catastrophic forgetting)」と呼びます。これは、AIが新しいタスクを学習した際に、以前のタスクで使用していたコードを誤って上書きしてしまう現象です。まるで、カセットテープに新しい曲を録音することで、90年代のヒット曲を消去してしまうようなものです。
科学者たちは、私たちの脳がどのようにこの問題を解決しているのかを研究してきました。彼らは、私たちの脳が巧妙な二部構成のシステムを使用していると考えています。一方の部分である「海馬」は、新しい情報を即座に捉える超高速のメモ帳のようなものです。もう一方の「新皮質」は、時間をかけて情報を整理し、長期記憶へと蓄積していく、ゆっくりと調理を進める図書館のようなものです。私たちは新しいことを学びながら古いことを失わずに済みますが、ほとんどのAIシステムは、一度にすべてをやろうとする一つの巨大な脳のように構築されているため、あのフラストレーションの溜まる「リセット」ボタン現象が起きてしまうのです。大きな疑問はこうです。古いスキルを維持しながら新しいスキルを習得できる、人間のように学ぶAIを構築できるのでしょうか?
NeuroSynth:ルーツを忘れないAI
ここで、この記憶喪失を防ぐために設計された、高校生研究者のヤシュ・キニ(Yash Kini)による新しいAIアーキテクチャ、「NeuroSynth」が登場します。NeuroSynthを、単一の脳ではなく、二人のスペシャリストが協力して働くチームとして考えてみてください。それは「プランナー(計画者)」と「習慣形成者(Habit-Former)」です。
プランナーは、脳の海馬から着想を得ています。これは学習が速い存在です。AIが新しい課題に直面すると、プランナーが介入して素早く解決策を見つけ出し、そして決定的なことに、その知識を「凍結」させます。これは、解決策の完璧な写真を撮り、それが誤って消去されないように金庫にロックするようなものです。習慣形成者は、脳の皮質から着想を得た、柔軟な働き手です。これは常にオープンであり、新しいことを学び続けます。しかし、ここからが魔法のような仕掛けです。習慣形成者はただ単独で学ぶのではありません。金庫の中の凍結された写真(プランナー)を常に参照し、「リプレイ(再生)」(古いゲームを想像すること)と「蒸留(ディスティレーション)」(プランナーのスタイルを模倣すること)という手法を用いて、古い動きを練習し続けます。こうすることで、AIは古いものを削除することなく、新しいレベルを学ぶことができるのです。
この脳に似たチームが、標準的なAIよりも優れているかどうかをテストするために、研究者たちは「NeuroMaze-CL」と呼ばれるデジタル迷路の中で、3つの異なるモデルをテストしました。目標は単純です。グリッドを通り抜けて特定の出口を見つけることです。ひねりは、出口が毎回移動することです。AIは、第1の出口、第2の出口、第3の出口を、それぞれ一度も練習することなく学習しなければなりません。この「非再訪(non-revisitation)」ルールは、以前のノートを二度と見ることが許されない学生のように、AIに忘却を強いるように設計されました。
結果は、脳に着想を得たアプローチの明白な勝利でした。標準的なAIモデルであるPPOは、記憶に関して完全な惨敗でした。第3の迷路を学習した後、第1の迷路を完全に忘れてしまい、タスクAの成功率はわずか0.33%でした。まるで、AIが最初から第1の迷路を見たことがなかったかのようでした。2番目のモデルであるEWCは、更新を非常に慎重に行うことで古い記憶を守ろうとしましたが、慎重すぎて新しい迷路を効果的に学習することができませんでした。
しかし、NeuroSynthは「スイートスポット(最適解)」を見つけ出しました。同じトレーニングの後、第1の迷路を**18.00%の成功率で覚えていました。これはPPOのほぼゼロに近いパフォーマンスよりも大幅に優れた数値です。NeuroSynthは単に第1のタスクを覚えただけでなく、第2のタスクもより良く保持しており、PPOの0.00%に対して、タスクBでは35.33%**の成功率を達成しました。最終的で最も困難なタスク(タスクC)に関しては、NeuroSynthは慎重なEWCモデルよりも高いパフォーマンスを示しましたが(9.00% 対 2.00%)、この特定の差は、決定的な勝利と呼ぶには統計的に十分な強さはありませんでした。
この研究は、「速い学習」と「遅い記憶」を分離し、リプレイを用いて古いスキルを練習することで、安定性と柔軟性を兼ね備えたAIを構築できることを示唆しています。これは、ロボティクスや医療AIのあらゆる問題を解決する魔法の杖ではありませんが、脳の二経路システムを模倣することが、ロボットが新しいことを学ぶたびにあのフラストレーションの溜まる「忘却」ボタンを押してしまうのを止めるための、有望な方法であることを示しています。著者が述べているように、これは、すでにマスターしたスキルを失うことなく、一生涯のスキルを真に学ぶことができる機械への一歩なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。