Illuminating the Three Dogmas of Reinforcement Learning under Evolutionary Light
本論文は、人工生命コミュニティが、オープンエンドな新規性探索とエージェンシーの熱力学的理論を統合することで、強化学習の核心的な教義に対する根本的な批判に対処し、学習を報酬の最適化ではなく適応として再定義する生物学的に忠実な枠組みを提案できることを論じるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ロボットに「生き物のように振る舞う方法」を教えようとしていると想像してください。何十年もの間、これ(強化学習、またはRLと呼ばれます)の標準的なレシピは、3つの厳格なルール、すなわち「ドグマ(教条)」に依存してきました。
- 世界はゲームボードである: 環境は予測可能なグリッドであり、あらゆる動きが特定の結末へと導きます。
- 学習とは「最善の経路」を見つけることである: ロボットは、宝箱への最短ルートを見つけるように、問題に対する唯一の完璧な解決策を探索することで学習します。
- 目標は「単一のスコア」である: ロボットは一つの単純な数値(報酬スコア)によって突き動かされます。ビデオゲームのプレイヤーが高スコアを目指すのと同じように、彼らはできる限り高い数値を得ようとします。
この論文の著者であるマニ・ハミディとテレンス・ディーコンは、これら3つのルールはあまりに硬直的すぎると主張しています。彼らは、現実の世界はビデオゲームのような「単一の高スコア」を目指す場所ではないと言います。代わりに、彼らは「エージェント(自律的に行動する存在)」とは本当は何なのかを理解するために、進化と物理学の観点から学習を見るべきだと提案しています。
以下に、日常的な比喩を用いた彼らの議論の簡単な内訳を示します。
1. 学習は単なる「探索(Search)」ではなく、「探求(Exploration)」である(庭園の比喩)
古い見解では、学習とはハイカーが単一の山の頂上(最善の解決策)を見つけようとするようなものです。頂上を見つけたら、そこで終わりです。
著者たちは、真の適応とは、もっと**「野生の、開かれた庭を世話する庭師」**に近いものであると言います。
- 古いやり方: 背が最も高く成長する花だけを植えます。最も高い花を手に入れたら、それで終了です。
- 新しいやり方: 単に「最高の」花を探すのではありません。異なる種類の植物が互いに競合しないよう、庭のさまざまな隅々に異なる種類の植物が育つように促します。背は低いけれど非常に色彩豊かな植物もあれば、背は高いけれどまばらな植物もあるでしょう。
- なぜ重要か: 現実の世界では、まだ何が「最善の」解決策であるか分からないことがよくあります。そのため、一つの古い解決策を完璧にするのではなく、新しい種類の解決策(新規性)を絶えず探索し、作り出し続ける必要があるのです。これは「オープンエンドな新規性探索(Open-Ended Novelty Search)」と呼ばれます。それは、一つの勝者を見つけることではなく、アイデアの多様なエコシステムを作り出すことなのです。
2. 「スコア」は生き物には通用しない(マルチタスクの比喩)
古い見解では、エージェントは一つの単一の数値(ゲームのスコアのようなもの)によって駆動されます。著者たちは、生命にとってこれは不可能であると主張します。なぜなら、生命はマルチタスクだからです。
あなたが人間として生き残ろうとしている場面を想像してください。あなたは単に「幸福度を最大化」しようとしているだけではありません。あなたは同時に以下のことを行っています:
- 体温を維持しようとする(体温調節)。
- 塩分濃度を適切に保とうとする(浸透圧調節)。
- 食料を探す。
- 捕食者を避ける。
これらはすべて異なる「目標」であり、時には互いに衝突することもあります。もし虎が現れたら、「食料を探す」というあなたの目標は、突然「逃げる」という目標よりも重要度が下がります。
- 問題点: これらすべての異なる、刻々と変化するニーズを、一つの単一の数値(スカラー報酬)の中に押し込めることはできません。
- 解決策: 生き物は**ホメオスタシス(恒常性)**に基づいて活動しています。彼らは高スコアを目指しているのではなく、内部の「サーモスタット」や「燃料計」を安全な範囲内に保とうとしているのです。「報酬」とは数値ではなく、ニーズが満たされた時に感じる「安堵感」なのです。
3. 目標はどこから来るのか?(「誰が家を建てたのか?」の比喩)
もし、あるロボットがスコアを最大化するために学習していると言うなら、一体誰がそのスコアを与えたのでしょうか?現在のAIにおいては、人間のエンジニアがコードを書きます。生物学においては、「進化」が目標を与えたと言います。
しかし、著者たちは問いかけます:進化はどこからその目標を得たのでしょうか?
彼らは、「進化」と言うだけで終わらせることはできないと主張します。進化には、それが作用するための「何か」が必要です。進化には、自分自身をコピーし、繁殖できるほど長く生きながらえることができるシステムが必要です。
- 生命の物理学: 進化が存在するためには、まず、物事が崩壊していく自然な傾向(エントロピー)に抗う物理的なシステムが必要です。キャンプファイアと細菌を考えてみてください。
- キャンプファイアは燃料を燃やして一時的に秩序を作り出しますが、ただ燃え尽きるだけです。自ら生き残ろうとはしません。
- 細菌は、燃料を燃やし続けるために、自ら壁を築き、自らを修復する機械です。それは「自己持続的な」ループです。
- 大きな洞察: 著者たちは、**真のエージェンシー(主体性/自律的な行動能力)は、システムが物理法則に対して自らを維持するように物理的に構築されている場合にのみ存在すると主張しています。目標とは数値ではなく、単に「生き延びること」**なのです。
「ラチェット」のメタファー
論文は強力なイメージで締めくくられます。ラチェット(一方向にしか回転せず、逆回転を防ぐ道具)を想像してください。
- ほとんどの学習理論は、丘を転がり落ちるボールのようなものです。簡単に転がり落ちてしまいます。
- 著者たちは、真のエージェンシーとはラチェットのようなものであると示唆しています。それは自らを構築し、風に対しても形を保ち、そしてその形を次の世代へと受け継いでいくシステムです。
- この「ラチェット」こそが、進化を可能にするものです。自らを維持できるシステムがなければ、進化すべき「自己」すら存在しないのです。
まとめ
この論文は、真に知的な、自律的なマシンを構築するためには、彼らを「高スコアを追いかけるビデオゲームのキャラクター」として考えるのをやめるべきだと主張しています。代わりに、彼らを以下のような**「生命システム」**として考えるべきです:
- 多くの異なる可能性を探索する(単一の完璧な経路だけでなく)。
- 複数の内部的なニーズをバランスさせる(単一のスコアではなく)。
- 自らを維持し、繁殖するために物理的に構築されている(崩壊していく自然な傾向に抗う)。
システムが生きながらえるための物理学を理解することで、私たちはようやく、「目標」や「学習」が実際にどこから来るのかを理解することができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。