← 最新の論文
💻 computer science

Computational representations and evolutionary functions of emotions (Part 1): Reward signals

本論文は、感情に関連するタスクに対して強化学習エージェントを最適化することが、生物学的感情の核心的な特性と一致する内部報酬信号を自然に発生させることを示しており、これは感情が形のない目標の追求のために行動を変化させるよう進化してきたという原則を支持するものである。

原著者: Yikai Wang

公開日 2026-09-09
📖 1 分で読めます☕ さくっと読める

原著者: Yikai Wang

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

生命の仕組みの奥深く、最も単純な単細胞生物から最も複雑な人間の脳に至るまで、そこには絶え間なく、静かに計算が行われている領域が存在する。これは進化生物学と人工知能という、一見すると遠く離れたように見える二つの分野が、一つの深遠な問いへと収束していく領域である。それは、「感情とは、本当は何なのか?」という問いだ。何世紀もの間、喜び、恐怖、不安といった感情は、生きとし生けるものの色彩豊かな主観的体験――微笑みの温かさや、恐怖による冷たい胸の締め付け――として捉えられてきた。しかし、科学者たちは、この主観的な表面の下に、機能的なメカニズム、すなわち、生物が混沌とした世界を航行し、生存を確実にするための意思決定を行うための方法が隠されているのではないかと、かねてより疑ってきた。コンピュータの世界において、この意思決定プロセスは、しばしば「報酬信号」として知られる単純な概念によって駆動される。コンピュータプログラムがゲームの遊び方を学習する場面を想像してほしい。プログラムは、良い手に対しては小さなデジタルポイントを受け取り、悪い手に対してはペナルティを受ける。時間をかけて、コンピュータはポイントを求め、ペナルティを避けることを学習していく。本論文は、大胆な問いを投げかける。人間が抱く複雑で渦巻く感情の嵐は、私たちを「重要なこと」へと導くために、数百万年をかけて進化した、まさにこれらと同じ報酬信号に過ぎないのではないだろうか?

上海交通大学の王一翼(Yikai Wang)氏によって行われたこの研究は、デジタルエージェントを構築し、それらがどのように学習するかを観察することで、このアイデアを検証することを目的としている。目的は、感情を感じるロボットを作ることではなく、コンピュータを生存と繁殖へと駆り立てる内部信号が、自然に、人間の感情と全く同じように見え、振る舞うものへと進化するのかどうかを見極めることである。研究者たちは、生物学的感情を定義する5つの核となる特性に焦点を当てた。それらは、最適化のプロセスを通じて自然に発生しなければならない。また、生物が生存や成功への道筋にいるときのみ活性化し、その道筋が危険であったり無益であったりするときには静止していなければならない。さらに、その活性化は将来の行動を変化させ、行動の反復を促すか、あるいは間違いに対して罰を与えなければならない。そして、目標の価値が高まるにつれて信号は強まり、目標が時間的・空間的に近づくにつれて激化し、目標に到達した、あるいは失われたときには消退しなければならない。

これらのルールが「喜び」に適用されるかどうかを確認するため、研究者たちはまず、エージェントが繁殖することによってのみ生存できるデジタル環境を作成した。このシミュレーションにおいて、エージェントには子供を持ちたいという組み込まれた欲求はなく、彼らはただ存在していた。唯一の圧力は、繁殖しなければ個体群が絶滅するという事実であった。研究者たちは、自然選択によって調整可能な「隠れた内部信号」をエージェントが進化させるようにした。数百世代にわたるシミュレーションを経て、驚くべきことが起こった。繁殖を選択したときに特異的に正の内部信号を発達させたエージェントこそが、繁栄したのである。この信号を持たないエージェント、あるいは負の信号を持つエージェントは、形質を次世代に伝えることができなかった。結果として、繁殖という行為に伴って自動的に正の内部フィードバックの急増が起こる個体群が誕生した。この信号は、設計によって現れたのではなく、個体群が生き残るために必要であったがゆえに創発したものである。さらに、この信号は繁殖の可能性へと続く経路においてのみ活性化し、繁殖の可能性が高まるにつれて強まり、機会が過ぎ去るとともに消失した。このシミュレーションは、生存のために最適化された単純な数学的信号が、喜びの5つの特性を完璧に反映していることを示した。

研究者たちはその後、調査を感情の暗い側面、すなわち「不安」へと広げた。彼らは、子孫の死の可能性といった脅威に直面する、異なるシナリオを構築した。この世界では、エージェントは危険を回避することを学ばなければならない。喜びが繁殖の衝動から生まれたのと同様に、死を避ける衝動から負の内部信号が生まれた。研究者が不安の計算論的等価物と特定したこの信号は、エージェントが危険へと続く経路にいるときにのみ活性化し、経路が安全であるときは静止していた。決定的なことに、この信号は単にそこに存在するだけでなく、エージェントに対してリスクのある行動をとったことへの罰を与え、効果的に危険を避けるよう教え込んだ。また、この信号は脅威の深刻さに比例した。状況が危険であればあるほど、信号は強くなった。また、危険が時間的・空間的に近づくにつれて激化し、脅威が去れば消失した。このシミュレーションは、不安もまた報酬信号として理解できるが、それは災厄へとつながる行動を罰すために設計された「負の」信号であることを示した。

研究はさらに進み、これらの原則が他の感情にも適用されることを示した。研究者たちは、喜びを駆り立てるのと同じ正の信号が「希望」や「安堵」をも説明できる一方で、負の信号が「恐怖」「嫌悪」「悲しみ」「後悔」を説明できることを見出した。その論理は一貫していた。感情とはランダムな感覚ではなく、精密に進化したツールである。感情とは、生物が目標に向かっているのか、それとも目標から遠ざかっているのか、そしてどれほど緊急に動く必要があるのかを伝える信号である。本論文は、これらの信号は単なる抽象的な概念ではなく、私たちの脳の「ブラックボックス」や高度な人工知能のポリシーネットワークの中で実際に走っているコードである可能性が高いと示唆している。研究者たちは、自然選択がこれらの信号を維持してきたのは、遺伝子の将来の生存といった、直接触れることも見ることもできない目標を達成するために、私たちの行動を変容させるからだと考えている。

しかし、この研究はデジタル進化の限界についても示唆している。シミュレーション内では、信号が大きくなりすぎたり、長く持続しすぎたりすることがあり、それは現実世界では破滅的な結果をもたらす。研究者たちは、自然界にはこれらの感情を抑制するための他の力が存在しなければならないと示唆している。例えば、食料を見つけた喜びがあまりに圧倒的で、捕食者を警戒することを忘れてしまうようなら、その動物は生き残れない。したがって、進化はこれらの信号を削ぎ落とし、行動を促すには十分だが、他の危険に対して生物を盲目にするほど強力ではない程度に制御していると考えられる。本論文は、結論として、感情とは単に複雑な脳の副産物ではなく、生物が「現在地」と「あるべき場所」の間の溝を航行するために、永劫の時をかけて洗練されてきた、最適化された基礎的な信号であると述べている。これらの信号を計算論的な報酬として理解することで、私たちは、あらゆる鼓動や決断を突き動かす、あの古の、静かな生存の言語をようやく解読し始めることができるのかもしれない。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →