Environmental volatility amplifies Pavlovian control in decision-making
修正されたパブロフ的・道具的転移パラダイムを用いた本研究は、環境の揮発性が、計算コストの高い道具的更新に代わる安定した選択肢を提供し、結果に応じて選択のエントロピーを増大または減少させ得るパブロフ的メカニズムを増幅させることで、意思決定の制御を報酬予測手がかりへとシフトさせることを示している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
私たちの脳は毎日、絶え間ない計算機として機能しており、次に何をすべきかを決定するために、自分の行動がもたらすであろう結果の可能性を常に天秤にかけています。ボタンを押して報酬が得られれば、再びそれを押すことを学びます。もし押しても何も得られなければ、止まります。これが、因果関係が通常は一定に保たれている世界において、私たちが進む方法です。しかし、現実の世界がそれほど安定していることは滅多にありません。時には、予告なしにルールが変わることもあります。昨日まで安全へと導いてくれた道が、今日は危険へとつながっているかもしれません。環境が予測不能になると、脳は困難な問題に直面します。賢明な選択をするために頼りにしていた情報が、ノイズを含み、信頼できないものになるのです。このような不確実性の高い瞬間において、私たちの精神は、新しいルールを解明しようとし続けるべきか、それとも環境からの信号に対して自動的に反応する、より単純で古いシステムへと退くべきかを決断しなければなりません。
この「注意深い計算」と「自動的な反応」の間をどのように切り替えるのかという問いは、ボローニャ大学とイタリア国立研究評議会の研究者による新しい研究の中核をなしています。彼らは、世界が混沌としたとき、何が起こるのかを理解しようとしました。具体的には、不安定で予測不可能な環境が、自分自身の計算を無視して、代わりに馴染みのある手がかりの引きに身を任せる可能性を高めるのかどうかを調査しました。例えば、道標が動き続ける森の中を歩いている人を想像してみてください。やがてその人は、地図を読もうとするのをやめ、たとえ地図が別の場所に水があると示していても、通常は水へと導いてくれる花の香りに従うようになるかもしれません。研究者たちは、このようなシフトが、環境が激動しているときに人間の脳で起こるのか、そしてこのシフトが意思決定の性質そのものを変えてしまうのかどうかを確かめるべく研究に着手しました。
答えを見つけるために、チームはスロットマシンを模したコンピュータベースのゲームを設計しました。実験の第一段階では、50人の健康なボランティアが、2つの異なる条件下でこのゲームをプレイすることを学びました。「低ボラティリティ(変動性)」条件では、マシンは予測可能でした。あるレバーはほとんどの場合に報酬を与え、もう一方のレバーはめったに報酬を与えませんでした。ルールは長い間一定でした。「高ボラティリティ」条件では、ルールが頻繁に、かつ予告なしに変更されました。通常は当たりだったレバーが突然外れになり、外れだったものが当たりになることが、一度のセッション中に5回も起こりました。参加者は、自分の選択の結果を観察することによって、これらの変化するパターンを学習しなければなりませんでした。予想通り、人々は変化するルールを習得することをはるかに難しく感じました。彼らの選択は正確性に欠け、どのレバーを選ぶべきかについて、より確信が持てない様子でした。
スロットマシンのルールを学んだ後、参加者は第二段階へと進み、食べ物の報酬の写真を見せられました。特定の写真がどの食べ物を予測するかを、彼らは学習しました。これは、彼らがレバーを押すことなく、単に写真とその結果を観察するという受動的な学習段階でした。これにより、特定の写真と特定の食べ物の間に、彼らの心の中で強い結びつきが作られました。最後に、研究者たちはこれら二つの部分を統合しました。参加者は再びスロットマシンに戻りましたが、今度はレバーを選択する前に、写真がレバーの上に表示されました。その写真は、現在最も良い選択肢であるレバーと一致する場合もあれば、現在最悪の選択肢であるレバーを指し示す場合もありました。研究者たちは、参加者が最近報酬を与えてくれたレバーに固執するのか、それとも写真によって示唆されたレバーに引き寄せられるのかを観察しました。
結果は、明確かつ驚くべきパターンを明らかにしました。参加者が安定した低ボラティリティ環境下でゲームを学習していた場合、写真はほとんど影響を与えませんでした。彼らは主に写真を無視し、現在最も報酬を与えてくれているレバーに固執しました。しかし、混沌とした高ボラティリティ環境下でゲームを学習していた場合、写真が支配権を握りました。もし写真が現在最悪の選択肢を指し示していた場合、高ボラティリティ群の参加者は、安定群の参加者よりもはるかに頻繁に、その写真に従いました。彼らは過去にうまくいっていた戦略を放棄し、手がかりに判断を委ねたのです。これは、写真が現在のマシンのルールとは無関係であったにもかかわらず起こりました。絶え間ない変化に圧倒された脳が、自分自身の計算から、より単純な信号へと信頼を移したのです。
研究者たちはまた、参加者の選択がいかに一貫しているかも調べました。彼らは、個人の行動が瞬間ごとにどれほど変動するかを表す指標である「エントロピー」を測定しました。高ボラティリティ群では、写真と最善の選択が食い違ったとき、参加者の選択は非常に不安定になりました。彼らは二つのシステムの間で揺れ動き、写真に従うこととルールに従うことの間を行ったり来たりしているようでした。この内部的な葛藤が、ノイズが多く予測不可能な行動パターンを生み出しました。しかし、フィードバックが停止したときに何が起こるかをテストするために設計された第二の実験では、物語が変わりました。このバージョンでは、テストの特定の期間中に報酬のフィードバックを取り除きました。計算を更新するためのフィードバックがなくなると、道具的なシステム(計量的システム)には、活用できる材料が何もなくなりました。この状態において、参加者は単に不安定になっただけでなく、硬直的なまでに一貫しました。彼らは、たとえそれが間違った選択につながるとしても、毎回必ず写真に従ったのです。葛藤は消え去りました。なぜなら、脳が計算することをやめ、手がかりに完全に降伏したからです。
これらの知見は、環境のボラティリティが単に混乱やノイズを私たちの行動に加えるだけではないことを示唆しています。むしろ、それは私たちの脳が異なる種類の情報をどのように重み付けするかを能動的に変えてしまうのです。世界が安定しているとき、私たちは自分の行動から学ぶ能力に依存します。世界が予測不能になると、私たちの脳は、あらゆる変化を追跡することはコストがかかりすぎ、リスクが高いと判断するようです。その代わりに、環境からの信号に反応する、より単純な手がかりベースのシステムへと制御を移します。このシフトは学習の失敗ではなく、戦略的な適応です。脳は、混沌とした世界においては古いルールは消え去り、残された唯一の安定したものは「信号」であると認識しているのです。このメカニズムは、なぜ不安定またはストレスフルな状況にある人々が、より衝動的になったり、即時的な手がかりに突き動かされたりするのかという現象を説明する助けとなります。これは、依存症や強迫性障害などの疾患に見られるパターンです。この研究は、地図が変わり続けるとき、私たちは地図を読むのをやめ、香りに従い始めるのだということを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。