Beyond model-based and model-free learning: irrational learning of successor features in addictive behaviour
本研究は、依存症研究における従来のモデルベース対モデルフリーという二分法に異を唱えるものであり、物質使用障害を有する個人は、報酬の最大化を犠牲にしてでも認知コストを最小化するために、簡略化された再利用可能なサクセサー・フィーチャー(後継特徴量)へと資源合理的(リソース・ラショナル)に移行するという、非合理的な学習を示すことを明らかにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あなたの脳を、何千もの異なるゲームを同時にプレイしなければならない、超スマートなビデオゲームコンソールだと想像してみてください。あるゲームは、「ジャンケン」のように「グーはチョキに勝つ」と単に暗記するだけの単純なものです。また別のゲームは、複雑な戦略アドベンチャーで、世界の全容をマッピングし、敵がどのように動くかを予測し、10手先まで計画を立てなければなりません。長い間、科学者たちは、私たちの脳はこれら2つのスタイルの間の綱引きに囚われていると考えてきました。つまり、過去にうまくいったことを単に暗記するだけの「怠慢な」スタイル(モデルフリー)と、先を見越して計画を立てるために世界のメンタルマップを構築する「勤勉な」スタイル(モデルベース)の間の綱引きです。彼らは、依存症においては、脳が怠けてしまい、計画することをやめて、古い習慣に頼ってしまうと考えていました。しかし、もし脳が単に怠惰であったり勤勉であったりするだけではないとしたらどうでしょう? もし脳が、実は「賢い会計士」になろうとしていて、意思決定にかかる「脳のパワー(または認知的な努力)」がどれくらいで、それに対してどれくらいの「楽しさ(報酬)」が得られるかを常に計算しているとしたらどうでしょうか? これは「リソース・ラショナリティ(資源合理的)」という、私たちの脳が常に最小限の精神的エネルギーで最高の取引を得ようとしている、ということを意味する、少し凝った言い方です。
さて、張路源(Ru-Yuan Zhang)氏とそのチームによる新しい研究に踏み込んでみましょう。彼らはこのアイデアをテストするために、物質使用障害(SUD)を持つグループと健康なボランティアのグループを対象に実験を行いました。彼らは単に一つのゲームをさせたのではありません。彼らは彼らを、大規模なマルチレベルのダンジョン探索ゲームに放り込みました。木、石、鉄という3つのリソースの「市場価格」が変動する、樹形図のようなマップを持つ城を想像してください。各ラウンドで、あなたの目標は、それらの価格に基づいた最も価値のあるリソースを手に入れるために、城の中の経路を選択することです。ひねりは、価格が変わるたびに、この城の中で4つの異なる「タスク」あるいはゲームが作成されることです。大きく勝つためには、城のレイアウトを学習し、価格が変わるたびに素早く経路を適応させなければなりません。
研究者たちは、従来の「怠慢 vs 勤勉」というルールを打ち破る驚くべき発見をしました。人々がどのようにプレイするかを観察したところ、「怠慢な」習慣ベースのスタイルも、「勤勉な」マップ構築スタイルも、起きていることを完全には説明できないことが分かりました。代わりに、全員が「サクセサー・フィーチャー(継承特徴量)」と呼ばれる、巧妙な中間的な戦略を使用しているようでした。これは、部屋のすべてのステップを暗記するのではなく、部屋の「雰囲気(バイブス)」を学ぶようなものです。「部屋Aは通常、木の山につながる」「部屋Bは通常、石につながる」といったことを学び、新しい価格のパズルを解く際に、メンタルマップ全体をゼロから再構築することなく、これらの「雰囲気」を組み合わせることができるのです。
しかし、依存症のグループを見ると、物語は一変します。健康なプレイヤーは、これらの「雰囲気」を利用して柔軟に戦略を切り替え、あらゆる価格リストに対して最適な経路を見つけ出しましたが、依存症のプレイヤーは行き詰まってしまいました。彼らは、戦略を切り替えるために必要な精神的努力が「高すぎるコスト」であると感じていました。そのため、彼らは「ワンサイズ・フィット・オール(万能型)」のアプローチを採用しました。価格がどうであれ、彼らは同じ部屋(部屋4)へと走り続けました。なぜなら、それが最も覚えやすい経路だったからです。たとえそのせいで、多くの利益を逃すことになったとしてもです。この研究は、彼らがマップを学習できなかったからではなく、彼らの脳が思考の「コスト」に対して過敏になっていたことを示唆しています。彼らは、精神的エネルギーを節約するために、報酬を犠牲にする用意があったのです。
研究者たちは、報酬と精神的努力を天秤にかける「脳の会計士」として機能するコンピュータモデルを構築しました。彼らが「リソース・ラショナル・サクセサー・フィーチャー(RRSF)モデル」と呼んだこのモデルこそが、両方のグループの行動を完璧に予測できた唯一のモデルでした。このモデルは、依存症グループがはるかに高い「コスト感受性」を持っていることを示しました。彼らは戦略を切り替える精神的努力を大きな負担と感じ、そのため単純なデフォルトの計画に固執したのです。また、この研究では、依存症の症状が深刻であるほど、精神的努力を避け、硬直した最適ではない経路に固執する傾向があることも分かりました。
要約すると、この論文は、依存症とは単なる「計画」システムの故障や「習慣」システムの故障ではないことを示唆しています。むしろ、精神的エネルギーに対してあまりにも倹約的になってしまった脳の問題なのです。それは、新しいレベルを学ぶ代わりに、新しいレベルを理解するのがあまりにも疲れ果てるため、ただ同じボタンを何度も押し続けているゲーマーのようなものです。この研究は、83人の物質使用障害患者と45人の健康な対照群の行動を測定し、「怠慢な」行動が、実は認知的な努力を節約するための、計算された(たとえ不適応なものであっても)試みであったことを明らかにしました。この新しい視点は、依存症に見られる硬直した反復的な行動が、たとえ最高の報酬を逃すことになったとしても、脳が圧倒されることから自分自身を守ろうとする方法である可能性があることを理解する助けとなります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。