← 最新の論文
🧬 biology

Entrenchment in Human Exploration: A Future-Path Model of Early Convergence

本論文は、人間による探索における「定着(entrenchment)」の認知モデルを導入し、人々が自身の将来の選択をシミュレートすることによって、最適ではない選択肢に時期尚早に落ち着いてしまうことを示しており、このメカニズムは、ホライゾンが長くなるにつれて非貪欲な行動が増加することを一意に説明し、UCBやトンプソン・サンプリングといった標準的な探索戦略とは一線を画すものである。

原著者: Shinji Nakazato

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Shinji Nakazato

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

人間は常に、根本的な選択に直面しています。それは、「現在うまくいっている方法を使い続けるべきか、それともより良いものを見つけるために新しいことを試すべきか」という問いです。科学者に「探索と利用のトレードオフ(exploration-exploitation tradeoff)」として知られるこのジレンマは、学習の原動力です。私たちが「探索」するとき、私たちは世界に関する情報を収集しています。「利用」するとき、私たちはその情報を用いて最高の報酬を得ようとします。理想的には、私たちはこれら二つの衝動のバランスを取り、最適な選択肢を見つけるために十分にサンプリングを行い、その後はその選択肢に落ち着いて享受することになります。しかし、多くの状況において、人々はあまりにも早く探索をやめてしまうように見受けられます。彼らは実際には最善ではない選択肢に固執し、より良い選択肢が存在する場合でも、それを使い続けてしまうのです。研究者が「定着(entrenchment)」と呼ぶこの頑固な執着は、私たちの脳が未来をシミュレーションする方法において、私たちを不適切な習慣の中に閉じ込めている可能性を示唆しています。

東京理科大学の中里真司による新しい研究は、なぜこのようなことが起こるのかについて、新鮮な説明を提示しています。この研究は、私たちが現在の選択を評価するとき、単に目の前の報酬を見ているだけではないと提案しています。その代わりに、私たちは自分自身の将来の決定をどのように行うかを想像するという、精神的なシミュレーションを行っています。極めて重要なのは、この研究によれば、私たちは「将来、自分の意見を更新したり学習したりすることは決してない」かのように、現在の信念を固定した状態でこのシミュレーションを行っているという点です。この精神的なショートカットは、私たちの将来の経路に対して特定の種類の不確実性を生み出します。モデルによれば、タイムホライゾン(時間軸)が長い場合、つまり、あと多くの決定が残されている場合、このシミュレートされた不確実性は大きくなり、最善の選択肢を放棄して、より劣った選択肢へと漂流させるのに十分な大きさになります。この知見は、人間が常に報酬を最大化しようとしているという考えに異を唱えるものであり、私たちの内なる未来のシミュレーションが、私たちを誤った方向へと導く可能性があることを示唆しています。

このアイデアを検証するために、研究者は、繰り返しの選択を含むゲームを行った二種類の異なる実験データを分析しました。一つはウィルソン・タスクとして知られる実験で、参加者は単純な二択のゲームに直面しました。研究者は、決定の開始時点における選択肢に関する参加者の知識が同一になるようゲームを慎重に制御しましたが、将来のターン数が異なるように設定しました。あるケースでは、参加者は残りターンが1回であることを知っていました。別のケースでは、残り6回であることを知っていました。もし人々が単に最善の選択肢を見つけようとしているのであれば、知識が同じであるため、行動も同じになるはずです。しかし、データは明確な違いを示しました。参加者がより多くのターンが残っていると知っているとき、彼らは最善ではない方の選択肢を選ぶ傾向が有意に高かったのです。この結果は非常に強力であり、標準的な学習理論や、単に人々がより慎材になったり好奇心を持ったりしたという考えでは説明できませんでした。この特定のパターンを再現できた唯一のモデルは、「将来の経路」シミュレーションに基づいたモデル、すなわち、意思決定者が「自分は何も新しく学ばない」と想定して将来の選択を想像するモデルでした。

研究はさらに、この行動を他の形態の探索と区別することに進みました。時には、人々は可能な限り最善の選択肢に関する情報を集めるために、あえて劣った選択肢を選ぶことがあります。これは「指向的探索(directed exploration)」と呼ばれます。これらの頑固な選択が、スマートな探索の一種なのか、それとも単に「行き詰まり」なのかを確認するため、研究者はグリッド上の多くの地点を含む、より複雑なゲームを用いた実験を調査しました。このゲームでは、真の最適地点は研究者によって既知とされていました。分析の結果、長期的なホライゾンにおいて人々が非最適な選択を行った際、彼らは圧倒的に「本当に劣った地点」に向かって移動していることが明らかになりました。彼らは最適解を見つけるために探索していたのではなく、そこから漂流していたのです。これは、行動がまさに「定着」であったこと、つまり、精神的なシミュレーションが現在の選択を実際よりも魅力的に見せてしまうために、人が劣った選択に陥ってしまう自己強化的なループであったことを裏付けています。

また、研究は選択肢のサイズがこの行動にどのように影響するかについても調査しました。グリッドゲームにおいて、参加者は30または121の異なる地点から選択しなければなりませんでした。モデルは、選択肢が多いほど、未来の精神的シミュレーションにおける不確実性が増大し、人々が悪い選択肢に固執する可能性がさらに高まると予測しました。データはこれを支持しました。利用可能な選択肢が増えるにつれて、非最適な選択肢に固執する割合も上昇しました。さらに、研究では、最善の選択肢と二番目に良い選択肢の価値の差が非常に明確である場合、人々は固執しにくくなることも判明しました。しかし、その差が小さい場合、あるいは未来が遠く感じられる場合、平凡な選択肢に固執する傾向は強まりました。

これらの知見は、人間の意思決定が冷徹な計算によるものではなく、想像力の限界によるものであるという姿を描き出しています。この研究は、私たちの脳は常に将来を最適化しようとしているわけではなく、時には、たとえどこにも通じていなくても、現在の慣れ親しんだ経路の方が安全であると感じさせるような「可能性の霧」を先に見ているのだと示唆しています。将来の自分自身を、決して考えを変えない存在としてシミュレートすることで、私たちは図らずも学習への障壁を作り出しています。この研究は、これが人間の知性の欠陥であると主張しているのではなく、むしろ、私たちが時間と不確実性を処理する方法における構造的な特徴であると述べています。私たちが人生を計画するために用いる仕組みそのもの、すなわち「次に何をすべきか」を想像することが、時として、最善の道を見つけることを妨げる要因になり得ることを示しているのです。結果は数千回の試行にわたって堅牢であり、単純なミスや一般的な多様性の好みといった他の説明を排除した場合でも成立していました。

最終的に、この論文は、この特定の「行き詰まり」を捉える数学的枠組みを提供しています。それは、非最適な選択を行う確率は、残された時間が長くなり、選択肢の数が増大するにつれて増加することを示しています。これは、時間が長いほど最善の解決策を見つけるのに役立つと示唆する伝統的な合理的学習理論とは逆の結果です。本研究は、人間の学習者にとって、時間があることは、むしろ、より少ないもの(妥協的な選択)で満足してしまう可能性を高めることを裏付けています。研究は、脳が具体的にどのようにこの未来の不確実性を計算しているのかという問いを残していますが、私たちが未来の選択をどのように想像するかが、現在の行動を左右する強力な原動力となり、私たちの利益にならないパターンに私たちを閉じ込める可能性があることを明確に確立しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →