Entrenchment in Human Exploration: A Future-Path Model of Early Convergence
이 논문은 인간의 탐색 과정에서 나타나는 '고착(entrenchment)'에 관한 인지 모델을 소개하며, 사람들이 자신의 미래 선택을 시뮬레이션함으로써 차선책에 조기에 안주하게 된다는 점을 입증하고, 이는 더 긴 호라이즌(horizon)에서 비탐욕적(non-greedy) 행동이 증가하는 현상을 독특하게 설명하며 UCB나 톰슨 샘플링(Thompson sampling)과 같은 표준적인 탐색 전략과 차별화되는 메커니즘이다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
인간은 끊임없이 근본적인 선택에 직면한다. 우리가 알고 있는 데서 작동하는 방식을 고수할 것인가, 아니면 더 나은지 확인하기 위해 새로운 것을 시도할 것인가? 과학자들에게 '탐색-이용 트레이드오프(exploration-exploitation tradeoff)'로 알려진 이 딜레마는 학습의 엔진이다. 우리가 탐색할 때 우리는 세상에 대한 정보를 수집하며, 이용할 때 우리는 그 정보를 사용하여 최선의 보상을 얻는다. 이상적으로는, 충분히 샘플링하여 최선의 옵션을 찾은 다음, 그것을 즐기며 안착하도록 이 두 가지 동기 사이의 균형을 맞춘다. 그러나 많은 상황에서 사람들은 너무 일찍 탐색을 멈추는 것처럼 보인다. 그들은 실제로는 최선이 아닌 선택지에 고착되어, 더 나은 옵션이 존재함에도 불구하고 계속해서 그 선택을 반복한다. 연구자들이 '고착(entrenchment)'이라고 부르는 이 완고한 지속성은, 우리의 뇌가 우리를 부적절한 습관에 가두는 방식으로 미래를 시뮬레이션하고 있을 가능성을 시사한다.
도쿄 과학 대학의 나카자토 신지(Shinji Nakazato)가 수행한 새로운 연구는 왜 이런 현상이 발생하는지에 대해 신선한 설명을 제공한다. 이 연구는 우리가 현재의 선택을 평가할 때, 단순히 즉각적인 보상만을 보는 것이 아니라고 제안한다. 대신, 우리는 자신의 미래 결정을 상상하며, 다음에 무엇을 할지를 머릿속으로 시뮬레이션한다. 결정적으로, 이 연구는 우리가 미래에도 자신의 의견을 배우거나 업데이트하지 않을 것처럼, 즉 현재의 신념을 고정시킨 채로 이 시뮬레이션을 수행한다고 제안한다. 이러한 정신적 지름길은 우리의 미래 경로에 대해 특정한 종류의 불확실성을 만들어낸다. 이 모델은 시간 지평(time horizon)이 길 때, 즉 내려야 할 결정이 많이 남아 있을 때, 이 시뮬레이션된 불확실성이 커져서 우리가 최선의 옵션을 포기하고 더 나쁜 쪽으로 표류하게 만든다는 것을 보여준다. 이 연구 결과는 인간이 항상 보상을 극대화하려고 노력한다는 생각에 도전하며, 우리의 내부 시뮬레이션이 우리를 잘못된 길로 인도할 수 있음을 시사한다.
이 아이디어를 테스트하기 위해, 연구자는 사람들이 반복적인 선택이 포함된 게임을 수행하는 두 가지 다른 유형의 실험 데이터를 분석했다. 윌슨 과업(Wilson task)으로 알려진 한 세트의 실험에서, 참가자들은 단순한 두 가지 옵션 게임에 직면했다. 연구자들은 결정 시점에 옵션에 대한 참가자들의 지식이 동일하도록 게임을 정교하게 통제했지만, 수행해야 할 미래의 턴 수는 다양하게 설정했다. 어떤 경우에는 참가자들이 단 한 번의 턴만 남았다는 것을 알았고, 다른 경우에는 여섯 번의 턴이 남아 있다는 것을 알았다. 만약 사람들이 단순히 최선의 옵션을 찾으려 하는 것이라면, 지식이 동일하기 때문에 두 경우 모두 행동이 같아야 했다. 그러나 데이터는 명확한 차이를 보여주었다. 참가자들이 더 많은 턴이 남아 있다는 것을 알았을 때, 그들은 최선이 아닌 옵션을 선택할 가능성이 유의미하게 높았다. 이 결과는 매우 강력하여, 사람들이 단순히 더 신중해지거나 호기심이 많아진 것이라는 일반적인 학습 이론이나 설명으로는 설명될 수 없었다. 이 특정 패턴을 재현할 수 있는 유일한 모델은, 결정자가 무언가를 새로 배울 것이라고 예상하지 않은 채 자신의 미래 선택을 상상하는 '미래 경로(future-path)' 시뮬레이션에 기반한 모델뿐이었다.
연구는 이 행동을 다른 형태의 탐색과 구별하기 위해 더 나아갔다. 때때로 사람들은 가능한 최선의 선택에 대해 더 많은 정보를 수집하기 위해 의도적으로 더 나쁜 옵션을 선택하는데, 이를 '지향적 탐색(directed exploration)'이라고 한다. 이 연구에서의 고집스러운 선택이 스마트한 탐색인지 아니면 단순히 정체된 것인지를 확인하기 위해, 연구자는 여러 지점이 존재하는 격자 위에서 진행되는 더 복ual한 두 번째 게임을 살펴보았다. 이 게임에서 진정한 최적의 지점은 연구자들에게 알려져 있었다. 분석 결과, 긴 시간 지평 상황에서 사람들이 비최적적인 선택을 할 때, 그들은 최적의 지점을 향해 탐색하는 것이 아니라 진정으로 더 나쁜 지점들을 향해 움직이고 있었다. 그들은 최적을 찾기 위해 탐색하는 것이 아니라, 그로부터 멀어지고 있었다. 이는 이 고집스러운 선택이 '고착'임을 확인시켜 주었다. 즉, 개인의 정신적 시뮬레이션이 현재의 선택을 실제보다 더 매력적으로 보이게 함으로써 발생하는 자기 강화적 루프이다.
연구는 또한 선택지의 크기가 이 행동에 어떻게 영향을 미치는지 조사했다. 격자 게임에서 참가자들은 30개 또는 121개의 서로 다른 지점 중 하나를 선택해야 했다. 모델은 더 많은 옵션이 있으면 정신적 미래 시뮬레이션의 불확실성이 증가하여, 나쁜 선택에 고착될 가능성이 더욱 높아질 것이라고 예측했다. 데이터는 이를 뒷받침했다. 사용 가능한 옵션의 수가 증가함에 따라, 비최적의 선택에 머무르는 비율도 함께 높아졌다. 또한, 연구는 최선의 옵션과 차선책 사이의 가치 차이가 매우 명확할 때 사람들은 고착될 가능성이 낮아진다는 것을 발견했다. 그러나 그 격차가 작거나 미래가 멀게 느껴질 때, 평범한 선택을 지속하려는 경향은 더 강해졌다.
이러한 발견은 인간의 의사결정이 냉철한 계산보다는 상상력의 한계에 더 가깝다는 그림을 그려낸다. 이 연구는 우리의 뇌가 항상 미래를 최적화하기 위해 앞을 내다보는 것이 아니라, 때로는 앞을 내다보며 우리가 어디로도 인도하지 못할 길을 더 안전하게 느끼게 만드는 가능성의 안개를 보고 있다고 제사한다. 우리가 미래에도 변하지 않을 것처럼 미래의 자신을 시뮬레이션함으로써, 우리는 의도치 않게 학습에 대한 장벽을 만든다. 이 연구는 이것이 인간 지능의 결함이라고 주장하는 것이 아니라, 우리가 시간과 불확실성을 처리하는 방식의 구조적 특징이라고 본다. 우리가 삶을 계획하기 위해 사용하는 바로 그 메커니즘—다음에 무엇을 할지 상상하는 것—이 때로는 우리를 최선의 길을 찾지 못하게 만드는 원인이 될 수 있음을 보여준다. 결과는 수천 번의 시행을 통해 견고하게 입증되었으며, 단순한 실수나 일반적인 다양성 선호와 같은 다른 설명들을 배제했을 때도 유효했다.
궁극적으로, 이 논문은 이러한 특정한 종류의 정체 현상을 포착하는 수학적 프레임을 제공한다. 이는 비최적의 선택을 할 확률이 남은 시간이 길어지고 옵션의 수가 확장됨에 따라 증가함을 보여준다. 이는 남은 시간이 많을수록 최선의 해결책을 찾는 데 도움이 된다는 전통적인 합리적 학습 이론과는 반대되는 결과이다. 이 연구는 인간 학습자에게 있어, 더 많은 시간을 갖는 것이 오히려 더 적은 것에 안주하게 만들 수 있음을 확인해 준다. 연구는 뇌가 정확히 어떻게 이 미래의 불확실성을 계산하는지에 대한 질문을 남겨두었지만, 우리가 미래의 선택을 상상하는 방식이 현재의 행동을 이끄는 강력한 동력이 될 수 있으며, 우리에게 이로운 패턴에 갇히게 할 수도 있다는 점을 확고히 정립했다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.