← 최신 논문
🧬 biology

Beyond model-based and model-free learning: irrational learning of successor features in addictive behaviour

이 연구는 물질 사용 장애를 가진 개인들이 보상 극대화보다 인지적 비용을 최소화하기 위해 단순화되고 재사용 가능한 후속 특징(successor features)으로 전환하는 자원 합리적(resource-rational) 성향을 특징으로 하는 비합리적 학습을 보인다는 점을 입증함으로써, 중독 연구에서의 전통적인 모델 기반 대 모델 프리 이분법에 도전한다.

원저자: Ru-Yuan Zhang, Zeming Fang, Yu-Yan Gao, Yu-Feng Xia, Zi-Jian Cheng, Lingxiao Yang, Wei Li, Tomoko Kishimoto, Lei Guo, Trevor Robbins

게시일 2026-07-31
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ru-Yuan Zhang, Zeming Fang, Yu-Yan Gao, Yu-Feng Xia, Zi-Jian Cheng, Lingxiao Yang, Wei Li, Tomoko Kishimoto, Lei Guo, Trevor Robbins

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신의 뇌를 수천 개의 서로 다른 게임을 동시에 실행해야 하는 아주 똑똑한 비디오 게임 콘솔이라고 상상해 보세요. 어떤 게임은 "가위바위보"처럼 단순히 "바위는 가위를 이긴다"는 것을 암기하는 것처럼 간단합니다. 다른 게임은 전체 지도를 그리고, 모든 적이 어떻게 움직일지 예측하며, 열 단계 앞을 계획해야 하는 복잡한 전략 어드벤처와 같습니다. 오랫동안 과학자들은 우리의 뇌가 두 가지 스타일 사이에서 줄다리기를 하며 갇혀 있다고 생각했습니다. 즉, 과거에 효과적이었던 것을 단순히 암기하는 "게으른" 스타일(Model-Free)과, 세상을 이해하기 위한 정신적 지도를 구축하여 앞을 내다보는 "열심히 일하는" 스타일(Model-Based) 사이의 줄다리기 말입니다. 그들은 중독 상태에서 뇌가 게을러져서 계획하기를 멈추고 오래된 습관에만 의존한다고 믿었습니다. 하지만 만로 우리 뇌가 단순히 게으르거나 열심히 일하는 것이 아니라면 어떨까요? 만약 뇌가 실제로 "두뇌 에너지"(또는 인지적 노력)가 얼마나 드는지, 그리고 그 결정이 얼마나 많은 "즐거움"(보상)을 돌려주는지를 끊임없이 계산하는 영리한 회계사가 되려고 노력하는 것이라면 어떨까요? 이것이 바로 "자원 합리성(resource-rationality)"의 세계입니다. 이는 우리 뇌가 항상 최소한의 정신적 에너지로 최선의 거래를 얻으려고 노력한다는 것을 의미하는 멋진 표현입니다.

이제 장루원(Ru-Yuan Zhang)과 그 팀의 새로운 연구로 들어가 보겠습니다. 그들은 물질 사용 장애(SUD)가 있는 집단과 건강한 자원봉사자 집단을 대상으로 이 아이디어를 테스트하기로 했습니다. 그들은 단순히 한 가지 게임을 시킨 것이 아니라, 그들을 거대한 다층 구조의 던전 크롤러 게임에 던져 넣었습니다. 나무, 돌, 철이라는 세 가지 자원의 "시장 가격"이 매 라운드마다 변하는 나무 모양의 지도를 가진 성을 상상해 보세요. 당신의 목표는 변화하는 가격에 따라 가장 가치 있는 자원을 얻기 위해 성의 경로를 선택하는 것입니다. 반전은 가격이 매번 바뀐다는 점이며, 이는 동일한 성 안에서 네 가지의 서로 다른 "과업" 또는 게임을 만들어냅니다. 크게 이기려면 성의 구조를 학습해야 하고, 가격이 바뀔 때마다 자신의 경로를 빠르게 적응시켜야 합니다.

연구진은 기존의 "게으른 대 열심히 일하는" 규칙을 깨뜨리는 놀라운 사실을 발견했습니다. 사람들이 게임을 하는 방식을 관찰했을 때, "게으른" 습관 기반 스타일이나 "열심히 일하는" 지도 구축 스타일 중 그 어느 것도 일어나는 현상을 완전히 설명할 수 없었습니다. 대신, 모두가 "계승 특징(Successor Features)"이라는 영리한 중간 단계 전략을 사용하는 것처럼 보였습니다. 이것은 마치 모든 단계를 하나하나 암기하는 것이 아니라 방의 "분위기"를 배우는 것과 같습니다. 당신은 "A 방은 보통 나무 더미로 이어진다"와 "B 방은 보통 돌로 이어진다"는 것을 배우고, 이 "분위기"들을 조합하고 섞어서, 처음부터 전체 정신적 지도를 다시 만들 필요 없이 새로운 가격 퍼즐을 해결할 수 있습니다.

하지만 중독이 있는 집단을 살펴보면 이야기는 반전됩니다. 건강한 플레이어들은 이러한 "분위기"를 사용하여 전략을 유연하게 바꾸고 모든 가격 목록에 대해 최선의 경로를 찾아낸 반면, 중독이 있는 플레이어들은 갇혀 버리기 시작했습니다. 그들은 전략을 바꾸는 데 필요한 정신적 노력이 너무 비용이 많이 든다고 느꼈습니다. 그래서 그들은 "원 사이즈(one-size-fits-all)" 접근 방식을 채택했습니다. 가격이 무엇이든 상관없이, 그들은 가장 기억하기 쉬운 경로인 (4번 방)으로 계속 달려갔으며, 이는 많은 돈을 놓치는 결과를 초래하더라도 말입니다. 이 연구는 그들이 지도를 배울 수 없어서가 아니라, 그들의 뇌가 사고의 "비용"에 과도하게 민감해졌기 때문임을 시사합니다. 그들은 정신적 에너지를 아끼기 위해 보상을 기꺼이 희생할 용의가 있었습니다.

연구진은 보상과 정신적 노력을 저울질하는 "두뇌 회계사" 역할을 하는 컴퓨터 모델을 구축했습니다. 그들이 "자원 합리적 계승 특징(RRSF)" 모델이라고 부른 이 모델만이 두 집단의 행동을 완벽하게 예측할 수 있었습니다. 이 모델은 중독 집단이 훨씬 높은 "비용 민감도"를 가지고 있음을 보여주었습니다. 즉, 그들은 전략을 바꾸는 정신적 노력을 엄청난 부담으로 느꼈고, 그래서 단순한 기본 계획을 고수했습니다. 또한 연구는 중독 증상이 심각할수록 정신적 노력을 피하고 경직되고 차선의 경로를 고수하는 경향이 더 강하다는 것을 발견했습니다.

요약하자면, 이 논문은 중독이 단순히 "계획" 시스템이 고장 났거나 "습관" 시스템이 고장 난 것이 아니라는 점을 시사합니다. 대신, 그것은 정신적 에너지를 지나치게 아끼려는 뇌에 관한 것입니다. 이는 마치 새로운 레벨을 배우는 대신, 새로운 레벨을 파악하는 것이 너무 지치기 때문에 그냥 똑같은 버튼을 계속 누르고 있는 게이머와 같습니다. 이 연구는 83명의 물질 사용 장애 환자와 45명의 건강한 대조군을 대상으로 이러한 행동을 측정했으며, "게으른" 행동이 사실은 인지적 노력을 아끼기 위한 계산된, 비록 부적응적일지라도 의도적인 시도였다는 것을 발견했습니다. 이 새로운 관점은 중독에서 보이는 경직되고 반복적인 행동이, 비록 최고의 보상을 놓치게 될지라도, 정신적 압도로부터 자신을 보호하려는 뇌의 방식일 수 있다는 점을 이해하는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →