← 최신 논문
📈 economics

A Bayesian latent class reinforcement learning framework to capture adaptive, feedback-driven travel behaviour

본 논문은 베이지안 잠재 클래스 강화 학습 프레임워크를 제안하여 이질적이고 적응적인 이동 행동을 모델링하며, 운전 시뮬레이터 데이터 분석을 통해 고유한 선호도 진화 및 탐색-활용 전략을 가진 세 가지 뚜렷한 여행자 클래스를 식별한다.

원저자: Georges Sfeir, Stephane Hess, Thomas O. Hancock, Filipe Rodrigues, Jamal Amani Rad, Michiel Bliemer, Matthew Beck, Fayyaz Khan

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Georges Sfeir, Stephane Hess, Thomas O. Hancock, Filipe Rodrigues, Jamal Amani Rad, Michiel Bliemer, Matthew Beck, Fayyaz Khan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 학교에 가는 가장 좋은 방법을 배우려고 노력하고 있다고 상상해 보세요. 때때로 당신은 빠르고 신뢰할 수 있기 때문에 매일 같은 경로를 이용합니다. 하지만 다른 때에는, 설령 그것이 당신을 더 늦게 도착하게 만들지라도 새로운 길을 시도해 보는 것이 더 빠른지 확인하기 위해 새로운 거리를 시도하기도 합니다. 이것이 인간이 의사결정을 내리는 방식의 핵심입니다: 우리는 익숙한 것을 고수하는 것(착취, exploitation)과 더 많은 것을 배우기 위해 새로운 것을 시도하는 것(탐색, exploration) 사이에서 균형을 잡습니다. 오랫동안, 사람들의 이동 방식을 연구하는 과학자들은 모든 사람이 같은 방식으로 학습하거나 우리의 선호도가 돌처럼 고정되어 있다고 가정하는 모델을 사용해 왔습니다. 하지만 현실 세계에서 사람들은 복잡합니다. 우리는 서로 다른 속도로 학습하며, 새로운 정보에 의해 혼란을 느끼기도 하고, 실제로 운전할 때와 단지 여행을 상상할 때 완전히 다르게 행동할 수도 있습니다. 이 논문은 심리학과 수학을 결합하여 사람들이 단순히 무엇을 선택하는지가 아니라, 시간이 지남에 따라 그들이 어떻게 선택을 하기 위해 학습하는지를 밝혀냄으로써 이 복잡한 현실을 파고듭니다.

조르주 세이르(Georges Sfeir)와 동료들이 이끄는 이 연구의 연구진은 '잠재 클래스 강화 학습(Latent Class Reinforcement Learning, LCRL)'이라는 새로운 종류의 "여행 뇌" 모델을 구축하기로 결정했습니다. 이것을 탐정들이 왜 서로 다르게 행동하는지 이유를 찾아내려는 탐정 이야기라고 생각해보세요. 모든 사람이 같다고 가정하는 대신, 그들은 83명의 사람들이 각각 20번의 경로 선택을 하는 모습을 관찰하기 위해 운전 시뮬레이터를 사용했습니다. 참가자들의 절반은 실제로 그 경로들을 운전하며 시간이 흐르는 것을 느꼈고(경험적 피드백), 나머지 절반은 화면상의 가상 시간을 보고 버튼을 클릭하기만 했습니다(진술 선호). 연구팀은 이 데이터를 그들의 정교한 새 모델에 입력했는데, 이 모델은 일종의 분류 기계 역할을 합니다. 이 모델은 단순히 "이 사람은 빠른 경로를 좋아한다"라고 말하는 것이 아니라, "이 사람은 오래된 습관을 고수하는 느린 학습자인가? 모든 것을 시도하는 모험가인가? 아니 혹은 실제로 운전하고 있는지 아니면 단지 생각 중인지에 따라 마음을 바꾸는 사람인가?"라고 묻습니다.

모델은 운전자 그룹이 하나의 덩어리가 아니라, 각기 다른 개성을 가진 세 가지 뚜렷한 "유형"으로 나뉜다는 것을 발견했습니다. 약 22%의 사람들은 "맥락 카멜레온(Context Chameleons)"이었습니다. 이들은 컴퓨터 화면상에서 여행을 상상할 때는 한 방식으로 행동했지만(안전하고 신뢰할 수 있는 경로를 선호), 실제로 시뮬레이터에서 운전대를 잡았을 때는 행동이 완전히 뒤바뀌어 갑자기 위험하고 예측 불가능한 경로를 갈망했습니다. 이들은 학습이 느렸으며, 새로운 경험을 바탕으로 자신의 믿음을 업데이트하는 데 시간을 들였습니다.

그다음으로는 가장 큰 그룹인, 참가자의 거의 절반(49%)을 차지하는 "지속적 착취자(Persistent Exploiters)"가 있었습니다. 이 운전자들은 위험하고 불확실한 경로를 무엇이든 상관없이 사랑하는 사람들이었습니다. 실제로 운전하고 있든 버튼을 클릭하고 있든, 그들은 때때로 더 오래 걸리더라도 불확실한 경로를 계속 선택했습니다. 이들은 가장 고집스러운 착취자들이었으며, 가장 느린 그룹보다 피드백에 다소 빠르게 적응하긴 했지만, 여전히 과거의 경험에 상당히 의존했습니다.

마지막으로, 샘플의 약 29%를 차지하는 세 번째 그룹은 "적응형 전환자(Adaptive Switchers)"였습니다. 이들은 여성일 가능성이 높고 소득이 높은 경향이 있었습니다. 이들은 실제로 운전할 때는 안전한 경로를 선호하기 시작했지만, 화면을 통해 질문에 답할 때는 갑자기 더 모험적으로 변하여 위험한 경로를 선택했습니다. 이들은 가장 높은 탐색 성향을 보였으며, 안전한 옵션과 위험한 옵션 사이를 왔다 갔다 했습니다. 이들은 세 그룹 중 가장 높은 학습률 추정치를 보였으나, 이는 통계적으로 유의미하지 않았는데, 이는 이들이 급격하고 휘발적인 변화에 반응하기보다는 시간이 지남에 따라 점진적으로 진화하는 안정적인 기대를 유지했음을 시사합니다.

이 논문은 우리가 이러한 다양한 "학습 성격"을 무시한다면, 교통 시스템을 설계하거나 새로운 도로에 사람들이 어떻게 반응할지 예측하는 데 있어 실수를 저지를 수 있다고 제안합니다. 만약 당신이 "맥락 카멜레온"을 "지속적 착취자"처럼 취급한다면, 당신의 교통 조언은 완전히 실패할 것입니다. 연구진은 단순히 이 그룹들이 존재한다고 추측한 것이 아니라, '베이지안 변분 추론(Variational Bayes)'이라는 정교한 수학적 기법을 사용하여 사람들을 이 세 가지 클래스로 나누는 것이 모든 사람이 동일하게 학습한다고 가정하는 것보다 데이터를 훨씬 더 잘 설명한다는 것을 증명했습니다. 그들은 또한 각 그룹이 계속해서 똑같이 나쁜 교통 상황이나 똑같이 좋은 교통 상황을 겪게 될 경우 어떻게 반응할지를 보여주는 시뮬레이션을 실행하여, 그들의 "성격"이 실제로 어떻게 학습 방식을 바꾸는지 확인했습니다.

요약하자면, 이 논문은 여행을 이해하기 위해서 우리는 단순히 지도를 보는 것이 아니라 운전자의 마음을 들여다봐야 한다고 주장합니다. 우리는 그들이 익숙한 것을 고수하는 유형인지, 새로운 것을 쫓는 유형인지, 아니면 상황에 따라 마음을 바꾸는 유형인지 알아야 합니다. 이러한 차이를 포착하는 모델을 구축함으로써, 저자들은 도시와 계획가들이 평균적인 사람이 아닌 모든 유형의 학습자에게 작동하는 더 나은 시스템을 설계할 수 있도록 돕기를 희망하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →