Intention Inference Under Execution Noise: Separating Aleatoric and Epistemic Uncertainty in Social Dilemmas
본 논문은 노이즈가 존재하는 사회적 딜레마 상황에서 적대적 의도와 실행 오류를 구분하기 위해 능동적 추론(active inference) 내의 부분 관측 마르코프 결정 과정(POMDP) 프레 framework를 제안하며, 의도 추론이 조건부 상대방에 대한 협력을 개선하는 반면 높은 노이즈 하에서의 상호 추론는 역설적으로 상관된 신념 기반의 붕괴를 유발할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 친구와 "신뢰(Trust)" 게임을 하고 있다고 상상해 보세요. 당신과 친구 모두 비밀 목표를 가지고 있습니다. 바로 협력하여 큰 보상을 나누는 것입니다. 하지만 여기 반전이 있습니다. 이 게임은 가끔씩 지직거리는 무전기로 진행됩니다. 당신은 "너를 믿어"라고 말하려 했지만, 잡음 때문에 메시지가 뒤집혀서 친구에게는 "네 보상을 내가 훔칠 거야"라고 들릴 수도 있습니다. 이때 당신의 친구는 중대한 결정을 내려야 합니다. 당신이 정말로 보상을 훔치려 했던 것일까요, 아니면 그저 통신 상태가 불량했던 것일까요? 만약 친구가 잡음이 들릴 때마다 당신을 도둑이라고 가정한다면, 그들은 영원히 당신을 믿지 않게 될 것이고, 결국 둘 다 보상을 놓치게 될 것입니다. 이것이 게임 이론의 유명한 퍼즐인 '죄수의 딜레마'에 '노이즈(잡음)'라는 복잡한 설정이 더해진 핵심입니다. 과학자들은 특히 세상이 잡음으로 가득할 때, 로봇이나 AI가 '나쁜 행동'이 실수인지 아니면 배신인지를 어떻게 구별해낼 수 있을지 오랫동안 연구해 왔습니다. 만약 그들이 이를 잘못 판단한다면, 협력을 파괴하는 분노의 연쇄 반응이 시작될 수 있기 때문입니다.
이 논문은 바로 그 문제를 깊이 파고듭니다. 저자인 키발 마하데와 조나단 쇼크(Kival Mahadewa and Jonathan Shock)는 다음과 같이 질문합니다. "에이전트(행위자)는 어떻게 노이즈 섞인 사고와 악의적인 의도를 구분할 수 있는가?" 그들은 이 게임을 바라보는 새로운 방식을 제안하며, '의도(intention)'를 숨겨진 비밀로, '행동(action)'을 노이즈가 섞인 단서로 취급합니다. 그들은 이러한 '마음 읽기(mind-reading)' 방식이 협력하고자 하는 친구와 게임을 할 때는 눈부시게 효과적이지만, 매우 시끄러운 환경에서 두 플레이어가 서로의 마음을 읽으려고 할 때는 오히려 역효과를 낼 수 있다는 것을 발견했습니다. 그런 경우, 두 플레이어는 서로가 화가 났다고 올바르게 추측하게 되는 루프에 빠져 신뢰의 완전한 붕괴를 초래할 수 있습니다. 즉, 의도를 너무 잘 파악하는 것이 잡음이 너무 심할 때는 오히려 함정이 될 수 있다는 것입니다.
지직거리는 무전기의 이야기
상황을 설정해 봅시다. 두 에이전트(이름을 "로보-A"와 "로보-B"라고 합시다)가 '반복 죄수의 딜레마'라는 게임을 하고 있습니다. 이 게임에서 그들은 협력(착하게 행동하기)하거나 배반(이기적으로 행동하기)하는 선택을 번갈아 가며 합니다. 둘 다 협력하면 둘 다 큰 보상을 얻습니다. 한 명은 배반하고 다른 한 명은 협력하면, 배반한 쪽은 엄청난 이득을 얻고 협력한 쪽은 손해를 봅니다. 둘 다 배반하면 둘 다 작고 슬픈 보상을 받습니다.
이제, 이 게임이 "잡음" 문제가 있는 무전기를 통해 진행된다고 상상해 보세요. 예를 들어, 잡음이 그들의 의도된 메시지를 10%의 확률로 뒤집는다고 가정합시다. 로보-A는 "협력" 버튼을 누르려 했지만, 잡음 때문에 메시지가 바뀌어 로보-B에게는 "배반" 신호가 전달되었습니다.
여기서 문제가 발생합니다. 로보-B는 로보-A가 나쁘게 행동하려고 의도한 것인지, 아니면 단순히 잡음 때문에 발생한 일인지 알 수 없습니다.
- 기존 방식 (MDP): 표준 컴퓨터 모델은 "배반" 신호를 사실로 취급합니다. 그들은 "로보-A가 나를 배신했다!"라고 생각하고 즉시 보복합니다. 이는 일어나지도 않은 실수 때문에 서로를 계속 처벌하는 분노의 소용돌이로 이어집니다.
- 새로운 방식 (POMDP): 저자들은 더 똑똑한 모델을 제안합니다. 단순히 신호를 보는 대신, 로봇은 '의도'가 무엇이었을지 추측해야 합니다. 로봇은 이렇게 묻습니다. "내가 '배반' 신호를 보았고, 무전기가 불량하다는 것을 알고 있다면, 로보-A가 나쁘게 행동한 것일까, 아니면 그냥 잡음 때문일까?"
"마음을 읽는" 로봇
저자들은 **능동적 추론(Active Inference)**이라는 프레임워크를 사용하여 로봇을 구축했습니다. 이 로봇을 두 가지 미스터리를 동시에 풀려고 노력하는 탐정이라고 생각해 보세요.
- 내 친구는 지금 무엇을 하려고 하는가? (이것은 실수인가, 아니면 배신인가?)
- 내 친구는 어떻게 학습하는가? (내가 협력하면, 그들도 협력하도록 배울 것인가?)
이 로봇은 두 가지 욕구 사이의 균형을 맞추는 특별한 "비용 함수(cost function, 결정의 점수를 매기는 방식)"를 가지고 있습니다.
- 실용적 가치(Pragmatic Value): "나는 지금 당장 최고의 보상을 얻고 싶다." (속지 마라!)
- 인식적 가치(Epistemic Value): "나는 진실을 배우고 싶다." (친구가 실제로 착한지 아니면 착한 척하는 것인지 테스트해야 한다.)
이 둘의 균형을 맞춤으로써, 로봇은 다음과 같이 말할 수 있습니다. "나는 '배반' 신호를 보았지만, 내 친구는 보통 협력해 왔고 잡음이 심하다. 나는 이것이 실수였다고 가정하고, 어떤 일이 일어나는지 보기 위해 다시 협력을 시도하겠다." 이는 무턱대고 당하지 않으면서도 '용서'할 수 있는 원칙적인 방법입니다.
놀라운 반전: 마음 읽기가 역효과를 낼 때
저자들은 이 새로운 로봇이 다양한 유형의 상대와 어떻게 성능을 보이는지 확인하기 위해 수천 번의 시뮬레이션을 실행했습니다.
시나리오 1: "착한" 상대(Tit-for-Tat)와 경기할 때
로봇이 도발당하지 않는 한 협력하도록 프로그래밍된 상대와 경기할 때, 이 새로운 "마음 읽기" 로봇은 슈퍼스타가 됩니다. 이 로봇은 대부분의 "배반" 신호가 그저 잡음임을 정확히 식별해 냅니다. 실수를 용서하고 협력을 유지하며, 기존의 "최악을 가정하는" 로봇보다 훨씬 높은 점수를 얻습니다. 로봇은 상대의 패턴을 학습하고 행복한 협력의 리듬을 찾아갑니다.
시나리오 2: "복사꾼(Copycat)"(자기 자신과의 대결)과 경기할 때
여기서 기묘한 일이 벌어집니다. 저자들은 두 대의 새로운 "마음 읽기" 로봇이 서로 대결하게 했습니다.
- 낮은 잡음(매우 깨끗한 무전기)에서는, 두 로봇 모두 상대가 착하다는 것을 파악하고 완벽하게 협력합니다.
- 하지만 높은 잡음(매상 매우 지직거리는 무전기)에서는 이상한 현상이 나타납니다. 로봇들이 붕괴하기 시작합니다.
왜 그럴까요? 그들이 자신의 일을 너무 잘 수행했기 때문입니다.
로보-A가 "배반" 신호를 본다고 가정해 봅시다. 로보는 생각합니다. "흠, 잡음이 심하긴 하지만, 내 친구가 최근에 좀 이상하게 행동했어. 어쩌면 정말로 화가 난 걸까?" 그래서 로보는 보복하기로 결정합니다. 로보-B는 로보-A의 보복을 보고, "오, 저 친구는 확실히 지금 화가 났구나"라고 생각하며 다시 보복합니다.
두 로봇 모두 상대의 '진정한 의도'를 추론하려고 노력하기 때문에, 의도치 않게 피드백 루프를 만들어냅니다. 그들은 (첫 번째 로봇이 실제로 보복을 했기 때문에) 상대가 실제로 적대적이라는 것을 정확하게 추론하게 되고, 결과적으로 계속 싸우게 됩니다. "잡음"은 단순히 오해를 일으킨 것이 아니라, **신념에 의한 붕괴(belief-driven collapse)**를 일으켰습니다. 그들은 혼란스러워서 협력을 멈춘 것이 아니라, 상대가 나쁘다고 너무 확신하게 되었기 때문에 협력을 멈춘 것입니다.
임계점
논문은 잡음에 대한 특정 "티핑 포인트(tipping point)"를 계산합니다.
- 잡음이 10% 미만(수학적으로 0.05에서 0.10 사이)이면, 로봇들은 대개 실수와 배신을 구분할 수 있습니다.
- 잡음이 15%를 넘어서면, 로봇들은 서로에 대해 협력을 유지할 수 없습니다. "협력적 의도"가 너무 희박해지기 때문에, 로봇들은 "이것은 실수가 아니라, 저 사람이 나를 해치려 하는 것이 분명하다"라고 결정하고 영구적인 방어 모드로 전환합니다.
저자들은 이러한 붕괴가 로봇의 수학 실력이 부족해서 발생하는 것이 아니라, 오히려 수학이 너무 정확하기 때문이라고 밝혔습니다. 잡음이 많은 세상에서 두 에이전트가 모두 서로의 숨겨진 생각을 추측하려고 노력한다면, 그들은 서로가 화가 났다고 정답을 맞히게 되고, 결국 시스템 전체가 무너질 수 있습니다.
이것이 의미하는 바
이 논문은 협력의 문제를 영원히 해결했다고 주장하는 것이 아닙니다. 대신, 세상을 어떻게 표현하느냐가 중요하다는 것을 보여줍니다.
- 만약 당신이 행동을 사실로 취급한다면(기존 방식), 너무 쉽게 혼란에 빠지고 화를 낼 것입니다.
- 만약 당신이 행동을 숨겨진 의도를 알려주는 노이즈 섞인 단서로 취급한다면(새로운 방식), 훨씬 더 똑똑하고 관대해질 수 있습니다.
- 하지만, 만약 모든 사람이 혼란스러운 세상에서 서로의 마음을 추측하려고 한다면, 모두가 서로가 화가 났다고 올바르게 추측하게 되어 시스템 전체가 무너지는 "신뢰 붕괴"를 겪을 위험이 있습니다.
저자들은 이러한 "의도 추론"이 강력한 도구이지만 한계가 있다고 제안합니다. 이 방식은 당신이 협력하고자 하는 사람과 함께할 때는 매우 훌륭하지만, 모두가 혼돈의 세상 속에서 서로의 마음을 추측하려 할 때는 취약해질 수 있습니다. 이는 때때로 타인이 무엇을 생각할지에 대해 너무 많이 아는 것이, 오히려 그들을 신뢰하기 어렵게 만들 수 있다는 점을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.