State-Dependent Observation Noise Reintroduces Epistemic Value in Linear-Gaussian Active Inference
이 논문은 선형-가우시안 능동 추론 모델에 상태 의존적 관측 노이즈를 도입하는 것이 사후 공분산과 유효 칼만 이득을 행동 의존적으로 만듦으로써 인식적 가치를 복원하고, 이를 통해 곱셈적 제어 역학을 요구하지 않고도 정보 탐색 행동을 위한 동기를 재확립한다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
호기심의 과학: 길을 잃는 것이 왜 최고의 학습 방법이 될 수 있는가
당신이 로봇에게 어둡고 안개가 자욱한 미로를 통과하는 법을 가르치고 있다고 상상해 보십시오. 인공지능의 세계에는 기계에게 행동을 가르치는 두 가지 주요 방법이 있습니다. 첫 번째는 '보상 사냥꾼(reward hunter)'입니다. 로봇에게 "금화를 가져와!"라고 명령하면, 로봇은 금화를 잡기 위해 다른 모든 것은 무시한 채 무엇이든 할 것입니다. 두 번째는 '호기한 탐험가(curious explorer)'입니다. 이 로봇은 금코인이 눈에 보이지 않더라도, 배우고 싶어 하고, 혼란을 줄이고, 자신이 어디에 있는지 파악하도록 프로그래밍됩니다. 이 두 번째 유형의 행동을 **능동적 추론(Active Inference)**이라고 부릅니다. 이는 지능적인 에이전트가 단순히 보상을 쫓는 것이 아니라, 불확실성을 느끼는 것이 내부 뇌에 '비용이 많이 드는' 일이기 때문에 정보를 쫓는다는 이론입니다.
오랫동안 과학자들은 **선형-가우시안 모델(Linear-Gaussian models)**이라는 단순하고 예측 가능한 세계를 사용하여 이 아이디어를 테스트해 왔습니다. 이것을 로봇이 직선으로 움직이고 센서가 세상을 약간 흐릿하지만 일관되게 보여주는, 아주 매끄럽고 곧은 복도라고 생각하십시오. 이 단순한 세계에서는 유명한 문제가 발견되었습니다. 로봇의 '호기심 스위치'가 꺼진 상태로 고정되어 버리는 것입니다. 로봇이 무엇을 하든, 그가 얻을 것으로 기대되는 새로운 정보의 양은 정확히 동일하게 유지됩니다. 이는 마치 학생이 "이 책의 어떤 페이지를 넘기더라도 새로운 것을 배울 수 없을 거야"라고 생각하여, 배우기를 멈추고 그저 정답을 맞히는 데만 집중하는 것과 같습니다. 이 논문은 단순하지만 심오한 질문을 던집니다. "로봇의 세계에 아주 작고 현실적인 변화를 준다면, 이 호기심 스위치를 다시 켤 수 있을까?"
발견: 센서가 '범위에 따라 달라질' 때
이 논문의 저자인 다니엘 코바(Daniel Corva)는 이 "지루한" 선형 로봇들에게 호기심을 다시 불러일로 수 있는 놀랍도록 간단한 방법을 찾아냈습니다. 그는 문제가 로봇의 목표나 움직임이 아니라, 로봇의 눈이 작동하는 방식에 있다는 것을 발견했습니다.
기존의 "고장 난" 모델에서 로봇의 센서는 어디에서나 동일하게 흐릿하다고 가정되었습니다. 로봇이 벽 바로 옆에 서 있든 구석 멀리 떨어져 있든, 카메라의 흐릿함(이를 **노이즈(noise)**라고 합니다)은 동일했습니다. 흐릿함이 변하지 않았기 때문에, 로봇은 물체에 가까이 다가간다고 해서 자신의 모습이 더 선명해지지 않는다는 것을 깨달았습니다. 따라서 로봇은 배우기 위해 움직일 이유가 없었으며, 오직 금코인을 얻기 위해서만 움직였습니다.
저자들은 작은 수정을 제안했습니다. 만약 센서의 흐릿함이 로봇이 어디에 있는지에 따라 달라진다면 어떻게 될까요? 물체에 가까워지면 매우 선명해지지만, 멀어지면 매우 거칠고 흐릿해지는 카메라를 상상해 보십시오. 이것을 **상태 의존적 관측 노이즈(state-dependent observation noise)**라고 부릅니다. 현실 세계에서 우리의 감각은 정확히 이와 같이 작동합니다. 표지판은 가까이 있을 때는 읽기 쉽지만, 길 건너편 멀리 있을 때는 읽는 것이 불가능합니다.
"이중 효과": 더 잘 보기 위해 움직이다
저자들이 로봇 모델에 이 "범위 의존적" 흐림 현상을 추가했을 때, 마법 같은 일이 일어났습니다. 로봇은 갑자기 자신의 행동이 미래를 보는 능력을 바꿀 수 있다는 것을 깨달았습니다.
로봇이 벽에 가까이 다가가면 센서의 노이즈가 줄어들고, 로봇의 내부 지도는 훨씬 더 선명해졌습니다. 멀리 떨어져 있으면 지도는 계속 흐릿한 상태로 남았습니다. 이는 **이중 효과(dual effect)**를 만들어냈습니다. 로봇의 행동(이동)은 두 가지 일을 동시에 수행했습니다. 첫째, 로봇의 위치를 바꾸었습니다(명백한 부분). 둘째, 그리고 이것이 새로운 부분인데, 로봇이 자신의 위치에 대해 확신하는 정도(certainty)를 바꾸었습니다.
이제 로봇은 더 잘 보기 위해 이동하는 것을 선택할 수 있게 되었으므로, 뇌 속의 '호기심 항(curiosity term)'이 깨어났습니다. 로봇은 다시 호기한 탐험가처럼 행동하기 시작했습니다. 로봇은 단지 벽을 만지고 싶어서가 아니라, 벽에 가까이 다가가는 것이 시야를 더 맑게 하고 미로를 더 잘 이해하게 도와주기 때문에 벽 쪽으로 걷기로 선택했습니다.
이것이 AI에 의미하는 바
이 논문은 이러한 작은 변화가 "고착된" 행동을 깨뜨리기에 충분하다는 것을 수학적으로 증명합니다. 이전에는 단순한 직선형 세계에서 로봇의 움직임을 매우 복잡하게 만들거나 목표를 바꾸지 않는 한 호기심이 불가능하다고 생각했습니다. 이 논문은 목표나 움직임의 규칙을 바꿀 필요가 없음을 보여줍니다. 단지 센서가 멀어질수록 성능이 떨어진다는 사실을 인정하기만 하면 됩니다.
저자들은 단순히 방정식만 쓴 것이 아니라, 이를 증명하기 위해 cpomdp라는 소프트웨어 도구를 구축했습니다. 그들은 가상 로봇을 만들고, "스마트한" 센서(거리에 따라 흐려지는 센서)를 주었을 때 로봇이 정보를 수집하기 위해 선택을 하기 시작한다는 것을 보여주었습니다. 반면 "멍청한" 센서(항상 동일하게 흐릿한 센서)를 주었을 때, 로봇은 호기심을 잃고 그저 보상을 향한 경로만을 따랐습니다.
요약
주요 결론은 단순한 AI 에이전트의 호기심는 당신이 어디에 있는지와 얼마나 잘 볼 수 있는지 사이의 관계에서 나온다는 것입니다. 만약 당신의 학습 능력이 위치에 따라 달라진다면, 당신은 자연스럽게 배우기에 가장 좋은 장소로 움직이고 싶어 할 것입니다. 만약 학습 능력이 어디서나 동일하다면, 탐험할 이유가 없습니다.
이 논문은 단순한 선형 로봇들이 호기심을 가질 수 없는 운명이라는 생각을 반박합니다. 저자들은 "선형-가우시안 붕괴"(호기심이 죽는 순간)는 우리가 센서가 완벽하고 변하지 않는다고 가정할 때만 발생한다고 주장합니다. 일단 센서가 거리와 함께 저하된다는 점을 인정하면, 배우고자 하는 욕구가 돌아옵니다. 저자들은 수학적 증명과 이를 입증하는 작동하는 컴퓨터 프로그램을 제공함으로써 이에 대해 매우 확신하고 있습니다. 그들은 "행동하는 것이 주의를 기울이는 것(acting is attending)"임을 보여줍니다. 즉, 자신의 센서가 완벽하지 않다는 것을 아는 에이전트에게 몸을 움직여 주의를 집중하는 것은 자연스럽고 내재된 기능입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.