← 최신 논문
💻 computer science

Risk-Aware Preference Learning for Stochastic Outcomes

이 논문은 인간의 위험 민감도를 모델링하기 위해 누적 전망 이론을 통합하는 것이 전통적인 기대 효용 가설과 비교했을 때 확률적 로봇 내비게이션을 위한 선호도 학습에서 보상 함수 회복을 유의미하게 개선하고 후회를 줄인다는 것을 입증한다.

원저자: Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 예의 바른 인간처럼 행동하는 법을 가르치려 한다고 상상해 보십시오. 단순히 "사람을 때리지 마라"라거나 "빨리 걸어라"와 같은 긴 규칙 목록을 작성할 수는 없습니다. 왜냐하면 삶은 복잡하고 뜻밖의 일들로 가득하기 때문입니다. 대신, 과학자들은 영리한 기술을 찾아냈습니다. 로봇에게 서로 다른 두 가지 움직임을 보여준 뒤, 인간에게 "어느 쪽이 더 나아 보이나요?"라고 묻는 것입니다. 이 과정을 수천 번 반복함으로써, 로봇은 인간이 실제로 무엇을 가치 있게 여기는지에 대한 숨겨진 '점수판(scorecard)'을 배울 수 있습니다. 이것을 **선호 기반 보상 학습(preference-based reward learning)**이라고 부릅니다.

하지만 대부분의 연구 배경에는 까다로운 가정이 하나 숨어 있습니다. 그것은 인간이 상황의 좋고 나쁨을 단순히 합산하고, 각 요소가 발생할 확률에 따라 가중치를 부여하는 완벽한 계산기라고 가정하는 것입니다. 이를 **기대 효용(Expected Utility)**이라고 합니다. 하지만 실제 인간은 계산기가 아닙니다. 우리는 감정적입니다. 우리는 드물게 발생하는 재난(예: 자동차 사고)을 지나치게 걱정하며, 무언가를 얻는 기쁨보다 잃는 고통을 더 크게 느낍니다. 이 논문은 다음과 같은 단순한 질문을 던집니다. 만약 우리가 인간을 완벽한 계산기로 가정하는 모델을 사용하여 로봇을 가르친다면, 실제 인간은 위험을 회피하고 감정적인 의사 결정자라면 어떻게 될까요?

콜로라도 대학교 볼더 캠퍼스의 연구진은 로봇이 보행자 인파 사이를 통과해야 하는 시뮬레이션 세계에서 이 아이디어를 테스트하기로 했습니다. 이 세계에서 로봇이 하는 모든 움직임은 단 하나의 보장된 경로가 아닙니다. 대신, 그것은 주사위를 던지는 것과 같습니다. 로봇은 매끄럽게 미끄러지듯 나아갈 수도 있고, 누군가와 부딪힐 수도 있으며, 혹은 갇혀버릴 수도 있습니다. 결과는 직선이 아니라 가능성들의 구름입니다.

연구팀은 두 종류의 '스승'(로봇이 선호를 배우고자 하는 대상인 인간)을 설정했습니다. 한 스승은 오직 평균적인 결과만을 신경 쓰는 '완벽한 계산기'(기대 효용, EU)였습니다. 다른 스승은 **누적 전망 이론(Cumulative Prospect Theory, CPT)**이라는 복잡한 심리학적 모델을 사용하는 '위험 민감형' 인간이었습니다. 이 모델은 실제 사람들이 희귀하고 무서운 사건의 가능성을 과대평가하고, 충돌의 고통을 매끄러운 경로의 즐거움보다 훨씬 더 날카롭게 느낀다는 점을 반영합니다.

연구진은 또한 두 종류의 '학생'(학습 알고리즘)을 준비했습니다. 한 학생은 스승이 완벽한 계산기라고 가정하는 'EU 학습자'였고, 다른 학생은 스

가 위험에 민감한 인간이라고 가정하는 'CPT 학습자'였습니다. 그들은 두 학생에게 스승이 생성한 수천 개의 "어떤 경로가 더 나은가요?"라는 질문을 던졌고, 두 학생이 실제 점수판을 얼마나 잘 학습하는지 관찰했습니다.

시뮬레이션 결과는 다음과 같았습니다. 스승이 완벽한 계산기였을 때는 계산기 학생이 완벽하게 학습했고, 위험 민감형 학생은 추가된 복잡성 때문에 약간 혼란을 겪었습니다. 하지만 스승이 위험 민감형 인간이었을 때, 계산기 학생은 현저히 낮은 성능을 보였습니다. 이 학생은 인간의 충돌에 대한 공포를 설명하기 위해 회복된 점수판을 왜곡하려 했으며, 그 결과 로봇에게 충돌은 "조금 나쁜 것"일 뿐이지 "재앙적인 것"은 아니라고 믿게 만들어 편향된 보상을 도출했습니다. 로봇은 덜 정확한 교훈을 얻은 것입니다.

반면, 위험 민감형 학생(CPT 학습자)은 훨씬 더 나은 성과를 보였습니다. 이 학생은 인간이 단순히 결과의 가치를 다르게 평가하는 것이 아니라, 불확실성을 다르게 가중치 두고 있다는 점을 깨달았습니다. 결과의 "가치"와 위험에 대한 "공포"를 분리함으로써, CPT 학습자는 훨씬 더 낮은 오차로 점수판을 회복해 냈습니다.

이 논문은 만약 우리가 현실 세계에서 로봇을 안전하고 인간의 가치에 부합하도록 만들고 싶다면(현실에서는 희귀한 사고가 매우 무섭고 사람들이 본능적으로 불안을 느끼기 때문), 인간을 논리적인 수학 기계라고 가정해서는 안 된다고 제안합니다. 우리는 인간의 공포와 위험 민감도를 이해하는 로봇을 만들어야 합니다. 그렇지 않으면 로봇은 우리가 위험을 상관하지 않는다고 생각하여 위험한 지름길을 택하도록 배울 수 있습니다. 비록 이 결과가 실제 사람을 대상으로 한 실제 로봇 테스트가 아닌 컴퓨터 시뮬레이션에서 나온 것이지만, 증거는 명확한 필요성을 가리킵니다. 로봇에게 안전함을 가르치려면, 먼저 인간이 미지의 세계에 대해 실제로 어떻게 느끼는지 가르쳐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →