← 최신 논문
💻 computer science

Counterfactual Reasoning and Environment Design for Active Preference Learning

이 논문은 인과적 추론을 통해 인간의 선호도 순위 산정을 위한 다양하고 정보가 풍부한 쿼리를 생성함으로써 환경 설계와 궤적 선택을 공동으로 최적화하여, 장기 로봇 작업에서의 보상 추정 성능을 향상시키는 새로운 능동적 선호 학습 프레임워크인 CRED를 소개한다.

원저자: Yi-Shiuan Tung, Bradley Hayes, Alessandro Roncone

게시일 2026-07-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yi-Shiuan Tung, Bradley Hayes, Alessandro Roncone

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 세상을 항해하는 법을 가르친다고 상상해 보세요. 하지만 단순히 규칙 책을 건네줄 수는 없습니다. "항상 가장 빠른 경로를 택하라"거나 "잔디밭을 가로지르지 마라"고 말할 수도 없습니다. 왜냐하면 실제 삶은 복잡하기 때문입니다. 때로는 울퉁불퉁한 길을 가더라도 속도를 원할 수도 있고, 다른 때에는 시간이 더 걸리더라도 안전을 원할 수도 있습니다. 이것이 바로 **선호도 학습(Preference Learning)**의 핵심입니다. 선호도 학습은 로봇이 인간에게 직접 명령을 듣는 것이 아니라, 인간이 서로 다른 선택지 사이에서 무엇을 고르는지 관찰함으로써 인간이 무엇을 원하는지 배우는 분야입니다. 레스토랑의 맛 테스터를 떠올려 보세요. 로봇은 당신에게 두 가지 요리를 보여주며 "어느 것이 더 좋아 보이나요?"라고 묻기 전까지는 당신이 매콤한 것을 좋아하는지 달콤한 것을 좋아하는지 알지 못합니다.

하지만 문제가 하나 있습니다. 만약 로봇이 무작위로 두 개의 경로를 보여준다면, 너무나 형편없거나 똑같은 경로에 대해 묻느라 당신의 시간을 낭비하게 될 수도 있습니다. 이것을 **능동적 선호도 학습(Active Preference Learning)**이라고 합니다. 목표는 똑똑한 면접관이 되는 것입니다. 즉, 당신의 진정한 선호도를 최대한 빨리 파악하기 위해 '올바른' 질문을 던지는 것입니다. 하지만 복잡하고 긴 여정 속에서 어떤 질문을 던질지 결정하는 것은 매우 어렵습니다. 로봇은 종종 추측에만 의존하다가 헤매게 되며, 특히 자신이 본 적 없는 낯설고 생소한 환경에 맞닥뜨렸을 때 당신만의 독특한 의사결정 스타일을 배우는 데 실패하곤 합니다.

여기서 이 논문은 로봇을 위한 강력한 상상 엔진 역할을 하는 영리한 새로운 방법인 CRED를 소개합니다. 연구진인 Yi-Shiuan Tung, Bradley Hayes, Alessandro Roncone은 로봇이 단지 현재의 세상에 대해서만 질문하는 대신, 새로운 세상을 "상상"하고 "만약 ~라면 어떨까?"라는 질문을 던져야 한다고 제안합니다.

CRED가 어떻게 작동하는지 간단한 비유를 통해 알아보겠습니다. 당신이 친구가 가장 좋아하는 아이스크림 맛을 맞히려고 노력하고 있다고 상상해 보세요. 일반적인 로봇은 그저 "바닐라가 좋아, 초콜릿이 좋아?"라고 반복해서 물을 것입니다. 하지만 CRED는 다릅니다. 첫째, CRED는 **반사실적 추론(Counterfactual Reasoning)**을 사용합니다. 그것은 스스로에게 "만약 내 친구가 민트를 정말 좋아하지만 초콜릿은 싫어한다면 어떨까? 그렇다면 그들은 무엇을 선택할까?"라고 묻습니다. 로봇은 머릿속으로 이러한 "만 if" 시나리오를 시뮬레이션하여, 친구가 생각할 수 있는 모든 가능성을 포괄하는 다양하고 상상적인 선택지들을 만들어냅니다. 이는 로봇이 지루하고 반복적인 질문 대신 훨씬 더 흥미로운 질문을 생성하도록 돕습니다.

둘째, CRED는 **환경 설계(Environment Design)**를 사용합니다. 만약 당신의 친구가 초콜릿은 고급스러운 그릇에 담겨 나올 때만 좋아하고, 바닐라는 평범한 컵에 담겨 나올 때 좋아한다고 가정해 봅시다. 만약 당신이 항상 평범한 컵에 담아 제공한다면, 당신은 결코 그 사람의 진정한 선호를 배울 수 없을 것입니다. CRED는 '설정'이 중요하다는 것을 깨닫습니다. 로봇은 시뮬레이션 속에서 풀밭을 자갈길로 바꾸거나 날씨를 바꾸는 등 환경을 변화시키는 것을 "상상"하며, 이것이 선택에 어떤 변화를 주는지 확인합니다. 세계 자체를 미세하게 조정함으로써, 로봇은 당신의 선호를 가장 잘 드러낼 수 있는 완벽한 시나리오를 찾아낼 수 있습니다.

연구진은 이 아이디어를 두 가지 방식으로 테스트했습니다. 첫째, 모래, 풀, 자갈과 같은 다양한 지형이 있는 디지털 그리드 월드를 사용했습니다. 둘째, 배달 경로를 시뮬레이션하기 위해 OpenStreetMaps의 실제 지도 데이터를 사용했습니다. 그들은 CRED를 무작위로 경로를 선택하거나 현재 환경에 머물러 있는 다른 최상위 방법들과 비교했습니다.

결과는 유망했습니다. 시뮬레이션에서 CRED는 다른 방법들보다 훨씬 빠르게 "진정한" 선호를 학습했습니다. 다른 로봇들이 패턴을 파악하는 데 약 25번의 시도가 필요했던 반면, CRED는 종종 단 15번의 반복만으로 수렴했습니다. 더 중요한 것은, 로봇이 한 번도 본 적 없는 완전히 새로운 환경에 놓였을 때 CRED의 학습된 규칙이 훨씬 더 잘 작동했다는 점입니다. CRED는 단순히 연습했던 도로들을 암기한 것이 아니라, 선호의 '논리'를 학습했기에 일반화할 수 있었습니다. 예를 들어, 지도 테스트에서 CRED는 기존의 가장 좋은 방법과 비교했을 때 보상 예측 오차를 엄청난 차이로 줄였으며, 어떤 경우에는 거의 완벽한 정확도를 달ей했습니다.

이 논문은 "만약 ~라면 어떨까"라는 사고방식과 세상을 재설계하는 능력을 결합함으로써, 로봇이 우리를 훨씬 더 잘 이해할 수 있다고 제안합니다. 로봇은 모든 규칙을 들을 필요가 없습니다. 우리의 선택과 우리가 사는 세상 속의 가능성을 탐구함으로써 우리의 가치를 배울 수 있습니다. 현재 방식은 이러한 시뮬레이션을 실행하기 위해 많은 컴퓨팅 파워를 필요로 하지만, 저자들은 이 접근 방식이 현실 세계에서 인간의 요구에 진정으로 적응하는 로봇을 만드는 열쇠가 될 수 있다고 믿습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →