← 최신 논문
💻 computer science

Mind the Context: Continual Learning of Socially Appropriate Robot Actions via Environmental-Social Disentanglement

이 논문은 명시적 분리 이중 분기(Explicit Disentanglement Dual-Branch, EDD) 프레임워크를 소개하며, 이는 환경적 단서와 사회적 단서를 명시적으로 분리하여 치명적 망각을 완화함으로써 사회적 로봇이 다양한 환경에 걸쳐 문맥에 적절한 행동을 지속적으로 학습할 수 있도록 한다.

원저자: Rafal Robert Karpinski, Fethiye Irmak Dogan, Nikhil Churamani, Yiming Luo, Maartje M. A. de Graaf, Davide Dell'Anna, Hatice Gunes

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rafal Robert Karpinski, Fethiye Irmak Dogan, Nikhil Churamani, Yiming Luo, Maartje M. A. de Graaf, Davide Dell'Anna, Hatice Gunes

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 방 안으로 걸어 들어가는 장면을 상상해 보세요. 인간에게 이 방은 하나의 이야기를 들려줍니다. 이곳이 파티가 열리고 있는 북적이는 거실인지, 아니면 진지한 회의가 진행 중인 조용한 사무실인지 말이죠. 시끄러운 대화를 시작하거나 바닥 청소를 하는 것과 같은 동일한 행동도, 첫 번째 방에서는 완벽하게 예의 바른 행동일 수 있지만 두 번째 방에서는 완전히 재앙이 될 수 있습니다. 이것이 바로 기계가 인간 행동의 불문율을 배우려고 노력하는 **사회적 로보틱스(social robotics)**의 세계입니다. 하지만 여기 까다로운 문제가 있습니다. 로봇에게는 앞으로 방문할 수 있는 모든 가능한 방의 모든 규칙을 일일이 프로그래ミング해 줄 수 없다는 점입니다. 대신, 로봇에게는 **지속 학습(Continual Learning)**이 필요합니다. 이것은 마치 새로운 학교를 계속 다니는 학생과 같습니다. 그들은 이전 학교에서 배웠던 규칙을 잊지 않으면서도, 새로운 학교의 식당이나 체육관의 규칙을 배워야 합니다. 만약 규칙을 잊어버린다면, 그것은 '파괴적 망각(catastrophic forgetting)'이라 불리며, 로봇은 혼란에 빠지고 무례해질 것입니다.

연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 로봇이 자신이 '어디에 있는지'(환경)와 '누가 거기에 있는지'(사회적 군중)가 어떻게 함께 작용하여 예의를 결정하는지 이해하도록 가르칠 수 있을까요? 보통 로봇은 방 전체의 모습을 보고 규칙을 추측하려고 합니다. 하지만 저자들은 그것이 마치 안개가 낀 안경을 쓰고 퍼즐을 맞추려는 것과 같다고 제안합니다. 연구진은 더 똑똑한 방법을 제안합니다. 로봇에게 '배경'(가구, 벽)과 '사람'(군중, 그들의 위치)을 분리하여 학습시키고, 이 조각들을 다시 합치기 전에 각각 따로 학습시키는 것입니다.


"맥락을 주의하라" 실험 (The "Mind the Context" Experiment)

이 연구에서 연구진은 EDD(Explicit Disentanglement Dual-Branch, 명시적 분리 이중 분기)라고 불리는 새로운 학습 시스템을 구축했습니다. 두 종류의 안경을 쓴 로봇을 상상해 보세요. 한 쌍의 안경인 "환경 렌즈(Environmental Lens)"는 사람들을 흐릿하게 처리하여 로봇이 음식을 차릴 테이블이 있는지 또는 청소할 지저한 바닥이 있는지와 같이 순수하게 방의 구조에 집중할 수 있게 합니다. 다른 한 쌍의 안경인 "사회적 렌즈(Social Lens)"는 가구나 벽을 흐릿하게 만들어, 로봇이 사람들이 어디에 서 있고 서로 얼마나 가까이 있는지를 볼 수 있도록 사람들의 실루엣만을 남깁니다.

로봇은 이 두 가지 별도의 뷰를 사용하여 학습합니다. 로봇은 이 뷰들을 독립적으로 처리하는 두 개의 "두뇌"(또는 분기)를 가지고 있으며, 그 후 이들의 생각을 결합하여 "여기서 대화를 시작해도 괜찮을까?" 또는 "지금 청소기를 돌려야 할까?"를 결정합니다. 로봇이 거실에서 배운 것을 사무실로 이동했을 때 잊어버리지 않도록, 팀은 "리플레이 버퍼(replay buffer)"를 사용했습니다. 이것은 로봇이 새로운 방을 배우는 동안 연습할 수 있도록 예전 방의 스냅샷 몇 장을 보관하는 디지털 스첩북과 같으며, 이를 통해 로봇이 혼란에 빠지는 것을 방지합니다.

연구 결과

연구팀은 이 시스템을 아늑한 집부터 회의실, 복도, 넓은 개방형 사무실 등 다양한 유형의 사무 공간에 이르기까지 6가지의 서로 다른 실내 환경에서 테스트했습니다. 그들은 이 "두 개의 렌즈"를 가진 로봇을 전체 이미지를 한 번에 보는 방식이나, 훈련 없이 사회적 규칙을 추측하려는 매우 고급 AI 모델(소위 "제로샷(zero-shot)" 모델)을 포함한 다른 방법들과 비교했습니다.

결과는 매우 명확했습니다. 분리된 렌즈와 스크랩북을 가진 EDD 로봇이 인간이 예의 바르다고 간주하는 행동을 예측하는 데 가장 뛰어났습니다. 이 로봇은 오류율이 더 낮았으며(0.783, 다른 방법들의 경우 1.2 또는 2.0 이상), 그 예측은 인간의 의견과 훨씬 더 밀접하게 일치했습니다.

연구진은 또한 "사람"과 "방"을 나누는 다양한 방식을 테스트했습니다. 그들은 바운딩 박스(사람 주변에 상자를 그려 그 밖의 영역을 숨기는 방식)를 사용하는 것이 단순히 윤곽선(실루엣)을 사용하거나 로봇을 중심으로 줌인하는 것보다 약간 더 효과적이라는 것을 발견했습니다. 이는 사람들을 "환경" 뷰로부터 명확하게 숨기는 것이 로봇이 방의 규칙을 더 잘 이해하도록 돕는다는 것을 시사합니다.

흥미롭게도, 로봇이 방문한 방의 순서는 그리 중요하지 않았습니다. 단순한 복도에서 복잡한 거실으로 이동했든, 혹은 그 반대였든, 로봇은 양방향 모두에서 잘 학습했습니다. 이는 이 시스템이 매우 견고하며 새로운 경험의 순서에 의해 쉽게 혼란에 빠지지 않는다는 것을 보여줍니다.

시사점

이 논서는 로봇이 변화하는 세상에서 진정으로 예의 바르게 행동하기 위해서는 장면을 하나의 크고 엉망인 덩어리로 보는 것을 멈춰야 한다고 제안합니다. 대신, 그들은 "어디"와 "누구"를 능동적으로 분리해야 합니다. 환경과 사회적 군중을 두 가지 서로 다른 것으로 이해하도록 명시적으로 가르치고, 그 지식을 결합함으로써 로봇은 더 빨리 배우고 덜 잊어버리게 됩니다. 비록 이것이 실제 영상이 아닌 합성 이미지(컴퓨터 생성 장면)를 대상으로 테스트되었지만, 결과는 이러한 "분리(disentanglement)" 전략이 로봇이 매너를 잃지 않고 새로운 사회적 상황에 적응할 수 있는 유망한 경로임을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →