← 최신 논문
💻 computer science

GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning

GuidedAttention은 사용자가 롤아웃 초기화 단계에서 작업 관련 시각적 주의 핵심 지점(keypoints)을 검사하고 수정할 수 있도록 허용함으로써 로봇 조작의 분포 외(out-of-distribution) 강건성을 향상시키는 해석 가능한 모방 학습 프레임워크로, 수정된 지점들은 실행 전반에 걸쳐 자동으로 전파되어 디퓨전 기반 액션 정책을 가이드합니다.

원저자: Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai, Tomohiro Motoda, Hanbit Oh, Ryo Hanai, Yukiyasu Domae

게시일 2026-07-27
📖 7 분 읽기🧠 심층 분석

원저자: Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai, Tomohiro Motoda, Hanbit Oh, Ryo Hanai, Yukiyasu Domae

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 컵을 집거나 수건을 접는 것과 같은 작업을 가르치는 상황을 상상해 보세요. 과거에는 엔지니어들이 로봇의 팔이 어떻게 움직여야 하는지, 어디를 보아야 하는지, 무엇을 잡아야 하는지를 정확히 알려주기 위해 수천 줄의 코드를 작성해야 했습니다. 이는 마치 아이에게 엄격한 대본을 주는 것과 같아서, 만약 대본이 실제 세상과 완벽하게 일치하지 않으면 아이는 얼어붙어 버리곤 했습니다. 오늘날 우리는 "모방 학습(Imitation Learning)"이라는 더 스마트한 접근 방식을 사용합니다. 규칙을 쓰는 대신, 인간이 작업을 수행하는 영상을 로봇에게 보여주면 로봇은 그 패턴을 관찰하며 배우려고 노력합니다. 이는 마치 형이나 누나가 자전거 타는 것을 보고 따라 배우는 아이와 같습니다.

하지만 함정이 있습니다. 로봇이 이런 방식으로 학습할 때, 로봇은 "블랙박스" 뇌를 구축하게 됩니다. 로봇은 카메라를 통해 세상을 보지만, 우리는 로봇이 실제로 무엇을 보고 있는지 알 수 없습니다. 만약 로봇이 실패한다면, "이봐, 엉뚱한 곳을 보고 있잖아!"라고 쉽게 말할 수 없습니다. 왜냐하면 로봇의 주의력(attention)은 복잡한 수학 안에 숨겨져 있기 때문입니다. 이는 상황이 변할 때 큰 문제가 됩니다. 만약 컵을 새로운 위치로 옮기거나 테이블 위에 화려한 패턴을 놓으면, 로봇은 특정 설정에 맞춰 훈련되었기 때문에 혼란에 빠져 실패할 수 있습니다. 이는 마치 시험 문제를 외웠던 학생이 선생님이 문제 순서를 바꾸자 당황하는 것과 같습니다. 우리는 로봇의 마음속을 들여다보고 "아니, 배경이 아니라 컵을 봐!"라고 말할 수 있는 방법이 필요합니다.

여기서 GuidedAttention이라는 새로운 프레임워크가 등장합니다. 이것을 로봇에게 어디에 집중하고 있는지 보여주는 "마법 안경"을 주는 것이라고 생각해보세요. 이 연구를 진행한 무로오카 마사키(Masaki Murooka)와 그의 팀은 단순히 무엇을 할지 추측하는 것이 아니라, 먼저 교과서의 핵심 단어에 형광펜을 칠하는 학생처럼 이미지의 중요한 부분들을 지목하는 시스템을 만들었습니다. 만약 로봇이 엉뚱한 곳을 강조한다면, 인간이 개입하여 올바른 지점을 클릭하고 "여기를 봐!"라고 말할 수 있습니다. 그러면 로봇은 그 수정된 지점을 나머지 작업의 가이드로 삼아, 로봇이 움직이는 동안 자동으로 그것을 추적합니다.

이 논문은 이 아이디어를 두 가지 방식, 즉 컴퓨터 시뮬레이션 내부와 실제 로봇 팔을 이용한 실제 환경에서 테스트했습니다. 연구 결과, 로봇이 익숙한 환경에 있을 때는 스스로 꽤 잘 해낸다는 것을 발견했습니다. 하지만 목표물을 새로운 위치로 옮기거나 테이블에 눈에 띄는 색상의 블록을 배치하는 등 상황이 이상해지면 로봇은 보통 길을 잃습니다. 바로 이때 "마법 안경"이 빛을 발합니다. 작업 시작 시점에 인간이 주의력을 살짝 교정해주면, 로봇의 성공률은 극적으로 높아집니다. 몇몇 까다로운 실제 테스트에서, 시작 단계에서 주의력을 고쳐준 것은 로봇이 스스로 해결해야 했을 때보다 성공률을 약 80% 더 높여주었습니다. 로봇에게 어디를 봐야 하는지에 대한 간단하고 수정 가능한 힌트를 주는 것이, 변화무쌍하고 어지러운 세상을 견딜 수 있게 만드는 비결임이 밝혀졌습니다.

문제점: 로봇의 "블랙박스" 뇌

당신이 로봇에게 신발 끈을 묶는 법을 가르치고 있다고 상상해 보세요. 당신은 영상을 보여주고, 로봇은 당신의 움직임을 복제하며 배웁니다. 하지만 문제는 이렇습니다. 로봇은 당신처럼 신발을 "보는" 것이 아닙니다. 로봇은 픽셀의 덩어리를 봅니다. 현대의 로봇 학습에서는 **엔드 투 엔드 정책(End-to-End policies)**이라는 것을 사용합니다. 이는 로봇이 이미지를 입력받아 움직임을 출력값으로 내뱉으며, 인간이 중간 단계에서 설명할 수 있는 모든 과정을 건너뛰는 것을 의미합니다.

문제는 이 과정이 "블랙박스"라는 점입니다. 우리는 로봇이 무엇에 주의를 기울이고 있는지 알 수 없습니다. 만약 로봇이 신발 끈을 묶는 데 실패한다면, 로봇이 끈을 보고 있었는지, 바닥을 보고 있었는지, 아니면 그림자를 보고 있었는지 쉽게 알 수 없습니다. 이는 자동차 보닛 안을 볼 수 없는 상태에서 엔진을 고치려는 것과 같습니다. 설상가상으로, 만약 테이블 위의 신발 위치를 바꾼다면(이를 분포 외(Out-of-Distribution, OOD) 상황이라고 합니다), 로봇은 신발이 특정 위치에 있다는 조건으로 훈련되었기 때문에 완전히 혼란에 빠질 수 있습니다. 이는 수학 문제의 답이 "5"라는 것을 외웠던 학생이 숫자가 바뀌자 당황하는 것과 같습니다. 개념을 배운 것이 아니라 특정 예시만을 외웠기 때문입니다.

해결책: GuidedAttention (마법 안경)

저자들은 GuidedAttention이라는 해결책을 제안합니다. 로봇이 무엇을 볼지 추측하게 두는 대신, 로봇이 키포인트(keypoints), 즉 이미지의 중요한 부분을 표시하는 작은 점들을 예측하도록 강제합니다. 이 키포인트를 보물 지도라고 생각해보세요. 로봇은 잡아야 할 지점(예: 밧줄의 끝)과 목표물(예: 통과해야 할 구멍)에 각각 "X" 표시를 그려야 합니다.

놀라운 점은 이 "X" 표시들이 우리에게 보인다는 것입니다. 이것은 **해석 가능한 중간 표현(interpretable intermediate representation)**입니다. 즉, 우리는 로봇이 무엇을 중요하게 생각하는지 정확히 볼 수 있습니다. 만약 로봇이 엉뚱한 곳에 "X"를 그린다면, 인간이 개입하여 "X"를 올바른 위치로 옮길 수 있습니다. 이것이 수정 가능한(correctable) 부분입니다.

인간이 작업의 아주 초기에 이 "X"를 수정하면, 로봇은 더 이상 도움이 필요하지 않습니다. 로봇은 추적 모듈(tracking module)(움직이는 물체를 따라가는 스마트 카메라와 같은 역할)을 사용하여 로봇이 움직이는 동안 그 "X"들을 올바른 지점에 계속 고정시킵니다. 이는 로봇에게 "여기를 봐!"라고 적힌 포스트잇을 붙여주고, 친구가 게임 내내 레이저 포인터로 그 포스트잇을 따라가게 하는 것과 같습니다.

작동 원리: 로봇의 새로운 뇌

이 시스템은 **확산 정책(Diffusion Policy)**이라는 유형의 AI를 사용합니다. 이를 "노이즈 제거(denoising)"를 통해 배우는 로봇이라고 생각할 수 있습니다. 노이즈로 뒤덮인 사진을 상상해 보세요. 로봇의 임무는 노이즈를 천천히 제거하여 올바른 움직임을 드러내는 것입니다. 보통 로봇은 전체적으로 흐릿한 사진을 바탕으로 움직임을 추측하려고 합니다.

이 새로운 시스템에서 로봇은 먼저 키포인트("X" 표시)를 예측합니다. 그런 다음, 그 "X"들을 사용하여 노이즈 제거 과정을 안내합니다. 이는 로봇에게 "지저식한 배경은 무시하고, 이 두 점 주변의 영역에만 집중해!"라고 말하는 것과 같습니다.

논문은 **키포인트 오버라이드 메커니즘(Keypoint Override Mechanism)**이라는 영리한 기술을 소개합니다.

  1. 훈련: 로봇은 인간이 작업을 수행하는 것을 관찰하며 점들을 예측하는 법을 배웁니다. 인간은 영상의 맨 첫 프레임에서만 점들을 표시하며, 컴퓨터 프로그램이 나머지 영상 동안 이 점들을 추적합니다.
  2. 롤아웃(실제 작업): 로봇이 스스로 작업을 수행할 때, 로봇은 점들을 예측합니다. 로봇이 잘 하고 있다면 좋습니다! 하지만 로봇이 혼란스러울 때(예: 테이블이 달라졌을 때), 인간은 시작 단계에서 단 한 번 클릭하여 점들을 수정할 수 있습니다.
  3. 마법: 시스템에는 "수정된" 점들이 여전히 로봇의 뇌에 유효하도록 만드는 특별한 수학적 트릭이 있습니다. 단순히 점을 바꾸는 것이 아니라, 점의 의미를 바꾸어 로봇이 그 수정을 완벽하게 이해하도록 합니다.

결과: 실제로 효과가 있는가?

연구팀은 두 곳에서 테스트를 진행했습니다: 컴퓨터 시뮬레이션(가상 세계)과 실제 로봇 팔(Universal Robots UR5e)을 이용한 실제 환경입니다.

시뮬레이션에서:
그들은 세 가지 까다로운 작업을 테스트했습니다:

  • 케이블(Cable): 유연한 케이블을 좁은 틈 사이로 통과시키기.
  • 링(Ring): 기둥에 링을 끼우기.
  • 입자(Particle): 작은 입자들을 상자로 퍼 담기.

그들은 목표물을 새로운 위치로 옮기거나(위치 OOD/Positional OOD), 테이블의 질감을 화려한 패턴으로 바꾸어(외형 OOD/Appearance OOD) 작업을 더 어렵게 만들었습니다.

  • 도움 없이: 표준 로봇(베이스라인)들은 상황이 변할 때 많이 실패했습니다. 예를 들어, "외형 OOD"(화려한 패턴) 테스트에서 표준 로봇의 성공률은 약 **28.9%**에 불과했습니다.
  • GuidedAttention (자율 모드): GuidedAttention을 사용한 로봇은 더 나은 성능을 보였으며, 약 **45.6%**의 성공률을 기록했습니다.
  • GuidedAttention (인간 수정): 인간이 시작 단계에서 점들을 수정해주었을 때, 성공률은 **67.8%**로 급증했습니다! 이는 엄청난 향상입니다.

실제 환경에서:
그들은 컵을 다른 컵에 넣기, 체인을 집기, 수건 접기 등의 작업으로 실제 로봇을 테스트했습니다.

  • 위치 OOD (목표물 이동): 표준 로봇들은 어려움을 겪었으며, DP 베이스라인은 **35.6%**의 성공률만을 보였습니다. GuidedAttention은 도움 없이도 더 나은 성과를 냈습니다. 하지만 시작 시 단 한 번의 인간 수정이 더해지자 성공률은 **71.1%**로 치솟았습니다.
  • 외형 OOD (지저분한 테이블): 이것이 가장 어려운 테스트였습니다. 표준 로봇은 수건 작업에서 **0%**의 성공률을 기록하며 크게 실패했습니다. 도움 없는 GuidedAttention 역시 **13.3%**의 성공률에 그치며 고전했습니다. 하지만 인간의 수정이 더해지자 로봇은 **90%**의 성공률을 달성했습니다!

이것이 왜 중요한가

이 논문은 우리가 모든 것을 아는 로봇을 만들 필요는 없다는 것을 보여줍니다. 대신, 우리는 로봇이 어떻게 보는지를 알게 할 수 있고, 로봇이 혼란스러울 때 약간의 도움을 줄 수 있습니다.

저자들은 가장 큰 이득이 로봇이 새로운 환경이나 지저분한 환경에 처했을 때 발생한다는 것을 발견했습니다. 익숙한 환경에서는 로봇이 이미 괜찮았습니다. 하지만 세상이 변했을 때, "아니, 배경이 아니라 컵을 봐"라고 말할 수 있는 능력은 결정적인 역할을 했습니다.

또한 논문은 다른 아이디어들을 검토했습니다. 화면에 상자나 점을 표시하여 어디를 봐야 할지 알려주는 방식("마커 오버레이 프롬프팅")을 시도했지만, 효과가 좋지 않았습니다. 로봇은 패턴을 배울 수 있도록 스스로 점을 예측해야 하며, 동시에 잘못되었을 때 수정될 수 있어야 합니다.

한계점

저자들은 시스템의 한계에 대해서도 솔직하게 밝히고 있습니다.

  • 단순한 키포인트: 이 시스템은 몇 개의 점이 전체 작업을 설명하기에 충분하다고 가정합니다. 만약 열 개의 공을 저글링하는 것처럼 매우 복적인 작업이라면, 몇 개의 점만으로는 부족할 수 있습니다.
  • 2D 전용: 점들은 평면적인 이미지 위에 있습니다. 만약 로봇이 깊이를 알아야 하거나 점이 물체 뒤로 숨겨진다면, 시스템이 혼란을 겪을 수 있습니다.
  • 추적 문제: 시스템은 점들을 추적하는 데 의존합니다. 만약 로봇이 너무 빠르게 움직이거나 물체가 오랫동안 가려지면, 추적기가 점을 놓칠 수 있습니다.

결론

GuidedAttention은 로봇에게 그들이 무엇을 생각하는지 보여주는 안경을 주는 것과 같습니다. 이는 로봇의 "블랙박스" 뇌와 인간의 가이드 능력 사이의 간극을 메워줍니다. 시작 단계에서 단 한 번의 수정을 허용함으로써, 로봇은 이전보다 훨씬 더 지저분하고 변화무쌍한 환경을 잘 다룰 수 있게 되었습니다. 이것이 모든 것을 해결하는 마법 지팡이는 아닐지라도, 학습할 줄 알면서도 막혔을 때 우리의 말을 들을 수 있는 유연함을 갖춘 로봇을 향한 강력한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →