← 최신 논문
💻 computer science

Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections

이 논문은 분포 변화와 노이즈가 있는 데이터에 더 강건한 디퓨전 정책을 학습시키기 위해, 쌍을 이룬 인간의 교정 액션-청크와 로봇의 원치 않는 액션-청크에 대한 대조 학습을 활용하는 새로운 프레임워크인 Set-Supervised Diffusion Policy (SDP)를 제안한다.

원저자: Zhaoting Li, Gang Chen, Javier Alonso-Mora, Cosimo Della Santina, Jens Kober

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhaoting Li, Gang Chen, Javier Alonso-Mora, Cosimo Della Santina, Jens Kober

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 가구 조립이나 블록을 특정 위치로 밀어 넣는 것과 같은 섬세한 작업을 가르치고 있다고 상상해 보세요. 당신은 스승 역할을 하고, 로봇은 학생 역할을 합니다.

문제점: "완벽한 복사꾼"의 함정

전통적으로 로봇을 가르칠 때, 우리는 **행동 클로닝(Behavior Cloning)**이라는 방법을 사용합니다. 이것은 마치 학생이 선생님의 글씨체를 완벽하게 베끼려고 노력하는 것과 같습니다. 만약 선생님이 손을 떨어서 숫자 "5"를 약간 "6"처럼 보이게 썼다면, 로봇은 그 떨리는 "6"을 똑같이 복사하려고 노력합니다.

로봇 공학의 세계에서 이것은 큰 문제입니다.

  1. 경로 이탈: 로봇이 아주 작은 실수 하나를 하면, 로봇은 선생님이 보여준 적 없는 새로운 상황에 처하게 됩니다. 그러면 로봇은 당황하고 더 큰 실수를 저지릅니다.
  2. "아니오"를 무시함: 로봇이 실수를 하면, 당신(인간)이 개입하여 이를 바로잡습니다. 당신은 로봇에게 올바른 움직임을 보여줍니다. 하지만 표준적인 학습 방법은 당신의 '올바른' 움직임만을 봅니다. 로봇이 방금 저지른 '잘못된' 움직임은 완전히 무시합니다. 이는 마치 선생님이 "그걸 고쳐낸 건 잘했어"라고 말하면서도, 원래의 시도가 왜 나빴는지에 대해서는 전혀 설명하지 않는 것과 같습니다. 로봇은 계속해서 "완벽한" 동작을 복사하려고만 할 뿐, 무엇을 피해야 하는지는 배우지 못합니다.

해결책: "안전 구역" (Set-Supervised Diffusion Policy)

이 논문의 저자인 자오팅 리(Zhaoting Li)와 동료들은 **Set-Supervised Diffusion Policy (SDP)**라는 새로운 학습 방식을 제안합니다.

로봇에게 "정확히 이 하나의 움직임을 해라"라고 말하는 대신, "이 안전 구역 안에서는 무엇이든 해도 좋다"라고 말하는 것입니다.

작동 방식은 다음과 같은 간단한 비유를 통해 이해할 수 있습니다.

1. "레드 존"과 "그린 존"

로봇이 자동차를 주차하려고 한다고 상상해 보세요.

  • 로봇의 실수 (부정적 행동): 로봇이 왼쪽으로 너무 치우쳐서 주차하려고 합니다. 결국 연석에 부딪힙니다.
  • 당신의 교정 (긍정적 행동): 당신이 핸들을 잡고 차를 중앙으로 조향합니다.

기존 방식에서 로봇은 "중앙으로 조향하라"는 것을 암기합니다.
하지만 SDP에서 로봇은 안전 구역을 학습합니다. 로봇은 다음과 같이 이해합니다: "알았어, 연석에 부딪히는 것(왼쪽)은 나빠. 중앙은 좋아. 그러니 연석에 부딪히지만 않는다면 중간 영역 어디에든 주차해도 괜찮아."

이 "안전 구역"을 **원하는 행동 집합(Desired Action Set)**이라고 부릅니다. 이는 로봇에게 유연성을 부여합니다. 로봇은 완벽한 복사꾼이 될 필요가 없습니다. 그저 규칙이 정해진 구역 안에 머물기만 하면 됩니다.

2. "디퓨전(Diffusion)"의 마법

로봇은 어떻게 이 구역 안에 머무는 법을 배울까요? 그들은 **디퓨전(Diffusion)**이라는 기술을 사용합니다.
디퓨전을 조각가가 점토로 작업하는 것에 비유해 보겠습니다.

  • 시작점: 로봇은 무작위의 엉망인 점토 덩어리(무작위 노이즈)에서 시작합니다.
  • 과정: 단계별로 로봇은 점토를 "디노이징(denoise, 노이즈 제거)"하며, 나쁜 부분을 깎아내고 모양을 잡아갑니다.
  • 반전: SDP에서 로봇이 점토를 모양 잡을 때, 다음과 같은 규칙이 있습니다: "만약 점토를 만드는 모양이 연석에 부딪히는 모양(부정적 행동)이 되기 시작하면, 멈추고 다시 안전 구역 안으로 밀어 넣어라."

이 과정을 **반사 디퓨전(Reflected Diffusion)**이라고 합니다. 이것은 방 안에서 튀어 오르는 공과 같습니다. 공이 벽(나쁜 영역의 경계)에 부딪히면, 다시 방 안(좋은 영역)으로 튕겨져 들어옵니다. 이는 로봇이 설령 당신과 똑같은 움직임을 하지 않더라도, 항상 안전하고 수용 가능한 움직임을 생성하도록 보장합니다.

3. 실수로부터 배우기 (대조 데이터)

SDP의 핵심 혁신은 로봇의 실수와 당신의 교정을 함께 사용한다는 점입니다.

  • 기존 방식: "여기 올바른 움직임이 있어. 이걸 복사해."
  • SDP 방식: "여기 잘못된 움직임(이건 하지 마)이 있고, 여기 올-바른 움직임(이건 해)이 있어. 네 목표는 잘못된 것보다 더 낫고, 올바른 것에 가까운 '어떠한' 움직임을 찾아내는 거야."

무엇을 하지 말아야 하는지를 배움으로써, 로봇은 훨씬 더 견고해집니다. 만약 당신의 교정이 약간 흔들리거나 노이즈가 섞여 있었더라도, 로봇은 당황하지 않습니다. 로봇은 단지 "알았어, 나는 이 일반적인 영역 안에 머물러야 해"라고 이해할 뿐, 흔들리는 손을 똑같이 복사하려고 애쓰지 않습니다.

연구 결과는 어떠했나요?

연구진은 로봇이 물체를 밀거나 가구를 조립하는 등의 작업을 수행하도록 테스트했습니다.

  • 노이즈 처리에 탁월함: 인간 교사가 실수를 하거나 데이터가 "노이즈가 심할(흔들릴)" 때, SDP 로봇은 여전히 잘 작동했습니다. 기존의 "복사꾼" 로봇들은 실수를 그대로 복사하려 했기 때문에 실패했습니다.
  • 데이터 수집의 효율성: SDP 로봇은 단순히 교사를 복사하는 것이 아니라 "안전 구역" 내에서 탐색할 수 있기 때문에, 더 다양한 경험을 수집합니다. 이는 미래의 학습을 위한 더 나은 "교과서"를 만들어냅니다.
  • 실제 환경에서의 성공: 연구진은 시뮬레이션뿐만 아니라 실제 로봇을 사용하여 T자형 물체를 구멍에 끼워 넣는 등의 작업을 테스트했습니다. SDP 로봇은 특히 가장 어려운 버전의 과제에서 표준 로봇보다 더 높은 성공률을 보였습니다.

요약

요약하자면, SDP는 로봇을 가르치는 방식을 "내 손의 움직임을 똑같이 따라 해"에서 "이 안전한 영역 안에 머물고 나쁜 것은 피해"로 바꿉니다. 로봇의 실수를 경계선으로 사용하고 인간의 교정을 가이드로 삼음으로써, 로봇은 더 유연하고, 더 견고하며, 상황이 엉망이 되어도 실패할 확률이 낮아집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →