← 최신 논문
💻 computer science

SI-Diff: A Framework for Learning Search and High-Precision Insertion with a Force-Domain Diffusion Policy

본 논문은 새로운 모드 조건부 메커니즘과 검색 교사 정책을 통합하여 강건한 검색과 고정밀 삽입을 동시에 학습하고, 기존 베이스라인 대비 정렬 허용 오차와 제로샷 전이성을 크게 향상시키는 통합 힘 영역 확산 정책 프레임워크인 SI-Diff 를 제시합니다.

원저자: Yibo Liu, Stanko Oparnica, Simon Shewchun-Jakaitis, Guoyi Fu, Jie Wang, Jun Yang, Anand Jagannathan, Tony Hong-Yau Lo

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yibo Liu, Stanko Oparnica, Simon Shewchun-Jakaitis, Guoyi Fu, Jie Wang, Jun Yang, Anand Jagannathan, Tony Hong-Yau Lo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

키를 자물쇠에 넣으려는데 두꺼운 장갑을 끼고 있고 키구멍이 잘 보이지 않는다고 상상해 보세요. 당신은 감촉으로 주변을 더듬어야 합니다. 키가 약간 중심에서 벗어나 있다면, 그냥 곧바로 밀어 넣다가 걸릴 수도 있습니다. 구멍의 정확한 위치를 안다면 완벽하게 밀어 넣을 수 있죠. 하지만 이 작업을 로봇이 해야 하고, 로봇이 구멍의 정확한 위치를 모른다면 어떨까요?

이 논문은 바로 이 문제를 해결하는 로봇용 새로운 "두뇌"인 SI-Diff를 소개합니다. 이 시스템은 동일한 지시문을 사용하여 로봇에게 두 가지 매우 다른 작업을 수행하는 법을 가르칩니다: 구멍을 찾는 것과, 구멍을 찾은 후 물체를 밀어 넣는 것입니다.

간단한 비유로 설명하면 다음과 같습니다:

1. 문제: 두 가지 다른 동작

보통 로봇은 이 두 작업을 따로따로 배우도록 훈련됩니다.

  • 탐색: 로봇이 길을 잃었을 때는 주변을 흔들며 훑어봐야 합니다 (어둠 속에서 스위치를 찾는 사람의 행동처럼).
  • 삽입: 구멍을 찾으면 매우 섬세하게 움직여야 합니다. 걸리지 않고 물체를 밀어 넣을 만큼만 살짝 흔들며 삽입해야 합니다 (바늘에 실을 꿰는 것처럼).

대부분의 로봇은 이 두 가지 작업을 수행하기 위해 "모드"를 전환하거나 다른 소프트웨어를 불러와야 합니다. 저자들은 도구 변경에 대해 생각하지 않고 구멍을 더듬어 찾은 뒤 말뚝을 밀어 넣는 인간 작업자처럼, 기어를 바꾸지 않고 둘 다 수행할 수 있는 단일 로봇 두뇌를 만들고자 했습니다.

2. 해결책: "확산 (Diffusion)" 정책

연구팀은 **확산 정책 (Diffusion Policy)**이라는 유형의 AI 를 사용했습니다.

  • 비유: 확산을 소음 섞인 무작위 점토 덩어리로 시작해 완벽한 조각상이 드러날 때까지 소음을 천천히 깎아내는 조각가의 작업이라고 생각하세요.
  • 로봇에서: 로봇은 팔을 어떻게 움직일지 무작위로 추측하는 것으로 시작합니다. AI 는 로봇의 센서 (촉각과 힘) 가 알려주는 정보에 기반해 이 추측을 단계별로 정제하여 "소음 제거 (denoising)"를 수행하며, 탐색 또는 삽입을 위한 완벽한 움직임을 찾아냅니다.

3. 핵심 비법: "모드" 전환

가장 큰 과제는 코드 변경 없이 AI 가 어떤 동작 (탐색 대 삽입) 을 해야 할지 알게 하는 것이었습니다.

  • 비유: "탐색 곡"과 "삽입 곡"을 모두 재생할 수 있는 음악 플레이어를 상상해 보세요. 보통은 두 개의 다른 플레이어가 필요합니다. SI-Diff 는 "트랙 전환" 버튼과 같은 **모드 프롬프트 (Mode Prompt)**를 사용합니다.
  • 작동 원리: 로봇은 "지금 당신은 탐색 모드입니다" 또는 "지금 당신은 삽입 모드입니다"라는 지시를 받습니다. 이 작은 지시는 AI 에게 동일한 센서 데이터를 보더라도 다르게 해석하도록 합니다. 탐색 모드에서는 "계속 찾아라"를 의미하는 패턴을 찾고, 삽입 모드에서는 "조심스럽게 흔들어서 끼워 넣으라"는 의미의 패턴을 찾습니다.

4. 교사: 스마트한 가이드로부터 학습

로봇은 전문가를 관찰하며 가장 잘 학습합니다. 저자들은 훈련 데이터를 생성하기 위해 "교사 정책 (Teacher Policy)"이라는 규칙 세트를 만들었습니다.

  • 탐색 교사: 구멍을 놓칠 수 있는 완벽한 나선형만 그리는 대신, 이 교사는 다소 혼란스럽습니다. 무작위 속도와 방향으로 여덟 가지 다른 탐색 패턴을 시도합니다. 잃어버린 물건을 찾는 한 가지 방법만 보여주는 것이 아니라, 바닥을 쓸어내는 다양한 방법을 보여줘 적응력을 기르도록 가르치는 교사와 같습니다.
  • 삽입 교사: 이 교사는 인간이 본능적으로 사용하는 기술인, 꽉 끼인 말뚝을 좁은 공간에서 흔들어서 빼내는 방법을 알고 있습니다.

로봇은 교사가 수행한 수천 건의 "성공" 시도를 관찰하며 성공의 느낌을 모방하는 법을 배웁니다.

5. 결과: "아마도"에서 "확실히"로

연구팀은 현재 가장 우수한 방법 (TacDiffusion 같은 시스템) 과 로봇을 비교 테스트했습니다.

  • 기존 방식: 말뚝이 2 밀리미터(신용카드 두께 정도) 이상 벗어나 있으면 로봇은 보통 실패했습니다. 너무 경직되어 있었기 때문입니다.
  • SI-Diff: 새로운 시스템은 최대 5 밀리미터까지의 오정렬을 처리할 수 있었습니다. 실수에 훨씬 더 관대했습니다.
  • 제로샷 (Zero-Shot) 마법: 로봇은 정사각형 블록으로만 훈련되었음에도 불구하고, 원통, 삼각형, 심지어 USB 커넥터와 같은 보지 못한 모양을 성공적으로 삽입할 수 있었습니다. 이는 특정 블록의 모양이 아니라 탐색과 삽입의 개념을 배웠기 때문입니다.

요약

SI-Diff는 단일 AI 모델을 사용하여 구멍을 찾아내고 물체를 그 안으로 밀어 넣는 로봇 제어 시스템입니다. "모드 전환"을 사용하고 다양한 "교사" 시연으로부터 학습함으로써, 로봇이 더 견고해지도록 합니다. 이를 통해 로봇은 더 큰 실수를 처리하고 이전에 본 적이 없는 모양과 작업할 수 있으며, 소프트웨어를 전환하거나 스스로 재프로그래밍할 필요가 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →