← 최신 논문
💻 computer science

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM은 플로우 매칭(flow matching), 비대칭 혼합 트랜스포머 어텐션(asymmetric Mixture-of-Transformers attention), 그리고 접촉 게이트 가이던스(contact-gated guidance)를 활용하여 미래의 시각적 및 촉각적 변형과 행동을 공동으로 예측함으로써, 촉각 역학을 효과적으로 모델링하여 접촉이 빈번한 조작 작업에서 최첨단 성능을 달 achievements 하는 통합 시각-촉각 세계 행동 모델입니다.

원저자: Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 꽃병을 닦거나, 오이를 깎거나, 카드를 슬롯에 밀어 넣는 것과 같은 섬세한 작업을 가르친다고 상상해 보세요. 만약 로봇에게 카메라만 준다면, 그것은 마치 앞길은 보이지만 타이어 바로 밑에 있는 구덩이는 보이지 않는 선글라스를 끼고 운전하는 것과 같습니다. 로봇은 큰 그림은 보지만, 미끄러짐, 압력, 그리고 무언가가 휘어지기 시작하는 순간과 같은 촉각의 아주 작고 결정적인 디테일은 놓치게 됩니다.

이 논문은 시각과 촉각을 하나의 통합된 사고 과정으로 결합하여 이 문제를 해결하는 새로운 로봇의 "두뇌", VT-WAM을 소개합니다.

이 모델이 어떻게 작동하는지 쉬운 개념으로 나누어 설명하겠습니다.

1. 문제점: 로봇은 촉각에 대해 "눈이 멀어" 있다

현실 세계의 많은 작업은 무언가가 닿을 때 어떤 일이 일어나는지에 달려 있습니다.

  • 시각 (Sight): 배경에서 재생되는 영화와 같습니다. 지속적이고 명확하지만, 손가락이 미끄러지는 찰나의 순간이나 플러그가 걸리는 순간을 놓치기 쉽습니다.
  • 촉각 (Touch): 갑작스럽고 날카로운 알림과 같습니다. 접촉이 일어나는 짧은 순간에만 발생하지만, 로봇에게 정확히 무슨 일이 일어나고 있는지(예: "미끄러지고 있어!" 또는 "걸렸어!")를 알려줍니다.

이전의 로봇 두뇌들은 이 둘을 모두 사용하려고 시도했지만, 이를 별개로 취급했습니다. 그들은 카메라를 보고 촉각 센서를 확인했지만, 촉각의 느낌이 시간이 지남에 따라 어떻게 변하는지는 이해하지 못했습니다. 그것은 마치 노래를 듣고 있으면서 베이스 드럼 소리만 찰나의 순간 동안 들을 뿐, 멜로디는 무시하는 것과 같았습니다.

2. 해결책: "시간 여행을 하는" 두뇌

저자들은 VT-WAM(Visual-Tactile World Action Model)을 구축했습니다. 이 모델을 단순히 현재에 반응하는 것이 아니라, 자신이 보고 느끼는 것의 미래를 예측하는 로봇이라고 생각하세요.

단순히 "꽃병이 보인다"라고 말하는 대신, 다음과 같이 질문합니다:

  • "내가 손을 이렇게 움직이면, 다음 1초 동안 꽃병은 어떤 모습일까?"
  • "내가 이만큼 세게 누르면, 부드러운 스펀지의 표면이 어떻게 변형될까?"

이러한 미래의 변화를 예측함으로써, 로봇은 실제로 일어나기 전에 상호작용의 "물리 법칙"을 학습합니다.

3. 두 가지 비밀 재료

논문은 이 모델이 작동하기 위해 사용하는 두 가지 영리한 기술을 강조합니다.

A. "닻과 강물" (비대칭적 MoT 어텐션 - Asymmetric MoT Attention)

보트를 조종한다고 상상해 보세요.

  • 닻 (시각): 방 안의 어디에 있는지 알기 위해 고정된 지점이 필요합니다. 로봇은 비디오의 첫 번째 프레임(닻)을 잡아 고정합니다. 전체 비디오를 예측하려고 에너지를 낭비하지 않는데, 이는 속도가 느려지고 혼란을 줄 수 있기 때문입니다.
  • 강물 (촉각): 닻이 고정되어 있는 동안, 로봇은 흐르는 촉각 데이터의 강물을 관찰합니다. 로봇이 움직임에 따라 압력이 매 순간 어떻게 변하는지에 집중합니다.

이 설계 덕분에 로봇은 장면 속에 안정적으로 머물면서(시각), 너무 많은 데이터에 휩쓸리지 않고도 변화하는 접촉(촉각)을 매우 예민하게 인지할 수 있습니다.

B. "접촉 스위치" (AVTAG)

때때로 로봇은 카메라에 의해 주의가 분산됩니다. 로봇이 테이블을 닦고 있다면, 카메라는 테이블의 많은 부분을 보지만 촉각 센서는 마찰을 느낍니다.

  • 문제: 로봇의 두뇌는 데이터가 더 많은 카메라를 자연스럽게 선호합니다. 그래서 정작 촉각에 귀를 기울여야 할 때도 촉각 센서를 무시하게 됩니다.
  • 해결책: 저자들은 특별한 "훈련 규칙"(AVTAG라고 불림)을 추가했습니다. 이것은 마치 코치가 "이봐! 물체에 닿아 있을 때는 카메라를 보는 것을 멈추고 네 손의 감각에 집중해!"라고 외치는 것과 같습니다.
  • 이 규칙은 로봇이 접촉이 일어나는 특정 순간에 촉각을 우선시하도록 강제합니다. 이는 로봇이 상황이 까다로워질 때 자신의 손을 믿도록 가르치는 훈련 전용 스위치입니다.

4. 결과: 서투름에서 유능함으로

연구팀은 화이트보드를 닦는 것부터 좁은 소켓에 플러그를 삽입하는 것까지, 6가지 실제 작업으로 이 새로운 두뇌를 테스트했습니다.

  • 기존 방식 (Fast-WAM): 로봇은 약 **45%**의 성공률을 보였습니다. 쉬운 작업에는 괜찮았지만, 상황이 빡빡해지거나 미끄러워지면 실패했습니다.
  • VT-WAM 방식: 로봇은 **71.67%**의 성공률을 기록했습니다.

왜 이렇게 높아졌을까요?

  • 표면 작업 (닦기/깎기): 로봇은 단순히 사진을 보고 추측하는 대신, 마찰을 느끼고 압력을 조절하는 법을 배웠습니다.
  • 좁은 작업 (플러그 삽입): 플러그가 걸렸을 때, 카메라는 정렬이 어긋난 것을 보지 못할 수도 있지만, 촉각 센서는 저항을 느낍니다. VT-WAM은 그 느낌을 사용하여 플러그를 흔들어 제자리에 끼워 넣었습니다.

요약

VT-WAM은 로봇에게 "초감각"을 부여하는 것과 같습니다. 작업의 영상을 단순히 보는 대신, 자신이 보고 느끼는 것의 미래를 시뮬레이션하는 법을 배웁니다. 장면의 방향을 잡기 위한 "시각적 닻"과 촉각이 중요할 때 촉각을 우선시하는 "접촉 스위치"를 사용함으로써, 로봇은 현실 세계의 복잡하고 미끄럽고 좁은 상호작용을 훨씬 더 잘 다룰 수 있게 됩니다.

이 논문은 물체가 닿았을 때 어떻게 변형되고 변화하는지를 예측하도록 가르치는 것이 로봇을 섬세한 업무에 진정으로 유용하게 만드는 핵심이라고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →