← 최신 논문
💻 computer science

VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

이 논문은 인간-사물 상호작용(HOI) 비디오를 통해 동적인 맥락을 학습함으로써, 멀티모달 거대 언어 모델(MLLM)을 활용해 3D 객체의 행동 가능 영역(affordance)을 정밀하게 찾아내는 새로운 데이터셋(VIDA)과 모델(VideoAfford)을 제안합니다.

원저자: Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai, Zhiyuan Ma, Hui Xiong

게시일 2026-02-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai, Zhiyuan Ma, Hui Xiong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🤖 제목: "로봇에게 '눈'과 '경험'을 선물하다: 비디오로 배우는 물체 사용법"

1. 기존의 문제점: "사진만 보고 배우는 로봇의 한계"

지금까지 로봇들은 물체의 사용법을 배울 때 주로 **'정지된 사진'**이나 **'글자 설명'**을 보고 공부했습니다.

이건 마치 우리가 요리책의 사진 한 장만 보고 요리를 배우려는 것과 같아요. 사진 속의 재료는 보이지만, 칼을 어떤 속도로 움직여야 하는지, 프라이팬을 어떻게 흔들어야 하는지 같은 **'역동적인 움직임(Dynamic)'**을 알 수 없죠. 그래서 로봇은 물체를 보고 "저건 컵이네?"라고는 알지만, "어디를 어떻게 잡아야 가장 안정적이지?"라는 질문에는 엉뚱한 대답을 하곤 했습니다.

2. 이 논문의 해결책: "유튜브 영상으로 배우는 '진짜' 사용법"

연구팀은 로봇에게 사진 대신 **'사람이 물체를 사용하는 영상(HOI Video)'**을 보여주기로 했습니다.

사람이 컵을 잡는 모습, 망치를 휘두르는 모습, 문을 여는 모습이 담긴 수만 개의 영상을 로봇에게 보여주는 거죠. 이건 마치 요리 사진 대신, 수만 개의 '쿠킹 유튜브 영상'을 보며 요리 기술을 익히는 것과 같습니다. 영상에는 물체의 어느 부분을 만지는지, 어떤 힘을 주는지에 대한 '비밀(Interaction Priors)'이 다 들어있거든요.

3. 핵심 기술: "VideoAfford" (로봇의 똑똑한 뇌와 눈)

연구팀은 이 과정을 위해 세 가지 특별한 도구를 만들었습니다.

  • 첫째, VIDA (거대한 학습 교과서): 3만 8천 개의 영상과 2만 2천 개의 3D 모델로 구성된, 로봇을 위한 '세상에서 가장 큰 행동 교과서'를 만들었습니다.
  • 둘째, 액션 인코더 (움직임 감지기): 영상 속 사람의 손동작이 '잡기'인지 '밀기'인지 그 **'리듬과 흐름'**을 읽어내는 기술입니다. (마치 춤 동작의 흐름을 읽는 것과 같죠!)
  • 셋째, 공간 인식 손실 함수 (공간 감각 교정기): 로봇이 물체의 특정 부분을 잡으라고 할 때, 점을 콕콕 찍는 게 아니라 '매끄럽고 덩어리감 있게' 영역을 지정하도록 가르칩니다. (마치 색칠 공부를 할 때 선 밖으로 나가지 않고 예쁘게 칠하도록 가르치는 것과 같습니다.)

4. 결과: "처음 보는 물체도 척척!"

이 기술을 적용한 로봇(VideoAfford)은 기존 방식보다 훨씬 뛰어난 성적을 거두었습니다. 특히 놀라운 점은 **'한 번도 본 적 없는 물체'**가 나타나도, 영상에서 배운 '움직임의 원리'를 응용해서 "아, 이건 이렇게 잡으면 되겠구나!"라고 스스로 추론해낸다는 것입니다.


💡 요약하자면?

  • 과거: "사진(정지 화면) 보고 공부하는 로봇" \rightarrow "어디를 잡아야 할지 잘 모름"
  • 현재(이 논문): "유튜브 영상(역동적 움직임) 보고 공부하는 로봇" \rightarrow "물체의 쓰임새와 잡는 위치를 완벽하게 이해함"

이 연구 덕분에 미래의 로봇은 우리 옆에서 마치 숙련된 요리사나 도우미처럼, 물체를 훨씬 더 자연스럽고 정확하게 다룰 수 있게 될 것입니다! 🚀

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →