← 최신 논문
💻 computer science

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

본 논문은 전진-역모델링에서 영감을 받아 목표 후보 생성과 구조화된 선택으로 작업을 분해함으로써 환각을 크게 줄이고 인간 수준의 성능을 달성하는 최첨단 오픈-보카불러리 인간 의도 인식을 실현하는 새로운 2 단계 비디오-언어 프레임워크인 IntentVLM 을 소개합니다.

원저자: Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구가 부엌에 있는 모습을 상상해 보세요. 친구가 냉장고 문을 열고 우유 한 팩을 꺼낸 뒤 커피 머신 쪽으로 걸어가는 것을 봅니다.

일반적인 로봇은 단순히 "사람이 우유를 들고 있다"거나 "사람이 커피 머신 근처에 있다"고 말할 뿐입니다. 하지만 진정으로 도움이 되는 로봇은 그들이 왜 이런 행동을 하는지 이유를 이해해야 합니다. 친구가 커피를 만들고 있는 걸까요? 아니면 우유가 있는지 확인하려는 걸까요? 아니면 손님을 위해 컵에 우유를 따르려는 것일까요?

이 논문은 바로 이 문제를 해결하기 위해 고안된 로봇용 새로운 "두뇌"인 IntentVLM을 소개합니다. 이 기술은 로봇이 인간이 무엇을 계획하고 있는지를 파악하도록 도와주며, 로봇에게 미리 정해진 답변 목록을 가르쳐 주지 않아도 됩니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다.

문제: "객관식"의 함정

대부분의 현재 로봇은 교사가 다섯 가지 옵션만 제시하는 객관식 시험을 치르는 학생과 같습니다. 정답이 목록에 없으면 로봇은 막히거나 틀린 추측을 합니다.

  • 옛 방식: 로봇이 우유와 커피를 보고 "A) 커피 만들기, B) 차 만들기, C) 정리하기" 같은 고정된 목록에서 선택해야 합니다. 만약 사람이 실제로 "핫초코"를 만들고 있다면, 그 옵션이 목록에 없기 때문에 로봇은 실패할 수 있습니다.
  • 새 방식 (IntentVLM): 로봇은 열린 형태의 아이디어를 이해할 수 있습니다. 미리 작성된 목록이 필요하지 않습니다. 로봇 스스로 "핫초코 만들기"를 파악할 수 있습니다.

해결책: 두 단계 탐정 과정

저자들은 인간의 뇌가 작동하는 방식에서 영감을 받았습니다. 이를 **"전진 - 역방향 모델링 (Forward-Inverse Modeling)"**이라고 부릅니다. 마치 탐정이 두 단계로 미스터리를 해결하는 것처럼 생각하세요.

1 단계: "만약에?" 생성기 (전진 모델)
정답을 바로 추측하는 대신, 로봇은 먼저 브레인스토밍 세션처럼 행동합니다. 비디오를 보며 "이 사람이 이런 행동을 하는 가능한 모든 이유는 무엇일까?"라고 묻습니다.

  • 비유: 탐정이 용의자 목록을 작성하는 상황을 상상해 보세요. "아마도 커피를 만들고 있을지도 모른다. 차를 위해 우유를 데우고 있을지도 모른다. 아니면 단순히 유통기한을 확인하고 있을지도 모른다."
  • 로봇은 자신이 보는 것을 바탕으로 이러한 "후보 아이디어"의 짧은 목록을 생성합니다.

2 단계: "최적 적합" 심사관 (역방향 모델)
로봇이 가능성 목록을 갖게 되면, 엄격한 심사관처럼 행동합니다. 다시 비디오를 보며 "이 아이디어들 중 어떤 것이 증거와 가장 잘 맞는가?"라고 묻습니다.

  • 비유: 탐정이 단서 (사람이 찻잔이 아닌 머그잔을 집어 들었다) 를 살펴보고 "좋아, '차 만들기'는 맞지 않아. '날짜 확인하기'도 맞지 않아. '커피 만들기'가 완벽하게 들어맞아"라고 말합니다.
  • 로봇은 자신의 목록에서 가장 적합한 것을 선택합니다.

이것이 특별한 이유

  1. "환각 (Hallucinations)" 감소: 때때로 AI 는 사실을 왜곡하거나 만들어냅니다. 로봇에게 먼저 가능성 목록을 작성한 후 가장 좋은 것을 선택하도록 강제함으로써, 로봇이 막연하게 추측하는 것을 막습니다. 마치 학생에게 최종 답을 주기 전에 풀이 과정을 보여달라고 요구하는 것과 같습니다.
  2. 개방적 사고: 로봇이 스스로 아이디어 목록을 생성하기 때문에, 제한된 어휘에 묶이지 않습니다. 인간이 가질 수 있는 복잡하고 독특한 의도도 이해할 수 있습니다.
  3. 효율성: 연구진은 로봇에게 새로운 기술을 가르치기 위해 "스마트 단축키 (LoRA)"를 사용했습니다. 이는 로봇의 두뇌 전체를 다시 작성하지 않고도 새로운 기술을 배우기 위한 전용 공책을 제공하는 것과 같습니다. 이로 인해 로봇은 빠르며, 사물을 인식하는 등 다른 기능들을 잊어버리지 않습니다.

결과

이 팀은 이 로봇 두뇌를 두 가지 다른 과제로 테스트했습니다.

  • IntentQA: 로봇이 비디오 속 사람들이 무엇을 하려는지 질문에 답해야 하는 테스트입니다.
  • Inst-IT Bench: 로봇이 의도를 이해하는 법을 배운 후에도 여전히 사물과 장면을 인식할 수 있는지 확인하는 테스트입니다.

결과:

  • 새로운 로봇은 약 80% 의 정확도를 보였으며, 이는 이전 방법들에 비해 약 30% 향상된 큰 도약입니다.
  • 이 로봇은 이러한 테스트에서 인간과同等한 성능을 발휘했습니다.
  • 결정적으로, 의도를 이해하는 법을 배우는 과정에서 로봇이 사물을 보거나 장면을 이해하는 법을 "잊어버리지" 않았습니다. 일반적인 지식을 온전히 유지했습니다.

요약

IntentVLM은 로봇에게 탐정처럼 생각하도록 가르치는 시스템입니다. 먼저 행동의 모든 가능한 이유를 상상한 다음, 증거를 이용해 가장 논리적인 것을 선택합니다. 이를 통해 로봇은 유연하고 자연스러운 방식으로 인간의 목표를 이해하게 되어, 일상적인 작업에서 훨씬 더 훌륭한 파트너가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →