← 최신 논문
💻 computer science

Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos

이 논문은 시선 주시와 마크 집합 (Set-of-Mark) 프롬프팅을 활용하여 시계열 역동성을 포착하는 새로운 프레임 샘플링 전략과 결합함으로써, VLLM 기반의 자시점 (Egocentric) 비디오에서 인간 - 객체 상호작용 예측 성능을 획기적으로 개선한 방법을 제안합니다.

원저자: Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 영화 예고편을 보는 AI: "다음 장면은?"

상상해 보세요. 여러분이 주방에서 요리하고 있는데, AI 가 그 모습을 지켜보고 있습니다.
**"저 사람이 지금 당장 무엇을 할까?"**라고 AI 가 생각한다고 칩시다.

기존의 AI 들은 단순히 "손이 움직이고 있으니 그릇을 잡겠지"라고 추측하는 수준이었습니다. 하지만 이 연구팀은 AI 를 단순한 관찰자가 아닌, 사람의 마음을 읽는 심리 분석가로 업그레이드했습니다.

이들은 AI 에게 세 가지 강력한 '수단'을 주었습니다.

1. 🧩 "점점 더 선명해지는 퍼즐" (Set-of-Mark)

일반적인 AI 는 화면에 있는 수많은 물건들 (냄비, 계란, 프라이팬 등) 을 구분하기가 어렵습니다. 마치 흐릿한 사진 속에서 물건을 찾는 것과 비슷하죠.

연구팀은 **Set-of-Mark(마크의 집합)**이라는 기술을 썼습니다.

  • 비유: 요리사가 재료를 준비할 때, 각 재료 위에 색깔이 다른 스티커를 붙여놓는다고 상상해 보세요. "이건 냄비 스티커, 저건 계란 스티커"라고 표시해 주는 거죠.
  • 효과: AI 는 이제 흐릿한 눈으로 보는 게 아니라, 각 물건에 라벨이 붙어 있는 선명한 화면을 보게 됩니다. 그래서 "아, 저기 스티커가 붙은 냄비가 중요하구나!"라고 쉽게 알아챕니다.

2. 👀 "눈빛이 말하는 비밀" (Gaze Trajectory)

사람은 무언가를 할 때, 먼저 으로 그 대상을 봅니다. "손이 움직이기 전에 눈이 먼저 간다"는 말처럼요.

  • 비유: 친구가 무언가를 가리키려 할 때, 그 친구의 눈이 어디를 보고 있는지 따라가 보세요. 그 친구가 무엇을 하려는지 금방 알 수 있죠.
  • 효과: 이 연구팀은 AI 에게 사용자의 **눈동자 이동 경로 (시선 궤적)**를 보여주었습니다. 화면에 "빨간색 원"이 최근 시선을, "파란색 선"이 과거 시선을 표시해 줍니다. AI 는 "아, 사람의 눈이 계란 쪽으로 쏠렸었구나. 그럼 계란을 깨뜨리려고 하겠구나!"라고 사람의 의도를 미리 파악하게 됩니다.

3. ⏱️ "가장 중요한 순간만 골라내는 필터" (Inverse Exponential Sampling)

영상을 분석할 때, 모든 프레임을 다 보면 AI 는 지쳐버립니다. (데이터가 너무 많아서요.)

  • 비유: 영화의 하이라이트 장면만 편집해서 보여주는 것과 같습니다. 특히 결정적인 순간 직전의 장면이 가장 중요합니다.
  • 효과: 연구팀은 역지수 샘플링이라는 방법을 썼습니다. 이는 "영양가 있는 마지막 장면"에 집중하는 전략입니다. 상호작용이 일어나기 직전의 몇 초 동안의 영상은 아주 촘촘하게, 그 이전의 영상은 덜 중요하게 처리해서 AI 가 가장 핵심적인 순간에 집중하게 만들었습니다.

🏆 결과: 어떻게 변했나요?

이 세 가지 기술 (스티커, 눈빛 추적, 핵심 장면 필터링) 을 합치자, AI 는 놀라운 실력을 발휘했습니다.

  • 기존 AI: 21% 만 맞추던 것을,
  • 새로운 AI: **27.5%**까지 맞추는 기록을 세웠습니다. (숫자가 작아 보일 수 있지만, 이 분야에서는 엄청난 도약입니다!)

특히 이 기술은 어떤 AI 모델을 쓰든 (LLaVA, Gemini 등) 적용이 가능해서, 마치 "모든 자동차에 장착할 수 있는 고성능 엔진"처럼 범용성이 뛰어납니다.

💡 왜 이것이 중요할까요?

이 기술이 완성되면, 실제 생활에서 우리를 도와주는 비서가 될 수 있습니다.

  • 주방에서: 뜨거운 냄비를 맨손으로 잡으려 하면, "잠깐! 냄비 손잡이를 잡으세요!"라고 경고해 줍니다.
  • 공장에서는: 위험한 기계에 손을 댈 것 같으면, 작업자에게 "위험합니다!"라고 알려주어 사고를 막아줍니다.

📝 한 줄 요약

이 논문은 **"AI 에게 물건에 스티커를 붙여주고, 사람의 눈빛을 따라가게 하며, 가장 중요한 순간만 집중하게 함으로써, 사람이 다음에 무엇을 할지 훨씬 더 정확하게 예측하게 만든 연구"**입니다.

이제 AI 는 단순히 영상을 보는 것을 넘어, 사람의 마음을 읽는 눈을 갖게 된 셈입니다!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →