← 최신 논문
💻 computer science

CEZSAR: A Contrastive Embedding Method for Zero-Shot Action Recognition

본 논문은 자동 부정 샘플링 절차를 통해 비디오 및 텍스트 임베딩을 공동 공간에 정렬함으로써 의미적 격차와 도메인 이동을 해결하는 제로샷 동작 인식용 새로운 대비 학습 방법인 CEZSAR을 제안하며, UCF-101 및 Kinetics-400 데이터셋에서 최첨단 결과를 달성합니다.

원저자: Valter Estevam, Rayson Laroca, Helio Pedrini, David Menotti

게시일 2026-05-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Valter Estevam, Rayson Laroca, Helio Pedrini, David Menotti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 "말 타기"나 "농구하기"와 같은 인간의 행동을 인식하도록 가르친다고 상상해 보세요. 보통 로봇을 가르치려면 사람들이 그런 특정 행동을 하는 수천 개의 영상을 보여주고 하나씩 라벨을 붙여야 합니다. 하지만 로봇이 한 번도 본 적 없는 새로운 행동, 예를 들어 "체인톱을 저글링하기"를 인식하게 하려면 어떨까요? 훈련 데이터에 그런 예시가 존재하지 않기 때문에 보여줄 수 없습니다. 이것이 Zero-Shot Action Recognition(제로샷 행동 인식) 의 과제입니다.

이 논문은 이를 해결하기 위해 CEZSAR이라는 새로운 방법을 소개합니다. 작동 원리를 간단히 설명하면 다음과 같습니다:

두 가지 큰 문제

저자들은 예시를 보여 주지 않고 로봇에게 새로운 행동을 가르치는 것이 어렵다고 말합니다. 그 이유는 두 가지 주요한 "방해 요소" 때문입니다:

  1. 의미적 격차(언어 장벽):
    "시각"(픽셀과 형태를 봄) 을 말하는 로봇과 "텍스트"(단어를 이해함) 를 말하는 로봇이 있다고 상상해 보세요. 텍스트 로봇에게 "이것은 경마입니다"라고 말하면 그 개념을 알지만, 시각 로봇은 말과 트랙이 흐릿하게 보이는 이미지를 봅니다. 문제는 텍스트 세계에서의 "경마"라는 아이디어가 시각 세계의 "경마" 이미지와 완벽하게 일치하지 않는다는 것입니다. 서로 다른 사투리를 말하는 두 사람처럼, 같은 것을 이해하지만 세부 사항이 번역 과정에서 손실됩니다.

    • 논문의 해결책: CEZSAR 은 보편적 번역기를 구축합니다. 시각 로봇과 텍스트 로봇이 경마의 이미지와 "경마"라는 문장이 기억 속에서 바로 옆에 놓이도록 공유된 언어를 배우게 합니다.
  2. 도메인 이동(맥락의 함정):
    공원에서 뛰는 사람들에 대한 영상만으로 로봇을 훈련시켰다고 가정해 보세요. 그런 다음 체육관의 트레드밀에서 뛰는 사람을 인식하라고 하면, 배경 (도메인) 이 완전히 다르기 때문에 로봇이 혼란을 겪을 수 있습니다. 로봇은 "달리기"가 아니라 "공원"을 외웠기 때문입니다.

    • 논문의 해결책: 저자들은 "시각" 세계 (다른 공원, 다른 체육관 등) 는 크게 변하지만 "달리기"에 대한 "텍스트" 설명은 동일하게 유지된다는 점을 깨달았습니다. 시각 학습을 텍스트 설명에 고정함으로써, 로봇은 혼란스러운 배경을 무시하고 행동 자체에 집중하도록 배웁니다.

CEZSAR 의 작동 원리 (레시피)

이 방법은 "대조적"인 접근 방식을 사용하는데, 이는 "뜨겁고 차가운" 게임과 같습니다.

  1. 설정: 시스템은 영상과 이를 설명하는 문장을 입력받습니다.
  2. 목표: 영상과 그에 맞는 문장을 수학적 공간에서 서로 "포옹"하도록 (매우 가깝게) 만듭니다.
  3. **반전 **(어려운 부정 샘플링): 이것이 교묘한 부분입니다. 시스템은 무엇을 "매칭되지 않는지" 배워야 합니다. 인간이 수동으로 나쁜 매칭을 찾는 대신 컴퓨터가 자동으로 생성합니다.
    • "말 타기" 영상을 가져옵니다.
    • "말 타기"에 대한 문장을 가져옵니다 (좋은 매칭).
    • "자전거 타기"나 "파스타 요리하기"에 대한 문장을 가져옵니다 (나쁜 매칭).
    • 컴퓨터에게 "요리" 문장을 "말" 영상에서 멀리 밀어내도록 강요합니다.
    • 마법: 인간 도움 없이 이러한 "나쁜 매칭"을 자동으로 찾아내는 똑똑한 트릭을 사용하여, 단일 컴퓨터에서 몇 시간 만에 수백만 개의 훈련 예시를 생성합니다.

결과

저자들은 이 방법을 UCF-101 과 Kinetics-400 이라는 두 가지 유명한 비디오 데이터셋에서 테스트했습니다.

  • 점수: 이전 방법들보다 훨씬 높은 정확도를 기록했습니다. 예를 들어, 한 번도 보지 못한 101 가지 다른 행동에 대한 테스트에서 다음으로 좋은 방법보다 정확도가 약 10 퍼센트 포인트 향상되었습니다.
  • 작동 이유: 텍스트 설명을 사용하여 시각 학습을 안내함으로써, 로봇은 "말 타기"와 "경마"처럼 비슷하게 보이는 행동들을 구별하는 데 훨씬 능숙해졌고, 서로 다른 배경에 혼란을 느끼지 않게 되었습니다.

요약

CEZSAR 은 컴퓨터가 한 번도 보지 못한 행동을 인식하도록 가르치는 새로운 방법입니다. 단순히 이미지를 외우는 대신, 컴퓨터가 이미지와 그 설명을 연결하도록 가르치며, 우리가 보는 것과 읽는 것 사이의 격차를 메우기 위해 "매칭과 불일치"의 똑똑한 게임을 사용합니다. 이를 통해 컴퓨터는 한 번도 해당 행동의 영상을 본 적이 없더라도 빠르고 정확하게 새로운 행동을 이해할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →