Act2See: Emergent Active Visual Perception for Video Reasoning
이 논문은 비전-언어 모델이 사고 연쇄 과정에서 동적 프레임 검색과 생성을 능동적으로 교차시키도록 함으로써 비디오 추론을 강화하는 새로운 프레임워크인 Act2See를 소개하며, 이를 통해 여러 벤치마크에서 최첨단 성능을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 미스터리를 해결하려는 상황을 상상해 보세요. 마치 영화 장면에서 무슨 일이 일어났는지 파악하는 것과 같습니다. 현재 대부분의 AI "탐정"(비전-언어 모델) 은 영화의 매우 초반부에 제공된 몇 개의 정적 스냅샷만 받아 전체 퍼즐을 그 정지 이미지들만으로 해결하도록 요청받습니다. 이는 영화의 표지 아트와 대본의 처음 두 페이지만 보고 영화의 줄거리를 추측하려는 사람과 같습니다. 그들은 이후에 벌어지는 모든 액션, 대화, 그리고 결정적인 세부 사항들을 놓칩니다.
ACT2SEE는 이러한 AI 탐정들에게 **능동적 시각 지각 (Active Visual Perception)**이라는 초능력을 부여하는 새로운 프레임워크입니다. 초기 스냅샷에 갇혀 있는 대신, ACT2SEE 는 AI 가 "잠깐, 아직 단서가 충분하지 않군"이라고 깨닫고 더 많은 정보를 적극적으로 찾아내도록 가르칩니다.
다음은 이를 단순한 단계로 나누어 설명한 작동 방식입니다:
1. "물어보고 행동하기" 접근법
과거 방식에서는 AI 가 처음에 보는 것만으로 추측했습니다. ACT2SEE 를 사용하면 AI 는 사고 과정을 멈추고 "이 특정 순간을 봐야 해" 또는 "만약 ~라면 어떻게 될지 상상해 봐야 해"라고 말하도록 훈련됩니다.
- 검색 (시간 여행자): AI 가 비디오에서 실제로 일어났지만 초기 스냅샷에는 포함되지 않은 특정 순간을 봐야 할 때, "검색 도구"를 사용해 비디오로 되돌아가 필요한 정확한 프레임을 꺼냅니다. 이는 책을 읽고 있는 사람에게 도서관 사서에게 특정 페이지를 찾아달라고 요청하는 것과 같습니다.
- 생성 (공상가): 때로는 질문이 일어나지 않은 것에 관한 것일 수 있습니다. 예를 들어 "해가 진 이전에 기차가 역에 멈췄다면 어땠을까?"와 같은 경우입니다. 이 장면은 비디오에 존재하지 않으므로, AI 는 "생성 도구"를 사용해 그 가상의 시나리오에 대한 완전히 새로운 이미지를 만들어냅니다. 이는 오직 상상 속에 존재하는 장면을 화가가 스케치하는 것과 같습니다.
2. 훈련 캠프 (지도 미세 조정)
그들은 어떻게 AI 에게 이를 가르쳤을까요? 단순히 "더 노력해라"라고 말한 것이 아닙니다. 그들은 매우 똑똑한 최첨단 AI(Gemini 2.5 Pro) 를 이용해 특별한 훈련 캠프를 구축했습니다.
- 훈련: 그들은 이 똑똑한 AI 에게 비디오 퍼즐을 해결하도록 요청했습니다. AI 가 더 많은 시각적 단서가 필요하다고 깨닫는 순간, 멈추고 "[X] 의 사진을 가져와 줘" 또는 "[Y] 의 그림을 그려 줘"라고 적어달라는 지시를 받았습니다.
- 품질 점검: 그들은 어떤 답변이나 받아들인 것이 아닙니다. AI 의 추론 단계를 인간이 작성한 "골드 스탠다드" 답변과 비교했습니다. AI 의 추론이 엉망이거나 인간의 논리와 맞지 않으면 폐기했습니다. 오직 AI 가 올바른 시각적 증거를 올바르게 요청한 고품질의 "탐정 작업"만 남겼습니다.
- 결과: 그들은 약 3,300 개의 예시로 구성된 이러한 고품질 "탐정 로그"의 거대한 데이터셋을 만들었습니다. 이 중 약 절반의 경우에서 AI 는 사건을 해결하기 위해 새로운 사진을 꺼내거나 새로운 그림을 그려야 했습니다. 그런 다음 이 데이터셋을 사용하여 더 작고 효율적인 AI 모델 (Qwen3-VL-8B) 을 훈련시켰습니다.
3. "창발적" 마법
가장 흥미로운 부분은 훈련된 AI 가 본 적 없는 새로운 퍼즐로 테스트될 때 발생합니다. 그것은 경직된 대본을 따르는 것이 아닙니다. 자발적으로 언제 더 많은 사진을 요청할지 결정합니다.
- 질문이 사실적 세부 사항에 관한 것이라면 (예: "차의 색깔은 무엇이었나요?"), 비디오에서 정확한 프레임을 검색해야 한다는 것을 압니다.
- 질문이 "만약에" 시나리오라면 (예: "차가 빨간색이었다면 어땠을까요?"), 그 가능성을 시각화하기 위해 새로운 이미지를 생성해야 한다는 것을 압니다.
"이미지로 사고하고" 동적으로 증거를 수집하는 이러한 능력을 저자들은 **창발적 능력 (emergent capability)**이라고 부릅니다. 이는 마치 AI 가 갑자기 "이건 눈으로만 볼 수 있는 것만으로는 해결할 수 없어. 더 자세히 보거나 나머지를 상상해야 해"라고 말하게 된 것과 같습니다.
4. 결과
복잡한 논리 퍼즐을 포함하는 비디오 추론 벤치마크와 같은 어려운 테스트에서 ACT2SEE 는 훨씬 더 크고 강력한 많은 모델들보다 더 좋은 성과를 냈습니다.
- 크기가 두 배인 모델들을 능가했습니다.
- 비디오 프레임을 추론에 추가하려 했지만 AI 가 언제 이를 사용할지 능동적으로 결정하도록 가르치지 않았던 다른 방법들보다 더 우수한 성능을 보였습니다.
- 다른 어떤 방법보다도 "반사실적" 질문 ("만약에" 시나리오) 을 훨씬 잘 처리하여 가상의 이미지를 생성하는 능력이 심층 추론에 필수적임을 입증했습니다.
요약
ACT2SEE 는 몇 장의 사진만 뚫어지게 바라보는 수동적 관찰자에서 증거를 더 깊이 파헤치거나 상상력을 발휘해 공백을 메울 때를 아는 능동적 조사관으로 AI 를 업그레이드한 것으로 생각할 수 있습니다. AI 에게 사고 과정 도중에 필요한 시각적 정보를 능동적으로 요청하거나 생성하도록 가르침으로써, 이전에는 불가능했던 수준의 이해도로 복잡한 비디오 퍼즐을 해결합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.