← 최신 논문
💻 computer science

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3 는 작업 분리형 어텐션 마스킹과 검증 가능한 궤적 기반 보상을 통해 네이티브 반복적 단서 탐색을 가능하게 함으로써 균일 샘플링의 한계를 극복하는 장기 비디오 멀티홉 추론을 위한 새로운 프레임워크로, MLVU 및 Video-Holmes 와 같은 벤치마크에서 최첨단 성능을 달성합니다.

원저자: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

30 분짜리 영화를 한 편 보고 미스터리를 해결하려는데, 실제로 볼 수 있는 시간은 몇 초뿐이라고 상상해 보세요. 대부분의 기존 AI 모델은 이 문제를 해결하기 위해 몇 초마다 전체 영화를 빠르게 흐릿하게 스냅샷처럼 찍은 뒤 즉시 답을 추측합니다. 이는 전체 더미 한 번 훑어보며 그 속에서 바늘을 찾으려 하고, 운 좋게 보였기를 바라는 것과 같습니다. 바늘은 종종 '건초'(지루한 부분) 에 숨어 있어 놓치거나, 너무 많은 정보에 압도당하게 됩니다.

Video-o3는 게임의 규칙을 바꾸는 새로운 AI 프레임워크입니다. 그냥 훑어보는 대신, 이는 확대경을 든 탐정처럼 행동합니다. 작동 원리는 다음과 같이 단순한 개념으로 나누어 설명할 수 있습니다:

1. 탐정의 접근법 (네이티브 인터리브된 단서 탐색)

전체 영화를 보고 나서 추측하는 대신, Video-o3 는 조금 보고, 생각한 뒤 결정합니다: "이 특정 5 초 구간을 확대해서 무슨 일이 일어나는지 확인해야겠다."

  • 작동 방식: 시스템에게 비디오의 특정 구간을 '자르도록'(필름 릴에서 작은 조각을 잘라내듯) 요청하여 자세히 살펴봅니다.
  • 루프: 이 과정을 반복합니다. 조금 보기 \rightarrow 생각하기 \rightarrow 단서 확대 \rightarrow 다시 생각하기 \rightarrow 다른 단서 확대.
  • 결과: 실제로 중요한 비디오 부분만 보고 나머지는 무시하며, 조각조각 답을 구성해 나갑니다.

2. '분산된 주의'의 문제 (작업 분리 주의 마스크)

범죄 현장과 동시에 보고서를 작성하려는 탐정을 상상해 보세요. 정확히 같은 시간에 두 가지를 모두 하려 하면 혼란스러울 수 있습니다. 범죄 현장을 보면서도 실제로 보고 있는 것이 아니라 기억에서 나온 것을 적어내릴 수도 있습니다. 이를 '가짜 사고'라고 합니다.

  • 해결책: Video-o3 는 특별한 '마스크' 기술을 사용합니다.
    • AI 가 단서를 찾을 때(비디오를 스캔할 때), 작성할 수 있는 최종 답을 무시하도록 강제됩니다. 완전히 증거를 찾는 데에만 집중합니다.
    • AI 가 답을 작성할 때, 원본 비디오 영상은 무시하고 방금 찾은 단서에만 집중하도록 강제됩니다.
  • 비유: 이는 '학습' 단계에서는 교과서만 볼 수 있고, '시험' 단계에서는 필기 노트만 볼 수 있는 학생과 같습니다. 이는 부정행위나 혼란을 방지하여 최종 답이 확실한 증거에 기반하도록 보장합니다.

3. '정지 신호' (검증 가능한 궤적 기반 보상)

이론적으로 탐정은 모든 프레임을 살펴보기 위해 무한히 확대할 수 있지만, 이는 시간이 너무 오래 걸리고 비용(연산 능력) 이 너무 많이 듭니다.

  • 해결책: Video-o3 는 특별한 보상 시스템으로 훈련됩니다.
    • AI 가 빠르고 정확하게 답을 찾으면 큰 '금별'(보상) 을 받습니다.
    • AI 가 이미 답을 얻은 후 불필요하게 확대를 계속하면 '페널티'(보상이 줄어듦) 를 받습니다.
  • 비유: 이는 '따뜻하고 차가운' 게임과 같습니다. AI 는 '따뜻한'(충분한 증거를 가진) 순간을 느끼는 즉시 검색을 멈추는 법을 배웁니다. 빈 방을 보는 시간을 낭비하는 대신, 퍼즐을 해결한 바로 그 순간에 멈추는 효율성을 학습합니다.

4. 훈련장 (Seeker-173K)

AI 에게 탐정이 되게 하려면 교과서만 주는 것이 아니라, 단서를 찾아야 하는 수천 개의 연습 사례를 제공해야 합니다.

  • 데이터셋: 연구자들은 Seeker-173K라는 거대한 데이터셋을 만들었습니다. 여기에는 AI 가 보기 \rightarrow 확대 \rightarrow 생각 \rightarrow 다시 보기 \rightarrow 해결의 사이클을 연습하도록 강요당하는 173,000 개의 '비디오 미스터리' 예제가 포함되어 있습니다.
  • 결과: 이러한 특정 '단서 탐색' 작업에서 많이 연습했기 때문에, 이전 모델들보다 복잡한 비디오 질문에 대해 훨씬 더 잘 해결하게 되었습니다.

결론

Video-o3 는 컴퓨터가 긴 비디오를 보는 더 똑똑한 방법입니다. 한 번에 전체 영화를 외우려 하는 대신, 인간 탐정처럼 행동합니다: 장면을 스캔하고, 중요한 세부 사항에 확대하며, 점들을 연결하고, 증거를 얻는 즉시 멈춥니다. 이는 이를 훨씬 더 빠르고, 정확하며, 긴 비디오에 숨겨진 복잡한 퍼즐을 해결하는 데 더 뛰어나게 만듭니다.

성능: 테스트에서 이 접근법은 비디오를 단순히 '훑어본' 이전 방법들보다 비디오 퍼즐을 훨씬 더 높은 정확도 (예: 주요 벤치마크 중 하나에서 72.1%) 로 해결할 수 있게 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →