StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
StreamOV 은 증거 기반 메모리를 활용한 효율적인 컨텍스트 관리와 숨겨진 상태 기반 트리거를 통한 능동적 응답 생성을 통해 오프라인 방법의 한계를 극복하는 새로운 스트리밍 오므니비디오 이해 프레임워크로, 새로 도입된 SOVBench 를 통해 검증되었습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
생각해 보세요. 멈추지 않는 24 시간 실시간 뉴스 피드를 보고 있다고 가정해 봅시다. 지금 일어나고 있는 일에 대해 똑똑한 AI 와 대화하고 싶지만, 비디오를 일시 정지할 수도 없고, 한 시간 전에 일어난 일을 보기 위해 되감기도 할 수 없습니다. AI 는 실시간으로 보고, 듣고, 기억하고, 대답해야 합니다.
이것이 바로 StreamOV가 해결하는 문제입니다.
문제: "압도된 사서"
대부분의 현재 AI 비디오 모델은 도서관이 문을 닫은 때에만 일하는 사서들과 같습니다. 영화가 완전히 끝날 때까지 기다렸다가, 대본 전체를 읽은 다음에야 질문에 답합니다. 이는 실시간 스트리밍에는 작동하지 않습니다.
만약 이러한 "오프라인" 사서들을 실시간으로 작동하게 하려 한다면, 그들은 두 가지 큰 두통에 직면하게 됩니다:
- 메모리 과부하: 2 시간 분량의 스트림의 모든 프레임과 소리를 기억하려 한다면, 그들의 두뇌는 폭발할 것입니다. 지루한 부분은 잊고 중요한 것만 보관할 방법이 필요합니다.
- "침묵" 문제: 실시간 채팅에서 때로는 최선의 답변이 아무 말도 하지 않는 것입니다. "셰프가 무엇을 요리하고 있나요?"라고 물었을 때 셰프가 아직 시작하지 않았다면, AI 는 추측하거나 환각적인 답변을 만들어내서는 안 됩니다. 셰프가 실제로 칼을 집어 들 때까지 침묵해야 합니다. 기존 AI 들은 종종 이 부분에서 어려움을 겪습니다. 너무 많이 말하거나 (침묵을 무의미한 말로 채우거나), 언제 말해야 하는지 지시하는 별도의 어색한 "관리자"가 필요하곤 합니다.
해결책: StreamOV
저자들은 이러한 실시간 "오모달 (시각과 청각)" 세계를 위해 특별히 설계된 StreamOV를 만들었습니다. 몇 가지 간단한 비유를 통해 작동 방식을 설명해 보겠습니다:
1. "스마트 체" (증거 기반 메모리)
스트림을 보고 있지만, 메모를 적을 수 있는 작은 메모지 하나만 있다고 상상해 보세요. 모든 것을 적을 수는 없습니다.
- 옛 방식: 모든 것을 적어 둔 뒤, 나중에 그걸 모두 억지로 넣으려 노력합니다.
- StreamOV 방식: 스마트 체를 갖추고 있습니다. 비디오가 재생되는 동안 끊임없이 묻습니다: "이 순간이 중요한가?"
- 시각적 장면이 극적으로 변했는가? (셰프가 프라이팬을 떨어뜨렸다!) -> 보관.
- 소리가 크거나 갑자기 들렸는가? (충돌음!) -> 보관.
- 사용자가 방금 한 질문과 일치하는가? (사용자가 계란에 대해 물었고, 셰프가 방금 계란을 깼다.) -> 보관.
- 단순한 배경 소음이거나 정적인 샷인가? -> 버림.
이는 "장기 - 단기 메모리"를 구축합니다. 단기 메모리는 방금 일어난 일 (최근 몇 초) 의 밀집된 버퍼입니다. 장기 메모리는 지난 한 시간 동안 가장 "증거가 풍부한" 순간들의 희소 집합입니다. 이로써 AI 의 메모리는 제한적 (작게) 이지만 놀라울 정도로 정보량이 풍부하게 유지됩니다.
2. "내장 직감" (응답 트리거)
이것이 이 논문의 가장 교묘한 수입니다.
옛 방식: AI 가 입을 다물라고 스스로에게 알려주는 특별한 "침묵 토큰" ("..."나 "잠시만"과 같은) 을 생성하거나, 언제 말해야 할지 결정하는 경비원 역할을 하는 별도의 작은 AI 로봇을 사용합니다.
StreamOV 방식: AI 는 자신의 내장 직감을 사용합니다.
AI 의 두뇌가 실제로 말하기 전에 "사전 사고" 단계를 갖는다고 생각해 보세요. StreamOV 는 AI 두뇌 내부의 숨겨진 상태인 생각의 아주 첫 번째 불꽃을 살펴봅니다.- 두뇌가 자신감을 느끼는가? -> 말하다.
- 두뇌가 정보가 부족하다고 느끼는가? -> 침묵하다.
"기다려"라고 입력하거나 별도의 로봇에게 묻지 않아도 됩니다. 내부적으로 "이제 충분한 증거가 있다"고 결정하고 말을 시작합니다. 그렇지 않다면 단순히 그 턴의 처리를 중단하여 에너지를 절약하고 무의미한 말을 피합니다.
3. 새로운 테스트: SOVBench
이것이 작동함을 증명하기 위해 저자들은 기존의 테스트를 사용할 수 없었습니다. 왜냐하면 기존 테스트는 마치 완성된 영화에 대한 "예상 문제"처럼 보였기 때문입니다. 그들은 SOVBench라는 새로운 실전 시험을 구축했습니다.
- 실시간 이해도 테스트 (지금 일어나고 있는 일에 대해 답변).
- 기억 테스트 (10 분 전에 일어난 일을 기억).
- 적극성 테스트 (언제 말하고 언제 침묵해야 할지 아는 능력).
- 비디오와 오디오를 모두 포함하여 AI 가 단순히 "보고"만 하는 것이 아니라 "듣고"도 있는지 확인합니다.
결과
테스트를 실행했을 때, StreamOV 는 단순히 게임을 한 것이 아니라 승리했습니다.
- 스트리밍 모드로 강제로 작동하게 된 거대하고 강력한 오프라인 모델 (Qwen3-Omni 등) 보다 뛰어난 성능을 보였습니다.
- 다른 스트리밍 모델들보다 언제 말하고 언제 침묵해야 할지 아는 데 더 뛰어났습니다.
- 메모리를 위한 "스마트 체"와 타이밍을 위한 "내장 직감"을 사용함으로써, AI 가 무한한 메모리나 외부 관리자 없이도 실시간 비디오 스트림을 효율적으로 이해할 수 있음을 증명했습니다.
간단히 말해: StreamOV 는 실시간으로 끝없이 이어지는 비디오를 보고, 중요한 부분만 기억하며, 대화에 참여할 때와 침묵해야 할 때를 정확히 알고, 압도되지 않는 최초의 AI 입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.