← 최신 논문
💻 computer science

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

이 논문은 현재 모델들의 장기 기억 및 실시간 인지 능력의 한계를 드러내는 시간 단위 규모의 상호작용적 비디오 이해를 위한 종합적인 벤치마크인 StreamArena와, 기존 베이스라인들을 능가하기 위해 지속적인 상호작용과 지속적인 멀티모달 메모리 사이의 균형을 효과적으로 맞추는 2단계 아키텍처인 StreamMind를 소개한다.

원저자: Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

게시일 2026-08-07
📖 6 분 읽기🧠 심층 분석

원저자: Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 로봇에게 당신의 가장 친한 친구이자, 투어 가이드이며, 동시에 개인 비서가 되도록 가르치려 한다고 상상해 보십시오. 당신은 로봇이 당신과 함께 영화를 보고, 한 시간 전의 모든 반전을 기억하며, 등장인물이 실시간으로 재채기하는 것을 알아차리고, 심지어 당신이 요청하면 인터넷을 검색하여 배우의 생일을 찾아내기 위해 벌떡 일어나는 모습을 원합니다. 이것이 바로 멀티모달 AI 에이전트(multimodal AI agents)—보고, 듣고, 말할 수 있는 컴퓨터 프로그램의 세계입니다. 하지만 여기 함정이 있습니다. 대부분의 이 로봇들은 '장기전'에 매우 취약합니다. 그들은 마치 3초짜리 기억력을 가진 금붕어와 같습니다. 만약 당신이 2시간짜리 영상을 보여준다면, 그들은 보통 마지막 몇 초만을 기억할 뿐입니다. 또한 그들은 대개 수동적이어서, 당신이 무언가를 말하지 않으면 스스로 중요한 것을 알아차리고 먼저 말을 꺼내는 대신 당신이 질문하기를 기다립니다. 과학자들은 이 로봇들이 영상의 시작 부분을 끝에 도달할 때까지 잊어버리지 않고 어떻게 긴 연속적인 비디오와 오디오 스트림을 처리할 수 있는지 구축하기 위해 노력해 왔지만, 실제로 그들이 정말로 해내고 있는 것인지 아니면 그냥 추측하고 있는 것인지를 테스트하는 것은 매우 어려웠습니다.

이 논문은 이러한 로봇들을 테스트하는 새로운 방법과 실제로 그 테스트를 통과하는 새로운 로봇 설계를 소개합니다. 연구진은 243개의 전체 길이 영상(평균 약 88.8분)으로 구성된 거대한 놀이터인 StreamArena를 구축했습니다. 여기에는 수천 개의 까다로운 질문들이 담겨 있습니다. 기존의 테스트들이 짧은 클립과 객관식 질문을 사용하여 로봇이 선택지를 보고 추측할 수 있게 했던 것과 달리, StreamArena는 로봇이 전체 영화를 시청하고, 한 시간 전의 세부 사항을 기억하며, 아무런 힌트 없이 개방형 질문에 답하도록 강제합니다. 연구진은 현재 대부분의 로봇이 처참하게 실패한다는 것을 발견했습니다. 만약 로봇이 과거를 기억하려고 하면 시각적 세부 사항을 놓치고, 시각적 세부 사항을 유지하려고 하면 역사를 잊어버립니다. 이를 해결하기 위해 저자들은 StreamMind라는, 특별한 두 부분으로 구성된 뇌를 가진 로봇을 만들었습니다. 한 부분은 즉각적인 대화를 처리하고 실시간으로 특정 이벤트를 관찰하며, 별도의 바쁜 다른 부분은 배경에서 작동하며 모든 사건에 대한 검색 가능한 영구적인 라이브러리를 구축합니다. 이 새로운 설계 덕분에 로봇은 혼란을 겪거나 느려지지 않고도 먼 과거의 사건을 기억하고, 검색 엔진과 같은 도구를 사용하며, 심지어 흥미로운 일이 발생했을 때 당신에게 알릴 수도 있습니다.

문제점: AI의 금붕어 기억력

당신이 금붕어의 기억력을 가진 친구와 함께 매우 길고 흥しい 영화를 보고 있다고 상상해 보십시오. 새로운 장면이 시작될 때마다, 당신의 친구는 그 이전까지의 전체 줄거리를 잊어버립니다. 만약 당신이 "첫 번째 장면에 나온 악당이 누구였지?"라고 묻는다면, 그는 첫 5초만을 기억하기 때문에 대답할 수 없습니다. 이것이 바로 현재 대부분의 AI 비디오 모델에서 일어나는 현상입니다. 그들은 지금 당장 일어나고 있는 일에 대해 질문에 답하는 데는 뛰어나지만, 한 시간 전에 무슨 일이 있었는지 기억하는 데는 어려움을 겪습니다.

설상가상으로, 대부분의 이러한 AI 모델들은 수동적입니다. 그들은 당신이 질문하기 전까지는 조용히 앉아 있습니다. 하지만 현실 세계에서는, 당신의 AI가 "헤이, 방금 저 캐릭터가 열쇠를 떨어뜨렸어!"라거나 "노래가 바뀌었고 분위기가 슬퍼지고 있어"와 같이 중요한 것을 스스로 알아차리기를 원할 수도 있습니다. 현재의 AI 모델들은 단지 당신이 먼저 말을 걸기를 기다리고 있기 때문에 보통 이러한 순간들을 놓칩니다.

연구진은 기존의 AI 모델 테스트가 너무 쉽다는 점을 주목했습니다. 그들은 짧은 비디오 클립과 객관식 질문을 사용했습니다. 이는 학생에게 사진 한 장을 보여주고 "이것은 고양이인가요, 강아지인가요?"라고 묻는 것과 같습니다. 학생은 사진에 대해 아무것도 알지 못하더라도 그냥 "고양이"라고 찍어서 맞출 수 있습니다. 연구진은 AI가 긴 영상을 이해하는 능력을 진정으로 테스트하려면 더 어려운 테스트가 필요하다는 것을 깨달았습니다. 즉, 전체 길이의 영화, 개방형 질문(AI가 직접 답을 생각해내야 하는 질문), 그리고 아주 오래전의 일을 기억해야 하는 과업이 필요했습니다.

해결책: StreamArena와 StreamMind

이러한 문제들을 해결하기 위해 팀은 StreamArena를 만들었습니다. 이것을 비디오 이해 AI를 위한 "올림픽"이라고 생각하십시오. 짧은 클립 대신, 그들은 평균 88.8분인 243개의 전체 길이 영상을 모았습니다. 그들은 단순히 간단한 질문을 던진 것이 아니라, 네 가지 특정 기술을 테스트하는 3,646개의 복잡한 과업을 만들었습니다:

  1. 실시간 인지 (Real-Time Perception): AI가 지금 당장 일어나고 있는 일을 설명할 수 있는가? (예: "여배우가 있는 방 번호가 몇 번인가요?")
  2. 역사적 회상 (Historical Retrospection): AI가 한 시간 전에 일어난 일을 기억할 수 있는가? (예: "지난 5분 동안 얼마나 많은 고유한 장면들이 나타났나요?")
  3. 주도적 상호작용 (Proactive Interaction): AI가 요청받지 않아도 스스로 말을 꺼낼 수 있는가? (예: "'Les Mouchoirs Blancs' 노래가 시작될 때 알려줘.")
  4. 도구 활용 (Tool Utilization): AI가 영상에 없는 정보를 찾기 위해 검색 엔진과 같은 외부 도구를 사용할 수 있는가? (예: "배우 부모님의 국적은 무엇인가요?")

기존 AI 모델들을 StreamArena에서 테스트했을 때 결과는 실망스러웠습니다. 비디오를 텍스트로 변환하여 모든 것을 기억하려고 했던 모델들은 시각적 세부 사항을 잃었습니다. 마지막 몇 초만을 기억했던 모델들은 과거에 대한 질문에 답할 수 없었습니다. 마치 로봇이 좋은 대화가인 동시에 좋은 역사학자가 될 수는 없는 것처럼 보였습니다.

그래서 팀은 이 긴장 관계를 다루도록 설계된 새로운 AI 아키텍처인 StreamMind를 구축했습니다. StreamMind를 두 팀이 협력하여 일하는 바쁜 사무실이라고 상상해 보십시오:

  • 프런트 데스크 (Frontend): 이 팀은 당신과 대화합니다. 그들은 빠르고 반응적이며, 당신의 즉각적인 질문을 처리합니다. 또한 그들에게는 특정 이벤트를 추적하도록 요청받은 것을 계속 지켜보는 특별한 "감시자" 팀(Monitor Workers)이 있습니다. 만약 당신이 "개가 짖을 때 알려줘"라고 말한다면, 감시자는 당신의 허락을 구하지 않고도 그 순간을 포착하기 위해 비디오를 지켜보며 "멍!" 하고 외칠 준비를 합니다.
  • 도서관 (Backend): 프런트 데스크가 당신과 대화하는 동안, 도서관 팀은 배경에서 작업합니다. 그들은 끊임없이 비디오를 관찰하고, 정리하며, 거대하고 검색 가능한 기억 저장소를 구축합니다. 그들은 단순히 요약본을 쓰는 것이 아니라, 핵심 프레임(사진)을 저장하고, 사건들을 이야기로 그룹화하며, 사람과 사물을 서로 연결합니다. 프런트 데스크가 한 시간 전의 일에 대한 질문에 답해야 할 때, 그들은 스스로 기억하려고 애쓰지 않습니다. 대신 도서관에 "45분 전의 개에 대한 정보가 있나요?"라고 묻습니다. 도서관은 즉시 정확한 장면과 세부 사항을 찾아냅니다.

이 분리가 핵심 비결입니다. "생각하는 것"과 "기억하는 것"을 "말하는 것"으로부터 분리함으로써, StreamMind는 전체 비디오에 대한 완벽한 기억을 유지하면서도 빠르고 반응적으로 움직일 수 있습니다.

결과: 새로운 챔피언

연구진이 StreamMind를 StreamArena 테스트에 투입했을 때, 그것은 다른 모든 시스템을 압도했습니다. 단순히 조금 더 잘한 수준이 아니라, 거대한 도약이었습니다.

  • 기존 최고의 스트리밍 모델들과 비교했을 때 실시간 인지 능력이 58.4% 향상되었습니다.
  • 역사적 기억 능력이 53.7% 향상되어, 실제로 한 시간 전의 일을 기억할 수 있음을 증명했습니다.
  • 도구 활용 능력이 무려 228.1% 향상되었으며, 이는 검색 엔진과의 협업 능력이 훨씬 뛰어남을 보여줍니다.
  • 주도적 상호작용 능력이 54.7% 향상되었는데, 이는 AI가 스스로 이벤트를 포착하고 알리는 능력이 훨씬 좋아졌음을 의미합니다.

가장 인상적인 점은 StreamMind가 이 모든 것을 더 빠르게 수행했다는 것입니다. 비디오가 재생되는 동안 이미 기억 라이브러리를 구축해 놓았기 때문에, 질문에 답하기 위해 비디오를 다시 볼 필요가 없었습니다. 이는 비디오를 매번 다시 처리해야 하는 다른 모델들에 비해 질문 답변 시간을 66.2% 단축시켰습니다.

이것이 왜 중요한가

이 논문은 AI 비서의 미래가 단순히 더 똑똑해지거나 더 큰 뇌를 갖는 것에 달려 있는 것이 아니라는 점을 시사합니다. 그것은 그들이 작동하는 방식을 바꾸는 것에 관한 것입니다. 하나의 거대한 뇌가 모든 것을 한꺼번에 하도록 강요하는 대신, 우리는 서로 협력하는 전문화된 부분들을 가진 시스템을 구축해야 합니다. StreamMind는 "현재"와 "과거"를 분리하고, AI에게 검색 가능한 영구적인 기억을 부여함으로써, 우리가 마침내 전체 영화를 함께 보고, 모든 세부 사항을 기억하며, 흐름을 놓치지 않고 필요한 답을 찾아주는 비서를 만들 수 있다는 것을 보여줍니다.

연구진은 StreamMind가 거대한 진전이지만 여전히 할 일이 남아 있다는 점을 주의 깊게 언급했습니다. 이 시스템은 질문과 답변 사이의 시간 간격이 매우 길 때(30분 이상) 여전히 약간 어려움을 겪으며, 미래의 개선 사항은 어떤 세부 사항이 기억 저장소에 저장할 만큼 중요한지를 결정하는 방법에 집중해야 할 것이라고 생각합니다. 하지만 현재로서는, StreamArena와 StreamMind가 새로운 표준을 세웠으며, 적절한 아키텍처가 있다면 AI가 마침 finally 실제 삶의 길고 연속적인 흐름을 따라잡을 수 있다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →