← 최신 논문
🤖 AI

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE는 교차 모달 결합, 양방향 정제, 그리고 다중 에이전트 교차 검증을 통해 자기 수정적이고 엔티티 중심적인 메모리를 구축함으로써 정체성 혼동과 환각을 방지하고, 기존 최첨단 베이스라인 대비 5.9%의 정확도 향상을 달ace하는 멀티모달 에이전틱 메모리 프레임워크이다.

원저자: Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

게시일 2026-08-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

영화 전체에 걸쳐 펼쳐지는 미스터리를 풀려고 노력 중이라고 상상해 보세요. 하지만 당신은 한 번에 단 하나의 정지된 프레임만을 볼 수 있고, 몇 분마다 기억이 깨끗이 지워집니다. 이것이 긴 영상을 이해하려고 노력하는 현대 인공지능의 일상적인 고충입니다. 오늘날 가장 똑똑한 AI 모델들은 책의 한 페이지를 완벽하게 읽어내는 천재적인 탐정과 같지만, 만약 40분짜리 영화를 건네준다면 압도당하고 맙니다. 그들은 전체 이야기를 아주 작은 정신적 상자 안에 구겨 넣으려 하거나, 영화를 작고 고립된 조각들로 잘게 쪼개버립니다. 문제는 무엇일까요? 이야기를 쪼개면 연결 고리를 잃게 된다는 점입니다. 등장인물이 누구인지 잊어버리고, 이름을 혼동하며, 마지막 장면의 단서들을 기억하지 못하기 때문에 첫 번째 장면에서 무슨 일이 일어났는지에 대해 무모하게 추측하기 시작합니다.

여기서 "장기 영상 이해(long-form video understanding)" 분야가 등장합니다. 과학자들은 컴퓨터가 몇 시간 분량의 영상을 시청하고, 세부 사항을 기억하며, 무엇이 일어났는지, 누가 그것을 했는지, 그리고 왜 그랬는지와 같은 까다로운 질문에 답할 수 있도록 가르치려 노력하고 있습니다. 목표는 단순히 픽셀을 보는 것이 아니라, 오프닝 장면부터 엔딩 크레딧까지 사람과 사물을 추적하며 하나의 이야기를 이해하는 AI를 구축하는 것입니다. 하지만 현재의 방식들은 너무 공격적으로 영상을 요약하여, 한 사람과 다른 사람을 구별하는 데 필요한 미세한 디테일들을 버려버리거나, "현재"만을 보고 있기 때문에 5분 전에 저지른 실수를 바로잡지 못하고 굴레에 갇히는 경우가 많습니다.

절강대학교와 시디안 대학교의 연구진이 설계한 새로운 시스템인 ViSAGE를 주목하십시오. 이 시스템은 AI 에이전트를 위한 초강력하고 자기 수정이 가능한 메모리처럼 작동합니다. 표준 AI의 메모리가 영화를 보면서 메모를 휘갈겨 쓰는 지저키한 공책이라면, 페이지를 넘기는 순간 다시 돌아가 잘못된 추측을 바로잡을 수 없습니다. 만약 첫 번째 장면에서 어떤 캐릭터를 "마리오"라고 생각했는데, 나중에 알고 보니 그가 "엠마"였다면, 일반적인 시스템은 계속해서 그를 마리오라고 부르며 혼란스럽고 틀린 답을 내놓게 됩니다. 그러나 ViSAGE는 용의자 명단과 사건 타임라인을 계속 유지하는 탐지와 같습니다. 30분 지점의 대화에서 이름이 언급되는 것과 같은 새로운 단서가 도착하면, 단순히 그것을 기록해 두는 것에 그치지 않고, 전체 이야기가 말이 되도록 처음부터 노트를 다시 작성합니다.

연구진은 이러한 "자기 수정" 시스템을 구축함으로써 AI가 마침 finally 긴 영상의 혼란을 처리할 수 있다는 것을 발견했습니다. 그들은 "무슨 일이 일어났는가"(사건)와 "누가 했는가"(캐릭터)를 분리하는 프레임워크를 만들었습니다. AI가 어떤 사람을 보았지만 아직 이름을 모를 경우, 임시 라벨을 부여합니다. 나중에 영상에서 그 이름이 밝혀지면, ViSAGE는 "역방향 업데이트(backward update)"를 사용하여 즉시 이전의 모든 노트를 수정함으로써, 모든 행동이 올바른 사람과 연결되도록 보장합니다. 또한, 검토를 위해 "에이전트" 팀을 사용합니다. 만약 AI가 답변에 확신이 없다면, 이야기를 지어내는 것(이를 '환각'이라고 합니다) 대신 "모릅니다"라고 말하도록 프로그래밍되어 있습니다. 이는 훨씬 더 안전하고 신뢰할 수 있는 방식입니다.

실험에서 이 새로운 접근 방식은 기존의 가장 뛰어난 방법들보다 현저히 우수한 성능을 보였습니다. 도전적인 장기 영상 테스트 세트에서, ViSAGE는 기존의 가장 강력한 시스템보다 정확도를 5.9% 향 향상시켰습니다. 구체적으로, 로봇 관련 영상 작업에서 45.5%, 웹 기반 영상 작업에서 58.4%, 그리고 Video-MME-long 벤치마크에서 무려 **79.1%**의 점수를 기록했습니다. 연구진은 메모리 오류를 수정함으로써 AI가 단순히 질문에 더 많이 맞히는 것뿐만 아니라, 누가 무엇을 하고 있는지 혼동하는 것과 같은 위험한 실수를 멈추고, 정보가 부족할 때 이를 인정하는 능력이 훨씬 좋아졌음을 보여주었습니다. 이는 AI가 진정으로 긴 이야기를 이해하기 위해서는 정적인 사실의 목록이 아니라, 성장하고 변화하며 스스로 수정할 수 있는 메모리가 필요함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →