← 최신 논문
🤖 AI

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

본 논문은 개체, 사건, 행동 유형에 걸쳐 기억 기반 추론을 테스트함으로써 장기 시점의 자기관점 영상 이해를 평가하도록 설계된 포괄적인 벤치마크인 EgoMemReason을 소개하며, 현재 멀티모달 모델들이 수일에 걸친 시간 간격에서 희소한 증거를 통합하는 데 심각한 어려움을 겪고 있음을 밝힙니다.

원저자: Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 일주일 내내 24 시간 내내 당신의 삶을 기록하는'스마트 글래스'한 켤레를 막 구매했다고요. 당신은 이를 착용한 채 먹고, 일하고, 자고, 친구들과 어울립니다. 이제 누군가가 그 주에 대해 질문을 한다고 가정해 보세요. "오늘 이전에 프로젝터실에서 했던 마지막 그룹 활동은 무엇이었나요?" 또는 "그 특정 주황색 테이블에서 피자를 먹은 횟수는 몇 번이었나요?"

이 질문에 답하려면 지금 일어나고 있는 일만 보면 안 됩니다. 며칠 치의 기억을 파헤쳐 올바른 순간들을 찾아내고, 이를 연결해야 합니다.这正是 논문 EGOMEMREASON이 다루는 과제입니다.

연구자들이 수행한 작업을 일상적인 비유를 사용해 간단히 설명해 드리겠습니다.

1. 문제: "Haystack 속의 바늘"이 실제로는 "일주일 치 건초 속의 바늘"입니다

현재의 AI 모델은 짧은 비디오 클립 (예: 10 초짜리 틱톡) 을 보고 무슨 일이 일어났는지 말해 주는 데는 뛰어납니다. 하지만 일주일 치에 달하는 비디오를 주면 AI 는 길을 잃습니다.

  • 옛날 방식: 대부분의 기존 AI 테스트는 "이 5 초짜리 클립에서 사람이 입고 있던 셔츠 색은 무엇이었나요?"라고 묻는 것과 같습니다. 답은 바로 눈앞에 있습니다.
  • 새로운 도전: 연구자들은 "아니요, 더 어렵게 만들어 보죠"라고 말합니다. 그들은 AI 가 3 일 전에 일어난 일을 기억할 수 있는지, 시간이 지남에 따라 사물이 어떻게 변했는지 추적할 수 있는지, 혹은 일주일 내내 흩어진 작은 단서들을 바탕으로 당신의 습관을 파악할 수 있는지 테스트하고 싶어 합니다.

2. 해결책: AI 를 위한"기억 운동실"

이 팀은 EGOMEMREASON이라는 새로운 테스트를 만들었습니다. 이를 서로 다른 유형의 정신 근육을 테스트하도록 설계된 세 가지 기계를 갖춘 운동실로 생각하세요. 연구자들은 이를"기억 유형"이라고 부릅니다.

  • 기계 1: "사물 추적기" (개체 기억)

    • 비유: 좋아하는 커피 머그잔이 있다고 상상해 보세요. 1 일에는 주방 카운터에 있고, 3 일에는 싱크대에 있으며, 5 일에는 식기세척기에 있습니다.
    • 테스트: AI 는 일주일 내내 그 특정 머그잔을 추적해야 합니다. 단순히"머그잔이 보입니다"라고 말해서는 안 됩니다."그 머그잔은 카운터에서 시작해 싱크대로 이동했고, 결국 식기세척기에 들어갔습니다"라고 말해야 합니다.
    • 도전 과제: AI 는 종종 어느 머그잔이 어느 것인지 혼동하거나, 그 상태의 작은 변화를 놓칩니다.
  • 기계 2: "타임라인 정리사" (사건 기억)

    • 비유: 바쁜 한 주 동안 일어난 사건들의 순서를 기억하려고 노력한다고 상상해 보세요. 바베큐를 하기 전에 영화를 봤나요, 나중에 봤나요?
    • 테스트: AI 는 서로 다른 날에 일어난 사건들의 목록을 제시받고, 이를 올바른 연대기 순서로 배열해야 합니다. 또한"어제 점심 식사 전에 프로젝터실에서 마지막으로 한 일은 무엇이었나요?"와 같은 질문에 답해야 합니다.
    • 도전 과제: 사건들이 몇 시간이나 며칠 간격으로 떨어져 있을 때, AI 는 타임라인을 올바르게 유지하는 데 어려움을 겪습니다. 종종 순서를 혼동하거나 이전 사건들을 잊어버립니다.
  • 기계 3: "패턴 탐정" (행동 기억)

    • 비유: 점심 식사를 마칠 때마다 보통 소파에 앉아 책을 읽는다는 것을 알아차렸다고 가정해 보세요. 매일 하는 것은 아니지만, 충분히 자주 일어나서"습관"이라고 할 수 있습니다.
    • 테스트: AI 는 일주일 전체를 살펴보고 당신의 습관을 파악해야 합니다."당신은 보통 어디서 점심을 먹나요?"또는"점심 식사 직후에 무엇을 하나요?"
    • 도전 과제: AI 는 일회성으로 이상했던 날들을 무시하고, 노이즈 속에 숨겨진 반복되는 패턴을 찾아내야 합니다.

3. 결과: AI 는 여전히"신생아"입니다

연구자들은 이 새로운"기억 운동실"에서 GPT-5, Gemini 등 주요 이름들을 포함한 17 개의 다양한 고급 AI 모델을 테스트했습니다.

  • 점수: 가장 똑똑한 AI 모델조차 정답의 약 40% 만 맞췄습니다. 이는 가장 어려운 질문들 중 일부에 대해 무작위로 추측하는 것보다 겨우 나을 뿐입니다.
  • 실패 이유:
    • "시각적 기반"문제: AI 는 비디오를 보지만, 냉장고 문을 열어 무언가를 넣었는지 아니면 꺼냈는지와 같은 미세한 세부 사항을 놓칩니다.
    • "장거리"문제: AI 는 10 분 전에 일어난 일을 기억하는 데는 뛰어나지만, 이틀 전에 일어난 일은 잊어버립니다.
    • "패턴"문제: AI 는 비디오를 요약할 수 있습니다 ("우리는 점심을 먹었습니다"). 하지만 미묘한 습관을 파악하는 데는 서툴러요 ("우리는 항상 주황색 테이블에서 점심을 먹습니다").

4. 그들이 시도한 것 (그리고 왜 작동하지 않았는지)

연구자들은 다음과 같은 방법으로 AI 를 돕기 위해 노력했습니다.

  • 더 많은 프레임을 제공하기: 비디오에서 더 많은 이미지를 AI 에게 보여줍니다. 결과: 큰 도움이 되지 않았습니다. AI 는 여전히 시간의 흐름에 따라 점들을 연결하지 못했습니다.
  • 텍스트 대본을 제공하기: 사람들이 말한 대본을 읽게 합니다. 결과: 큰 도움이 되지 않았습니다. 문제는 AI 가 읽을 수 없어서가 아니라, 시각적 사건들을 기억하고 연결하지 못했기 때문입니다.
  • "단계별로 생각하라"고 요청하기: AI 에게 추론 과정을 설명하도록 지시합니다. 결과: 오히려 상황을 더 악화시켰습니다! AI 는 자신의 긴 설명에 혼란을 느꼈습니다.

결론

이 논문은 AI 가 쓸모없다고 말하는 것이 아닙니다. AI 가"보고" "읽는" 능력은 점점 나아지고 있지만, 장기 기억에 대해서는 여전히 형편없다고 말하고 있습니다.

일주일이나 한 달 동안 당신의 삶을 도와줄 수 있는 AI 비서를 원한다면, AI 를 단순히"더 크게"만들거나 더 많은 텍스트를 읽게 해서는 안 됩니다. 우리는 인간이 기억을 저장, 조직, 검색하는 방식을 가르쳐야 합니다. 이 문제를 해결할 때까지, AI 는 지난 화요일에 일어난 일을 계속 잊어버릴 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →