TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation
TRACE 는 OCR 과 객체 감지를 통해 검색 가능한 타임라인을 구축하여 시각적 추론 전에 정밀하고 쿼리를 인지한 증거 위치 파악을 가능하게 함으로써 다중 비디오 이벤트 이해 및 주장 생성을 강화하는 증거 기반 안내 프레임워크로, MAGMaR 2026 과 같은 벤치마크에서 사실적 완전성, 인용 회수율 및 최첨단 성능을 크게 향상시킵니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
마치 거대한 폭풍에 관한 미스터리를 해결하려는 형사가 되어 상상해 보세요. 당신은 다양한 뉴스 채널, 소셜 미디어, 정부 방송에서 나온 수천 시간 분량의 영상 자료를 보유한 도서관을 가지고 있습니다. 상사는 당신에게 구체적인 질문을 던집니다: "실종자는 몇 명이며, 정부가 구호 물자를 보냈습니까?"
만약 당신이 표준 AI(즉, '구식 방식'으로 설명된 것들)였다면, 이 영상 자료들의 거대한 뭉치를 건네받으며 "모두 읽어보고 답을 알려라"라는 지시를 받았을 것입니다. 문제는 무엇일까요? AI 는 압도당합니다. 모든 단계를 시청하려 하지만, 한 번에 그토록 많은 정보를 '뇌'에 담을 수 없기 때문에 영상을 빠르게 넘기게 됩니다. 그렇게 하는 과정에서, 폭풍의 극적인 장면 자체를 보느라 바빠서 뉴스 티커에 흐릿하게 적힌 "실종자 300 명"이나 구호 물자 수치를 보여주는 스코어보드 같은 작고 결정적인 세부 사항들을 놓치게 됩니다.
TRACE는 이를 해결하는 새롭고 더 지능적인 방법입니다. 저자들은 이를 "추론 전 근거 확보 (Ground-Before-Reasoning)" 전략이라고 부릅니다. 다음과 같이 생각해보세요:
문제: "맹목적인 탐색"
현재의 AI 모델은 소란스러운 방에 들어와 가장 큰 목소리만 듣고 한 가지 특정 사실을 찾으려 하는 형사와 같습니다. 그들은 실제로 답을 담고 있는 속삭임 (화면의 텍스트) 을 놓칩니다. 또한 방이 너무 크면 지쳐버립니다 (즉, '컨텍스트 예산'이 부족해집니다).
TRACE 의 해결책: "먼저 색인 만들기" 접근법
영상을 맹목적으로 시청하는 대신, TRACE 는 형사가 읽기를 시작하기 전에 검색 가능한 색인을 먼저 만드는 사서처럼 행동합니다.
다음은 단계별 과정입니다:
1. "스캐너" (근거 확보)
AI 가 '생각'하거나 '추론'을 시도하기 전에, 먼저 영상 위에 빠르고 저렴한 스캐너를 실행합니다.
- 작동 방식: 화면의 텍스트 (뉴스 티커나 스코어보드 등) 를 읽는 OCR(광학 문자 인식) 과 마이크, 연단, 군중 같은 사물을 식별하는 객체 감지라는 두 가지 간단한 도구를 사용합니다.
- 비유: 로봇이 책의 모든 페이지를 빠르게 넘기며 본 모든 숫자, 이름, 사물과 그것을 본 시간을 적어 목록으로 만드는 상황을 상상해 보세요. 아직 이야기를 이해하려 하지 않습니다. 그저 텍스트 기반 타임라인을 구축할 뿐입니다.
- 도움 되는 이유: 이는 지저분한 영상을 깔끔하고 검색 가능한 사실 목록으로 변환합니다.
2. "검색 엔진" (위치 특정)
이제 인간 (또는 사용자) 이 질문을 합니다: "실종자 관련 정보는 어디에 있나요?"
- 작동 방식: 매우 빠르고 저렴한 텍스트 전용 AI 가 1 단계에서 생성된 검색 가능한 타임라인을 살펴봅니다. 질문을 숫자와 사물 목록과 매칭합니다.
- 비유: 책 전체를 다시 읽는 대신, 사서가 색인을 사용하여 "아, 답은 45 페이지, 82 페이지, 110 페이지에 있군요"라고 말합니다. 책의 나머지는 무시합니다.
- 도움 되는 이유: 관련 없는 장면들에 시간을 낭비하지 않고 중요한 정확한 순간들을 찾아냅니다.
3. "이야기꾼" (주장 생성)
이제 강력한 영상 AI(즉, '이야기꾼') 가 작업을 시작합니다.
- 작동 방식: 2 단계에서 식별된 특정 영상 클립과 색인에서 나온 메모만 전달받습니다. "이 특정 순간들을 보고 사실을 알려라"라고 지시받습니다.
- 비유: 형사에게는 이제 책의 관련 페이지 세 장만, 중요한 숫자가 강조된 채로 건네집니다. 완벽한 정확한 보고서를 작성하기 위해 그 페이지들에 100% 집중할 수 있습니다.
- 결과: AI 는 주장 (예: "실종자 300 명") 을 생성하고, 결정적으로 그 사실을 증명한 정확한 영상 클립을 인용합니다.
4. "편집자" (통합)
10 개의 다른 영상이 있었다면, 10 개의 약간 다른 보고서가 나올 수 있습니다.
- 작동 방식: 마지막 단계에서 이러한 보고서들을 통합합니다. 영상 A 가 "실종자 300 명"이라고 하고 영상 B 도 "실종자 300 명"이라고 하면, 시스템은 이를 하나의 강력한 사실로 병합하고 두 영상 모두의 인용을 유지합니다.
- 비유: 편집자가 모든 다른 기자들의 메모를 취합하여 서로 일치하는지 확인한 후, 모든 단일 출처를 인정하는 하나의 최종 권위 있는 기사를 작성합니다.
왜 이것이 중요한가 (결과)
이 논문은 실제 뉴스 사건 (MAGMaR 2026) 에서 이 시스템을 테스트하여 다음과 같은 결과를 발견했습니다:
- 더 많은 사실을 발견했습니다: 텍스트 오버레이에 숨겨진 작은 세부 사항들을 놓치지 않았습니다.
- 더 나은 인용을 제공했습니다: 자신의 주장을 증명한 정확한 영상 증거를 가리키는 능력이 훨씬 뛰어났습니다 ('인용 회상률'을 크게 향상시켰습니다).
- 더 정확했습니다: 이전 최고 시스템들을 압도적인 차이로 능가했습니다.
결론
TRACE 는 다음과 같이 말함으로써 게임의 규칙을 바꿉니다: "한 번에 전체 영상을 이해하려 하지 마라. 먼저 단서를 찾기 위해 스캔하고, 그 단서들을 이용해 답을 찾아라." 이는 혼란스럽고 압도적인 작업을 구조화된 단계별 조사로 변환하여, 진실을 담고 있는 작지만 결정적인 세부 사항들을 AI 가 놓치지 않도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.