CuriosAI Submission to the CASTLE Challenge at EgoVis 2026
CuriosAI 팀은 EgoVis 2026 의 CASTLE 챌린지를 위해 SVA 와 TMKG 두 가지 접근법을 제시하며, 600 시간 이상의 동기화된 다중 시점 1 인칭 비디오에서 파생된 185 개의 객관식 질문에 대해 Search-Verify-Answer 3 단계 파이프라인을 통해 리더보드 정확도 0.50 을 달성했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
12 명이 함께 생활하며 15 개의 서로 다른 카메라로 동시에 촬영된 600 시간 분량의 영상 자료를 바탕으로 거대한 미스터리를 해결하려 한다고 상상해 보세요. 도전 과제는 무엇일까요? 무슨 일이 일어났는지, 누가 그것을 했는지, 그리고 언제 일어났는지에 관한 185 개의 구체적인 객관식 질문에 답하는 것입니다.
이것이 바로 CASTLE 챌린지이며, 소프트뱅크 (CuriosAI) 팀은 인공지능을 이용해 이 문제를 해결하기 위해 두 가지 다른 방식을 시도했습니다. 그들은 이 방법들을 SVA와 TMKG라고 부릅니다.
다음은 이 방법들이 어떻게 작동했는지에 대한 간단한 설명입니다:
공통된 기반: "도서관"
질문을 해결하기 전에, 두 방법 모두 먼저 방대한 영상의 조직화된 도서관을 구축했습니다. 그들은 단순히 원본 영상을 시청한 것이 아니라, 이를 다섯 가지 유용한 계층으로 분해했습니다:
- 누가 누구인가: 12 명의 사람들을 식별합니다.
- 무슨 일이 일어나고 있는가: 장면들에 대한 캡션을 작성합니다.
- 어떤 사물이 있는가: 보드게임이나 주방 도구와 같은 특정 물건을 찾아냅니다.
- 무엇이 말해졌는가: 오디오를 전사하고 누가 말했는지 파악합니다.
- 타임라인: 각 사람의 행동 일정을 작성합니다.
두 방법 모두 이 동일한 "도서관"을 사용했지만, 정답을 찾기 위해 매우 다른 경로를 택했습니다.
접근법 A: SVA(검색 – 검증 – 답변)
비유: 엄격한 규칙집을 가진 형사
SVA 를 엄격한 조립 라인에서 일하는 세 명의 형사 팀으로 생각해 보세요:
- 검색 (정찰병): 먼저, 그들은 전체 도서관을 살펴보고 정답이 포함될 가능성이 높은 15 분 분량의 영상 구간을 추측합니다. 이를 통해 시간을 몇 시간에서 아주 작은 시간대로 좁힙니다.
- 검증 (회의론자): 이것이 가장 중요한 부분입니다. 그들은 그 15 분 구간을 더 작은 5 분 클립으로 분할합니다. 그리고 AI 에게 이 클립들을 살펴보게 하되, AI 가 거짓말 (환각) 을 하지 못하도록 엄격한 규칙집을 부여합니다.
- 규칙 1: 질문을 그대로 반복하지 마십시오.
- 규칙 2: 영상이 침묵하거나 비어 있다면, 모른다고 인정하십시오.
- 규칙 3: 무언가를 세었다면, 영상에서 정확히 어디에 있는지 지목해야 합니다.
- 규칙 4: 볼 수 없다면 사실을 만들어내지 마십시오.
- 답변 (심판): 마지막으로, 똑똑한 "심판" AI 가 회의론자가 수집한 모든 증거를 검토하고 (모호한 시각적 추측보다 오디오 인용문을 더 신뢰하며) 최종 답을 선택합니다.
결과: 이 방법은 매우 신중했습니다. 그들은 미스터리 하나당 약 28 번의 질문을 AI 에게 했지만, 정답을 맞춘 비율은 **50%**였습니다. 이것이 그들의 우승 제출작이었습니다.
접근법 B: TMKG(시간적 – 멀티모달 – 지식 – 그래프)
비유: 연결의 그물
TMKG 를 사실들의 거대한 3 차원 거미줄을 구축하는 것으로 생각해 보세요.
- 5 분마다 시스템은 누가 있었는지, 그들이 무엇을 말했는지, 그리고 어떤 사물이 보였는지를 포함한 모든 일이 일어난 "노드 (점)"를 생성합니다.
- 그 시스템은 누가 무엇을 했는지, 그들이 어디에 있었는지, 그리고 다음에 무슨 일이 일어났는지를 보여주는 끈 (엣지) 으로 이 점들을 연결합니다.
- 질문이 들어오면, 시스템은 이 그물에서 올바른 점들의 군집을 찾기 위해 검색합니다.
- 일단 위치를 찾으면, 시스템은 영상과 그물 데이터를 단일 AI에 넘겨 즉시 답변을 내도록 합니다.
결과: 이 방법은 더 빠랐으며 미스터리 하나당 약 1 번만 AI 에게 질문을 했지만, 정확도는 낮아 정답을 맞춘 비율이 **35%**에 불과했습니다.
주요 교훈
팀이 두 방법을 비교한 결과 명확한 교훈을 발견했습니다:
- **SVA(형사)**는 엄격함 때문에 승리했습니다. AI 가 자신의 작업을 재확인하고 사실을 만들어내지 않겠다는 엄격한 규칙을 따르도록 강제함으로써 어리석은 실수를 피했습니다.
- **TMKG(그물)**은 추가적인 "사실 확인" 층 없이 모든 것을 한 번에 처리하도록 단일 AI 에 의존했기 때문에 어려움을 겪었습니다.
결론:
이처럼 거대한 규모 (600 시간 분량의 영상) 에서는 단순히 더 똑똑한 데이터베이스를 구축하는 것만으로는 부족합니다. 비결은 검증에 있었습니다. "형사" 방식이 실행하는 데 더 많은 컴퓨팅 파워와 시간이 소요되었음에도 불구하고, 답변하기 전에 AI 에게 사실을 증명하도록 강요하는 추가 단계가 35% 점수와 50% 점수 사이의 차이를 만들었습니다.
팀은 두 방법 모두 때때로 시작점으로 잘못된 15 분 구간을 선택했기 때문에 실패했다고 지적했습니다. 하지만 그들은 올바른 구간을 찾을 수 있다면, "엄격한 검증자"를 추가하는 것이 올바른 답을 얻는 가장 좋은 방법이라고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.