← 최신 논문
💻 computer science

Results of the 1st Asynchronous CASTLE Challenge at the Joint Egocentric Vision Workshop in Conjunction with CVPR 2026

이 논문은 CVPR 2026과 연계하여 개최된 Joint Egocentric Vision Workshop에서 진행된 제1회 비동기 CASTLE 챌린지의 기여와 결과를 요약합니다.

원저자: Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tran

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tran

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

4일간의 휴가 동안 일어난 일을 단순히 하이라이트뿐만 아니라, 모든 대화, 움직인 모든 물건, 방 안의 아주 작은 변화까지도 기억해 내는 것을 상상해 보십시오. 동시에 열 명의 서로 다른 사람의 눈을 통해 관찰하면서 말입니다. 이것은 컴퓨터가 수천 시간의 영상을 입력받더라도 어려움을 겪는 종류의 기억력 테스트입니다. 인공지능 분야에서 연구자들은 일상의 기록을 담은 길고 각본 없는 녹화 영상을 보고, 마치 사람이 일기를 읽거나 영화를 본 것처럼 구체적인 질문에 답할 수 있는 시스템을 구축하기 위해 노력하고 있습니다. 과제는 엄청난 정보의 양과, 몇 시간 또는 며칠씩 떨어져 있을 수 있는 세부 사항들을 연결해야 하는 필요성에 있습니다. 만약 기계가 이 일을 배울 수 있다면, 결국 우리는 특정 순간을 찾기 위해 수년간의 개인 영상 속을 검색하거나 사람들이 살아가는 방식의 복잡한 패턴을 이해하는 데 도움을 받을 수 있을 것입니다.

우리가 이 문제를 해결하는 데 얼마나 가까워졌는지 테스트하기 위해, 한 연구 그룹은 CASTLE 챌린지라는 경진대회를 조직했습니다. 그들은 팀들에게 모든 세부 사항을 포착하기 위해 고속으로 촬영된 초고화질 영상이 담긴 방대한 데이터셋을 제공했습니다. 영상은 열 명의 참가자가 평범한 일상을 보내는 동안 착용한 카메라와, 방 안을 지켜보는 다섯 대의 고정 카메라로부터 얻은 것이었습니다. 데이터는 오디오, 심박수 모니터, 심지어 열화상 이미지까지 포함하여 매우 풍부했으며, 4일간의 활동에 대한 완전한 디지털 기록을 만들어냈습니다. 경쟁 팀들의 과제는 이론적으로는 단순하지만 실제로는 매우 어려웠습니다: 그들은 영상 속에서 일어난 일에 대한 185개의 객관식 질문에 답해야 했습니다. 이 질문들은 컴퓨터가 사람을 추적하고, 물건의 개수를 세고, 물건이 어디에 숨겨져 있는지 기억하며, 누가 먼저 케이크 한 조각을 먹었는지 혹은 마지막 날 누군가가 얼마나 빨리 차를 충전하고 있었는지와 같은 사건의 타이밍을 파악하는 능력을 요구했습니다.

네 팀이 이 도전에 나섰으며, 각기 다른 전략을 가져왔습니다. WDL로 알려진 우승 팀은 이 과제를 단서를 수집하는 탐정처럼 다루었습니다. 600시간의 영상을 한꺼번에 보려고 하는 대신, 그들의 시스템은 먼저 질문을 살펴보고 사람의 이름이나 특정 날짜와 같은 키워드를 찾았습니다. 그런 다음 이 단서들을 사용하여 나머지 부분은 무시하고 가장 관련성이 높은 영상 부분과 음성 전사 데이터만을 추출했습니다. 그들은 컴퓨터 모델이 발견한 증거에만 엄격하게 집중하도록 훈련시켰으며, 다중 샘플 자기 일관성(multi-sample self-consistency)을 통해 일관성을 확보하기 위해 각 질문에 대해 엄격하고, 균형 잡히고, 공격적인 프롬프트 변형을 실행했습니다. 이러한 접근 방식 덕분에 그들은 거의 58%의 정확도에 도달할 수 있었으며, 이는 185개 질문 중 약 108개를 맞혔음을 의미합니다.

또 다른 팀인 MARS는 더 상호작적인 접근 방식을 취했습니다. 그들은 다음 단계로 어떤 유형의 정보를 살펴볼지 결정하는 호기심 많은 에이전트처럼 행동하는 시스템을 구축했습니다. 만약 질문이 신체 활동에 관한 것이라면, 시스템은 특정 쿼리를 위해 심박수 데이터를 확인하는 것을 선택할 수 있습니다. 만약 누군가가 어디를 보고 있는지에 관한 것이라면, 시선 추적 데이터를 불러올 것입니다. 모든 것을 한꺼번에 처리하려 하기보다 검토할 증거를 동적으로 선택함으로써, 그들은 점수를 57%로 높였습니다. 세 번째 팀인 TAHAKOM은 정보들을 사람, 장소, 사물을 타임스탬프와 함께 연결하는 구조화된 관계 지도로 정리했습니다. 이를 통해 시스템에 사건 간의 연결 관계에 대한 구체적인 질문을 던질 수 있었고, 54.6%의 정확도를 달 achievement 했습니다. 마지막 팀인 CuriosAI는 컴퓨터가 이야기를 지어내는 것을 방지하는 데 집중했습니다. 그들은 시스템이 증거를 찾고, 이를 원본 영상과 대조하여 검증한 다음, 답변을 내놓아야 하는 엄격한 프로세스를 구축하여 모든 주장이 실제로 보거나 들은 것에 근거하도록 보장했습니다. 그들의 최선 방법은 49.7%의 정확도에 도달했습니다.

경진대회의 결과는 컴퓨터가 긴 영상을 이해하는 능력이 향 느는 중이지만, 여전히 갈 길이 멀다는 것을 보여줍니다. 상위 팀들은 질문의 절반 이상을 맞혔는데, 이는 무작위 추측보다는 상당한 발전이지만 여전히 절반 가까운 답을 놓쳤음을 의미합니다. 아마도 가장 드러나는 사실은 팀들이 모두 동일한 질문을 맞히지는 않았다는 점입니다. 네 팀의 정답을 합치면 176개의 질문을 해결할 수 있었으며, 아무 팀도 답하지 못한 질문은 단 9개뿐이었습니다. 이는 단일한 방법이 아직 완벽하지 않다는 것을 시사하지만, 서로 다른 접근 방식이 퍼즐의 서로 다른 조각들을 포착하고 있다는 것을 보여줍니다. 연구자들은 가장 큰 장애물이 여전히 엄청난 양의 데이터 속에서 길을 잃지 않고 충분한 증거를 커버하는 능력이라는 것을 발견했습니다. 시스템이 수백 시간의 영상 속을 항해할 수는 있지만, 긴 시간에 걸쳐 각본 없는 현실 세계의 사건들을 추론하는 과제는 여전히 어려운 문제입니다. 이 대회는 문제를 완전히 해결하지는 못했지만, 이러한 다양한 전략을 결합하는 것이 우리의 일상을 진정으로 이해하는 기계를 만드는 열쇠가 될 수 있음을 분명히 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →