LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
LongVT 는 새로 큐레이션된 대규모 데이터셋 (VideoSIAH) 과 기존 베이스라인을 크게 능가하는 3 단계 학습 전략을 지원받아 네이티브 툴 호출을 활용하여 글로벌에서 로컬로 이어지는'멀티모달 체인 - 오브 - 툴 - 씽크'프로세스를 수행함으로써 장편 비디오 추론을 강화하는 엔드 - 투 - 엔드 에이전트 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
LongVT 논문에 대한 설명을 일상적인 언어와 창의적인 비유로 번역한 것입니다.
큰 문제: "건초더미 속의 바늘" 비디오
2 시간짜리 영화를 하나 받아서 아주 구체적인 질문을 받았다고 상상해 보세요. "주인공이 43 분 지점에서 신발을 묶을 때 신은 양말의 색상은 무엇이었습니까?"
요약문을 읽거나 무작위 스크린샷 몇 장을 훑어보면서 이 질문에 답하려 한다면, 틀릴 가능성이 매우 높습니다. 이것이 현재 AI 모델들이 긴 비디오를 대할 때 직면하는 문제입니다. 특정 순간을 자세히 살펴보기보다는 전체 비디오를 한 번에 기억하려다 보니, 실제로 보지 않은 세부 사항을 만들어내는 "환각(hallucination)" 현상을 일으키는 경향이 있습니다.
해결책: LongVT(수사관 AI)
저자들은 LongVT라는 새로운 시스템을 개발했습니다. 전체 비디오를 외우려 하는 대신, LongVT는 수사관이나 인간 연구원처럼 행동합니다.
다음은 간단한 비유를 통해 그 작동 방식을 설명한 것입니다:
1. "대략적인 스캔"(도서관 검색)
거대한 도서관에서 특정 책을 찾고 있다고 상상해 보세요. 모든 책의 모든 페이지를 읽지는 않습니다. 먼저 복도를 따라가며 책등만 훑어보아 책이 있을 만한 대략적인 구역을 찾습니다.
- 논문에서: LongVT 는 먼저 비디오를 "전체적으로 훑어보는(global skim)" 작업을 수행합니다. 전체 비디오에 걸쳐 분산된 몇몇 프레임들을 살펴보고 무슨 일이 일어나고 있는지 대략적인 맥락을 파악합니다.
2. "도구 호출"(현미경)
수사관이 *"양말을 묶은 장면은 아마도 부엌 장면일 거야"*라고 생각하면, 단순히 추측하지 않습니다. 그는 현미경을 꺼내 오직 그 특정 부엌 장면에만 초점을 맞춰 자세히 살펴봅니다.
- 논문에서: 이것이 "네이티브 도구 호출(Native Tool Calling)"입니다. LongVT 에는
crop_video라는 내장 도구가 있습니다. 답이 40 분에서 45 분 사이에 있을 것이라고 판단하면, 실제로 그 5 분 분량의 비디오 조각을 잘라내어 고해상도로 다시 검토합니다.
3. "자기 수정"(잠깐, 다시 확인해 볼까)
때로는 수사관이 잘못된 장면을 확대해 보기도 합니다. 신발을 묶은 장면이 부엌에서 일어난 것으로 생각했지만, 실제로는 거실에서 일어났을 수도 있습니다.
- 논문에서: 논문은 LongVT 가 *"아, 내가 잘못된 시간대를 봤구나. 거기에 신발이 없네"*라고 깨닫는 것을 보여줍니다. 그런 다음 *"다시 해보자"*라고 말하며 도구를 두 번째로 호출하여 다른 시간 (예: 41 분 대신 43 분) 을 살펴봅니다. 이를 iMCoTT(Interleaved Multimodal Chain-of-Tool-Thought, 교차 멀티모달 도구 사고 체인) 라고 합니다.
학습: AI 가 어떻게 사고하는 법을 배웠는지
AI 에게 단순히 "수사관이 되어라"라고 말한다고 해서 작동하지는 않습니다. 저자들은 3 단계 학습 과정을 통해 이를 가르쳤습니다:
- 콜드 스타트 (교실): 먼저, 저자들이 만든 VideoSIAH라는 거대한 데이터셋을 사용하여 AI 에게 기초를 가르쳤습니다. 이 데이터셋은 "건초더미 속의 바늘" 질문으로 가득 차 있습니다. AI 에게 시간을 추측하고 비디오를 확인하며 스스로 수정하는 방법의 예시들을 보여주었습니다. 이는 학생들에게 도서관 카탈로그 사용법을 가르친 후 자유롭게 내보내는 것과 같습니다.
- 강화 학습 (연습장): 다음으로, AI 가 스스로 연습하게 했습니다. 올바른 시간을 추측하고 정답을 맞출 때마다 "보상"을 받았습니다. 틀리게 추측하거나 환각을 일으켰을 때는 보상을 받지 못했습니다. 이를 통해 AI 는 더 정밀해지도록 학습했습니다.
- 정제 (마스터 클래스): 마지막으로, 연습장에서 AI 가 낸 최고의 시도들을 가져와 새로운 교재로 사용하여 다시 가르쳤습니다. 이는 AI 의 기술을 공고히 하여 더 빠르고 신뢰할 수 있게 만들었습니다.
결과: 새로운 종류의 "사고"
이 논문은 이 접근 방식이 AI 가 긴 비디오를 처리하는 방식을 바꾼다고 주장합니다.
- 기존 방식: AI 는 비디오를 "기억"하려다 압도되어 종종 사실을 만들어냅니다 (환각).
- LongVT 방식: AI 는 모른다고 인정하고 증거를 찾습니다 (비디오를 잘라내어), 증거를 확인한 후 그런 다음 답을 내놓습니다.
핵심 요약:
LongVT 는 기억에서 답을 "추측"하려 하지 않는 AI 입니다. 대신 답을 찾는 법을 배웁니다. 긴 비디오를 건초더미로 간주하고, 바늘을 찾기 위해 도구를 사용하며, 말을 하기 전에 자신의 작업을 이중으로 확인합니다. 이로 인해 정확도가 훨씬 높아졌고, 본인이 보지 않은 것에 대해 거짓말을 할 가능성은 줄어듭니다.
논문은 또한 이러한 추가적인 "살펴보기" 작업에도 불구하고, AI 는 실제로 다른 모델들보다 더 빠르다고 지적합니다. 보지 않은 것에 대해 길고 지어낸 이야기를 쓰는 시간을 낭비하지 않기 때문입니다. 그저 진실을 찾아 답할 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.