Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval
본 논문은 LLM 을 활용하여 쿼리를 구체적인 도구 호출로 분해하고 불리언 연산자를 통해 그 결과를 병합하는 새로운 키프레임 검색 방법인 ToolMerge 를 소개하며, 새로 제안된 Molmo-2 Moments 벤치마크에서 경쟁력 있는 성능을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
4 시간짜리 영화를 상상해 보세요. 누군가 그 영화에 대해 매우 구체적인 질문을 한다면, 예를 들어 "노란색 재킷을 입은 남자가 강을 건너기 직전에 무엇을 하고 있었나요?"라고 묻는다면요.
이 질문에 답하기 위해 처음부터 끝까지 영화를 전체적으로 다시 본다면 시간이 영원히 걸릴 것입니다. 만약 몇 장의 무작위 프레임을 선택한다면 (사진 앨범을 넘기듯이), 아마도 정확한 순간을 놓치게 될 것입니다. 이것이 이 논문이 다루는 문제입니다: 영화를 전체적으로 보지 않고도, 정답을 담고 있는 긴 동영상의 정확한 몇 초를 어떻게 찾아낼 수 있을까요?
저자들은 ToolMerge라는 새로운 시스템을 제안합니다. 이것이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다.
1. 기존 방법의 문제점
이전 시스템들은 두 가지 방식으로 이 문제를 해결하려 했으나, 둘 다 결함이 있었습니다:
- "일률적 접근 (One-Size-Fits-All)": 전체 질문을 하나의 거대한 검색어로 취급했습니다. 마치 사서에게 "노란색 재킷을 입고 강을 건너는 남자가 있는 페이지를 찾아주세요"라고 요청하는 것과 같습니다. 사서는 강이 있는 페이지나 남자가 있는 페이지를 찾을 수는 있지만, 반드시 올바른 조합을 찾아내지는 못할 수 있습니다.
- "경직된 체크리스트 접근": 질문을 고정된 객체 목록으로 분해하려 했습니다 (예: "남자 찾기", "재킷 찾기", "강 찾기"). 하지만 현실은 복잡합니다. 때로는 행동을 찾아야 하고, 때로는 객체를 찾아야 하며, 때로는 특정 색상을 찾아야 합니다. 경직된 체크리스트는 이러한 뉘앙스를 놓칩니다.
2. 해결책: ToolMerge (스마트 탐정)
ToolMerge 는 사건을 해결하기 위해 다양한 도구를 사용하는 방법을 아는 스마트 탐정처럼 행동합니다. 거대한 도약으로 한 번에 정답을 찾으려 하는 대신, 탐정은 작업을 분할합니다.
1 단계: 플래너 (두뇌)
먼저, "플래너"(AI 두뇌) 가 질문을 읽습니다. 전체 문장을 검색하는 대신, 질문을 더 작고 구체적인 작업으로 분할합니다.
- 비유: 질문이 "노란색 재킷을 입은 남자는 무엇을 했나요?"라면, 플래너는 단순히 허공에 "노란색 재킷!"이라고 외치지 않습니다. 대신 이렇게 말합니다. "좋아, 나는 세 가지가 필요해: 1. 강이 있는 장면을 찾아라. 2. 노란색을 입은 남자를 찾아라. 3. 물을 건너는 사람을 찾아라."
2 단계: 도구들 (전문가들)
플래너는 이러한 작은 작업들을 서로 다른 "전문가" 도구들에게 보냅니다.
- 도구 A (SigLIP): 이는 장면 전문가입니다. "강", "협곡"과 같은 일반적인 분위기를 찾기 위해 전체 그림을 봅니다.
- 도구 B (T-REN): 이는 객체 전문가입니다. "남자", "노란색 재킷"과 같은 구체적인 사물을 찾기 위해 확대하여 봅니다.
- 도구 C (OCR): 이는 텍스트 리더입니다. 동영상 속 간판이나 화면에 쓰인 모든 단어를 읽습니다.
3 단계: 병합 (심판자)
이제 각 도구는 동영상의 모든 프레임을 자신의 특정 작업과 얼마나 잘 일치하는지에 따라 순위 매깁니다. "병합 (Merge)" 단계는 이러한 순위들을 결합합니다.
- "AND" 규칙: 질문이 강과 남자를 모두 필요로 한다면, 시스템은 두 도구 모두 높은 점수를 준 프레임을 찾습니다. 베enn 도표와 같습니다. 정답은 원들이 겹치는 중앙에 있어야 합니다.
- "OR" 규칙: 질문이 "그가 강을 건넜나요, 아니면 다리를 건넜나요?"라고 묻는다면, 시스템은 어느 조건이든 만족하는 프레임을 찾습니다.
마지막으로, 시스템은 이러한 결합된 규칙 전반에서 가장 높은 점수를 받은 상위 3 개에서 8 개의 프레임을 선택하여 실제 답변을 제공할 최종 "답변자" AI 에게 넘깁니다.
3. 새로운 테스트: Molmo-2 Moments (M2M)
자신들의 시스템이 작동함을 증명하기 위해, 저자들은 기존 테스트들이 불공평하다는 사실을 깨달았습니다. 이전 테스트들은 추측이나 동영상의 무작위 부분을 살펴봄으로써 답할 수 있는 질문들이었습니다.
그들은 **Molmo-2 Moments (M2M)**라는 새로운 테스트를 구축했습니다.
- 비유: 영화의 특정 10 초 클립만을 기반으로 시험지를 작성하는 선생님을 상상해 보세요. 선생님은 그 10 초 동안 정확히 무슨 일이 일어났는지 알고 있습니다. 학생이 정답을 맞힌다면, 그들은 반드시 그 특정 10 초를 보았을 것입니다. 영화의 나머지 부분에서 추측할 수는 없습니다.
- 이는 시스템이 정답을 맞혔다면, 실제로 올바른 프레임을 찾았음을 보장합니다.
4. 결과
ToolMerge 를 테스트했을 때:
- 이전 방법들보다 올바른 프레임을 찾는 데 더 뛰어났으며, 특히 여러 객체나 행위가 포함된 복잡한 질문에서 그랬습니다.
- **캡션 검색 (caption retrieval)**에서 특히 잘 수행되었습니다. 시스템에 장면의 길고 자세한 설명 (예: 캡션) 을 제공하면, ToolMerge 는 이전 방법들보다 그 설명과 일치하는 정확한 동영상 클립을 찾는 데 훨씬 뛰어났습니다.
- 또한, 특정 보상 시스템 (GRPO) 을 사용하여 플래너를 조금 "훈련"시키면, 어떤 도구를 사용해야 할지 더 잘 알게 되어 성능이 더욱 향상된다는 것을 보여주었습니다.
요약
ToolMerge는 긴 동영상 질문에 대한 답을 한 번에 추측하려 하지 않는 시스템입니다. 대신 프로젝트 매니저처럼 행동합니다: 질문을 작고 구체적인 작업으로 분할하고, 그 작업들을 서로 다른 전문 도구들에게 보내며, 그 결과를 결합하여 진실이 담긴 동영상의 정확한 몇 초를 찾아냅니다. 그들은 시간이 특정 순간에 고정된 더 엄격한 새로운 테스트를 만들어 이를 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.