OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
OmniReasoner는 옴니모달 LLM이 희소한 증거에 대한 고충실도 검사를 위해 "줌인(zoom-in)" 도구를 호출할 시점을 동적으로 결정함으로써 긴 오디오-비디오 스트림을 효율적으로 추론할 수 있게 하는 도구 사용 사후 학습 프레임워크로, 이는 시간적 일관성을 위한 새로운 TimeAnchor 메커니즘과 확장 가능한 학습을 위한 Temporal Augmented Data Engine에 의해 지원된다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
끝없이 이어지는 도서관에서 미스터리를 풀려고 노력하고 있다고 상상해 보세요. 이 도서관은 수천 권의 책으로 가득 차 있지만, 당신이 찾아야 할 단서는 아주 작습니다. 아마도 4,002페이지에 속삭여진 단 한 마디의 단어이거나, 12,500페이지 여백에 숨겨진 특정한 그림일 수도 있습니다. 만약 모든 페이지를 똑같은 속도로 읽으려 한다면, 당신의 뇌는 지칠 것이고, 전체를 서둘러 훑느라 미세한 디테일을 놓칠 수도 있습니다. 이것이 바로 컴퓨터가 긴 영상과 오디오를 이해하려고 할 때 직면하는 정확한 문제입니다. 컴퓨터는 '옴니모달(omni-modal)' 모델, 즉 보고 들을 수 있는 능력을 갖추고 있지만, 영상이 한 시간 길이일 때 가장 중요한 단서는 찰나의 소리나 아주 짧은 시각적 동작일 수 있습니다. 컴퓨터가 한 시간 전체를 고해상도로 처리하려고 하면 메모리가 부족해집니다. 반대로 모든 것을 빠르게 지나쳐 버리면 단서를 놓치게 됩니다. 과학자들은 컴퓨터에게 더 나은 탐정이 되는 법, 즉 전체 이야기를 빠르게 훑고, 수상한 부분을 포착한 다음, 그것이 정말 필요한 곳에서만 속도를 늦춰 자세히 살펴보는 법을 가르치기 위해 노력해 왔습니다.
여기에 새로운 '사고' 프레임워크인 OmniReasoner가 등장하여, 이 AI 탐정들에게 **'확대 버튼(zoom-in button)'**이라는 특별한 도구를 사용하는 법을 가르칩니다. OmniReasoner는 한 시간짜리 영상을 한꺼번에 응시하는 대신, 먼저 전체 타임라인을 책을 빠르게 넘기며 줄거리를 파악하듯 빠르고 저화질인 '훑어보기(glance)'를 수행합니다. 만약 답이 그곳에 있다고 판단되면 바로 답을 내놓습니다. 하지만 특정 인물이 특정 문구를 말하거나 어항에 물고기가 나타나는 것처럼, 특정 순간에 단서가 숨어 있다고 감지하면, 동작을 멈추고 **'확대(zoom-in)'**를 요청합니다. AI는 단 몇 초간의 고화질, 고속 클립을 요청한 뒤, 이 '확대된' 증거를 원래의 빠른 훑어보기와 함께 대조하며 퍼즐을 풀어나갑니다.
여기서 마법 같은 기술은 AI가 어디를 확대할지 아는 방법입니다. 과거에는 컴퓨터들이 '프레임(페이지 번호와 같은 개념)'을 세는 방식 때문에 어려움을 겪었습니다. 영상을 빠르게 재생하거나 느리게 재생하면 페이지 번호가 바뀌기 때문입니다. OmniReasoner는 TimeAnchor라는 영리한 시스템을 사용합니다. 이것은 페이지 번호가 아니라 시계 시간(예: "2분 49초를 보시오")을 기반으로 한 GPS 좌표와 같습니다. 이 덕분에 AI가 흐릿하고 빠르게 재생되는 버전을 보든, 결정체의 선명한 확대 버전을 보든, "2:49"는 항상 동일한 순간을 가리킵니다. 이는 AI가 큰 그림과 근접 촬영 사이를 전환할 때 길을 잃지 않도록 보장합니다.
AI에게 이 기술을 가르치기 위해, 연구진은 단순히 인간에게 모든 영상을 라벨링하게 하지 않았습니다. 그것은 시간이 너무 오래 걸리기 때문입니다. 대신 그들은 Temporal Augmented Data Engine을 구축했습니다. 이것은 짧은 클립들을 가져와 긴 영화로 꿰매고, 그 새로운 이음새 중 하나에 몰래 '단서'를 숨기는 영상 편집기라고 상상해 보세요. AI는 그 숨겨진 단서를 찾는 훈련을 받습니다. 때때로 AI는 전체 영화를 보고 그냥 추측하도록 지시받기도 하고, 때로는 확대 도구를 반드시 사용하도록 강요받기도 합니다. 시행착오(강화 학습) 과정을 통해, AI는 확대 도구를 사용하는 것이 더 높은 점수로 이어진다는 것을 배우지만, 그것이 실제로 필요할 때만 사용하도록 배웁니다.
결과는 이 접근 방식이 효과적임을 보여줍니다. 다양한 영상 및 오디오 과제를 통해 테스트했을 때, OmniReasoner는 특히 단서가 매우 희귀한 아주 긴 영상에서 정답을 찾는 능력이 현저히 향상되었습니다. 이 모델은 단순히 답을 맞히는 데 똑똑해진 것이 아니라, 효율적으로 변했습니다. 즉, 자신의 '두뇌 에너지'를 정말 중요한 순간에만 집중해서 사용하게 된 것입니다. 이 논문은 AI에게 모든 것을 똑같이 보라고 강요하는 대신, 언제 더 자세히 볼지를 결정하는 법을 가르침으로써, 이전에는 해결하기 너무 어려웠던 긴 오디오-비디오 스트림 속의 복잡한 미스터리를 풀 수 있다는 점을 시사합니다. 이는 AI가 단순히 영상을 보는 것을 넘어, 언제 멈추고 주의를 기울여야 할지를 정확히 아는, 실제로 영상을 '생각'하는 단계로 나아가는 발걸음입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.