← 최신 논문
🤖 AI

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus는 오디오 및 비디오 토큰의 중요도를 독립적으로 추정하여 모달리티 대칭적 압축을 달성함으로써, 교차 모달 정렬을 보존하면서도 추론 비용을 줄이고 정확도-효율성 트레이드오프 측면에서 기존 베이스라인을 능가하는 옴니모달 거대 언어 모델을 위한 훈련 불필요 쿼리 가이드 토큰 압축 방식이다.

원저자: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 비디오를 보고 동시에 오디오를 들을 수 있는 초지능형 로봇 비서(옴니모달 거대 언어 모델)가 있다고 상상해 보세요. 이 로봇은 매우 유능하지만 한 가지 문제가 있습니다. 긴 비디오와 소리가 담긴 영상을 보여주면, 로서 모든 단어를 읽으려 하고 비디오의 모든 프레임을 보려고 한다는 점입니다. 이는 마치 어떤 장면에서 하늘색이 무엇이었는지에 대한 간단한 질문에 답하기 위해 백과사전 전체를 읽으려는 것과 같습니다. 이 때문에 로봇은 느려지고, 실행 비용이 많이 들며, 너무 많은 정보에 압도당하게 됩니다.

이 논문은 이 로봇이 재학습 없이도 더 빠르고 똑똑해질 수 있도록 돕는 OmniFocus라는 새로운 방법을 소개합니다. 이 방법이 어떻게 작동하는지 쉬운 비유를 통해 설명해 드리겠습니다.

문제점: "불균형한" 가이드

기존 연구자들은 비디오나 오디오에서 "지루한" 부분을 무시하도록 하여 로봇의 속도를 높이려 노력했습니다. 하지만 그들은 보통 한 가지 감각만을 사용하여 무엇을 무시할지 결정했습니다.

  • 결함: 당신이 요리 프로그램을 보고 있다고 상상해 보세요. 만약 당신이 영상의 중요한 부분을 결정하기 위해 오직 셰프의 목소리에만 귀를 기울인다면, 셰프가 아직 언급하지 않았다는 이유로 중요한 시각적 단계(예: "냄비가 끓고 있다")를 놓칠 수 있습니다. 반대로, 오직 영상만 본다면 음식이 타고 있다는 것을 알려주는 미세한 소리(예: 지글거리는 팬 소리)를 놓칠 수 있습니다.
  • 결과: 로봇은 오디오 질문에는 잘 대답하지만 비디오 질문에는 서툴러지거나, 그 반대의 상황이 발생하게 됩니다. 즉, 가이드로 사용하는 감각에 "편향"되는 것입니다.

해결책: OmniFocus (질문 탐정)

OmniFocus는 질문(쿼리)을 먼저 듣고 무엇을 남길지 결정하는 탐정처럼 행동함으로써 이 문제를 해결합니다.

  1. 질문을 먼저 듣기:
    OmniFocus는 무엇이 중요한지 추측하는 대신, 당신의 질문을 먼저 살핍니다. 만약 당신이 "발표자가 예산에 대해 뭐라고 말했나요?"라고 묻는다면, 탐정은 오디오에 집중해야 함을 압니다. 만약 "자동차 색깔이 무엇이었나요?"라고 묻는다면, 비디오에 집중해야 함을 압니다.

  2. 두 개의 별도 팀 (모달리티 균형):
    이 방법은 비디오와 오디오를 두 개의 별도 팀으로 취급합니다. 그리고 팀 비디오에게는 "이 영상의 어느 부분이 질문과 일치하는가?"라고 묻고, 팀 오디오에게는 "이 오디오의 어느 부분이 질문과 일치하는가?"라고 묻습니다.

    • 비유: 당신이 여행을 위해 캐리어를 싸고 있다고 상상해 보세요. 대신 "옷" 서랍에서 모든 것을 꺼내거나 "신발" 서랍에서 모든 것을 꺼내는 대신, 당신의 여행 일정(질문)을 확인합니다. 당신은 하이킹에 필요한 특정 신발과 비에 대비한 특정 재킷을 챙깁니다. 서랍 전체를 다 채우는 것이 아니라, 오직 그 여행에 필요한 것들만 챙기는 것입니다.
  3. "이중 점수" 선택:
    탐정이 어떤 시간대의 덩어리(chunk)가 중요한지 알게 되면, 두 가지 규칙을 사용하여 유지할 특정 "토큰"(데이터 조각)을 선택합니다.

    • 규칙 A (악수/조화): 비디오와 오디오가 서로 일치하거나 맞물리는 부분(예: 문이 닫히는 시각적 모습과 문이 쾅 닫히는 소리가 일치하는 경우)을 유지합니다.
    • 규칙 B (두드러짐): 다른 감각의 신호가 없더라도, 각자의 카테고리 내에서 독특하거나 강렬한 부분(예: 오디오에서의 매우 뚜렷한 소리, 또는 비디오에서의 밝은 섬광)을 유지합니다.

결과: 더 빠르고 더 똑똑하게

연구진은 이 방법을 Qwen2.5-Omni 제품군(로봇)에 테스트했습니다.

  • 효율성: 질문과 맞지 않는 "지루한" 부분들을 버림으로써, 로봇은 1.38배 더 빠르게 작동하며 메모리를 적게 사용합니다.
  • 정확도: 데이터의 75%를 버렸음에도 불구하고(25%만 유지), 로봇은 이전 방식들보다 실제로 질문에 더 잘 대답했습니다. 비디오와 오디오 양쪽에서 가장 중요한 단서들을 모두 유지했기 때문에 "상식"을 잃지 않았던 것입니다.

요약

OmniFocus는 로봇 앞에 앉아 있는 스마트한 필터와 같습니다. 단순히 한 가지 감각에 의존해 데이터를 무작정 삭제하는 대신, 질문을 듣고 비디오와 오디오를 각각 확인한 뒤, 양쪽 모두에서 가장 관련 있는 "단서"만을 남깁니다. 이를 통해 로봇은 더 빠르고, 저렴하게 운영될 수 있으며, 불필요한 소음에 방해받지 않기에 놀라울 정도로 더 정확해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →