← 최신 논문
💻 computer science

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop 는 텍스트 쿼리와 시간적 다양성 점수를 활용하여 디코더 레이어 내에서 중복된 오디오비주얼 토큰을 점진적으로 제거함으로써 지연 시간과 메모리 사용량을 크게 줄이면서도 기존 베이스라인보다 뛰어난 성능을 보이는 오미모달 LLM 을 위한 학습 불필요한 레이어별 토큰 가지치기 프레임워크입니다.

원저자: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 비디오를 보며 동시에 오디오를 들을 수 있는 초지능 로봇 어시스턴트(「Omni-LLM」)를 상상해 보세요. 당신은 이 로봇에게 "배경에서 누가 노래하고 있나요?" 또는 "차의 색깔은 무엇인가요?"와 같은 질문을 던집니다.

문제는 고품질 비디오와 오디오가 거대한 데이터 홍수처럼 작용한다는 점입니다. 단 1 분짜리 비디오만으로도 로봇은 10,000 개 이상의 작은 정보 조각(「토큰」이라고 함) 을 처리해야 합니다. 이 모든 것을 한 번에 처리하려는 시도는 소방 호스에서 물을 마시려는 것과 같습니다. 느리고, 많은 에너지를 소모하며, 로봇을 둔하게 만듭니다.

이를 해결하기 위해 과학자들은 보통 로봇이 사고를 시작하기 전에 비디오와 오디오의 "지루한" 부분을 미리 버리려 합니다. 소리와 그림이 동시에 발생한다면 반드시 관련이 있을 것이라고 가정합니다.

이 논문의 핵심 아이디어: "OmniDrop"
이 논문의 저자들은 "잠깐만요, 그 가정은 잘못되었습니다"라고 말합니다. 소리와 그림이 동시에 발생한다고 해서 그것이 당신의 특정 질문에 중요하다는 뜻은 아닙니다.

무엇을 즉시 버리는 대신, 그들은 OmniDrop이라는 새로운 시스템을 구축했습니다. 몇 가지 간단한 비유를 통해 그 작동 방식을 설명해 보겠습니다:

1. "느린 시작" 전략 (레이어별 가지치기)

로봇의 뇌를 다층 건물이라고 상상해 보세요.

  • 기존 방법: 당신은 정문(입력) 에 서서 누가 누구와 유사한지 보고 즉시 50% 의 사람들(데이터) 을 쫓아냅니다. 이는 위험한데, 정답을 알고 있는 한 사람을 쫓아낼 수도 있기 때문입니다.
  • OmniDrop 방법: 당신은 모든 사람을 건물 안으로 들어오게 합니다. 처음 몇 층(초기 레이어) 에서 모든 사람들은 어울리고 서로 대화합니다. 이를 통해 오디오와 비디오가 섞여 장면을 함께 이해할 수 있게 됩니다.
  • 반전: 그룹이 더 높은 층(심층 레이어) 으로 올라갈수록 로봇은 "아, 이 질문을 답하려면 특정 사람들과만 대화하면 되겠구나"라고 깨닫기 시작합니다. 그런 다음 로봇은 중요하지 않은 사람들에게는 부드럽게, 그리고 점차 강하게 떠나라고 요청하기 시작합니다. 이렇게 하면 로봇이 무엇을 찾아야 할지 알기 전에 "큰 그림"을 잃지 않도록 보장합니다.

2. "질문은 손전등과 같다" (쿼리 안내)

로봇은 누구를 남겨야 할지 어떻게 알까요?

  • 기존 방법: 오디오와 비디오를 보고 서로 어떤 것이 일치하는지 추측하려 합니다.
  • OmniDrop 방법: 텍스트 질문을 기반으로 손전등을 비춥니다.
    • "저 소리는 무엇인가요?"라고 묻는다면, 손전등은 오디오 토큰을 강조하고 비디오 토큰은 어둡게 만듭니다.
    • "셔츠의 색깔은 무엇인가요?"라고 묻는다면, 손전등은 비디오 토큰을 강조합니다.
    • 로봇은 손전등이 비추는 토큰은 유지하고 어둠 속에 있는 토큰은 버립니다. 이렇게 하면 가지치기가 지능적으로 이루어지고 특정 작업에 맞게 조정됩니다.

3. "중간을 건너뛰지 마라" 규칙 (시간적 다양성)

위험이 하나 있습니다: 로봇이 손전등이 비추는 토큰만 유지한다면, 나머지 모든 것을 잊어버려 이야기에서 "간극"이 생길 수 있습니다.

  • 해결책: OmniDrop은 시간적 다양성이라는 규칙을 추가합니다. 특정 순간이 가장 중요하지 않더라도 주요 사건과 시간적으로 멀리 떨어져 있다면, 로봇은 그 토큰이 남을 수 있도록 약간의 "보너스 점수"를 부여합니다.
  • 비유: 책을 읽는다고 상상해 보세요. 영웅이 말하는 문장만 유지한다면 배경 묘사를 놓치게 됩니다. OmniDrop은 "영웅의 대사는 유지하되, 이야기가 끊기지 않도록 그 사이의 조용한 부분에서도 몇 문장은 유지하라"고 말합니다.

결과

저자들은 다양한 비디오 및 오디오 테스트를 사용하여 인기 있는 모델인 Qwen2.5-Omni 에서 이를 테스트했습니다.

  • 속도: 로봇의 사고 속도를 40% 빠르게 만들었습니다 (대기 시간 감소).
  • 메모리: 14.7% 적은 메모리를 사용했습니다.
  • 지능: 놀랍게도 무엇을 버릴지 더 똑똑하게 판단함으로써, 무작위 데이터 덩어리를 버리는 다른 방법들에 비해 로봇이 실제로 질문에 대한 답변 능력이 향상되었습니다 (테스트 점수 최대 3.58 점 상승).

요약하자면:
OmniDrop은 영화에 대한 지능적인 편집자와 같습니다. 영화를 보기 전에 반으로 자르는 대신, 전체를 보게 한 후 당신의 특정 질문에 어떤 장면이 중요한지 정확히 파악한 다음, 보면서 나머지를 잘라냅니다. 이렇게 하면 줄거리 잃지 않고 빠르게 답을 얻을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →