LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
본 논문은 새로운 코덱 스트림 토큰화 전략, 통합된 3D RoPE 좌표계, 대규모 개방형 감독을 활용하여 비디오, 공간, 시간적 grounding 작업 전반에서 최첨단 성능을 달성하는 차세대 비전-언어 모델인 LLaVA-OneVision-2 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
30 분짜리 영화를 친구에게 설명하려는데, 보여줄 수 있는 사진이 고작 30 장뿐이라고 상상해 보세요.
대부분의 기존 AI 모델 (이 새로운 모델 이전의 것들) 은 안전을 택합니다. 30 장의 사진을 30 분에 균등하게 배치해 선택합니다. 즉, 1 분마다 한 장씩입니다. 만약 10 분과 11 분 사이에 무언가 흥미진진한 일이 발생한다면, AI 는 그 정확한 순간을 보지 않았기 때문에 그 장면을 완전히 놓쳐버립니다. 마치 1 분마다 스코어보드만 바라보며 빠른 템포의 축구 경기를 이해하려 하는 것과 같습니다; 골 장면은 놓치게 되죠.
LLaVA-OneVision-2는 규칙을 바꾸는 새로운 종류의'초관찰자'입니다. 이 모델은 동영상을 일련의 정적 스냅샷처럼 보는 대신, 동영상을 압축된 디지털 파일(휴대폰이 공간을 절약하기 위해 사용하는 그런 파일) 로 취급합니다.
간단한 비유를 들어 작동 방식을 설명해 보겠습니다:
1. "비트 비용"나침반
동영상을 압축할 때 (예: 원본 영화를 MP4 로 변환할 때), 컴퓨터는 움직임이 빠르거나 급격하게 변하는 부분 (예: 자동차 추락이나 춤추는 사람의 회전) 을 설명하는 데 더 많은 작업을 해야 합니다. 이러한 부분에 더 많은'디지털 에너지 (비트)'를 할당하는 것입니다. 반면, 아무 일도 일어나지 않는 지루한 부분 (예: 정적인 벽) 에는 매우 적은 에너지를 사용합니다.
LLaVA-OneVision-2 는이"에너지 지도"를 읽습니다.
- 기존 방식: "1 초를 보고, 1 초를 건너뛰고, 다시 보겠다."
- 새로운 방식: "지금 동영상 파일이 에너지를 많이 쓰고 있군. 액션이 강렬하니까! 여기에 집중하겠다. 여기는 에너지가 낮으니 이 부분은 건너뛰겠다."
이 모델은 에너지를 골고루 분산시키는 대신, 액션이 발생하는 정확한 위치에'두뇌 능력 (토큰)'을 집중시킵니다.
2. "운동 탐정"
이 모델은'잔차 (residuals)'도 찾습니다. 사람이 걷는 동영상을 보고 있다고 상상해 보세요. 배경 (방) 은 그대로 유지됩니다. 이 모델은"매 프레임마다 방을 다시 설명할 필요는 없다"고 깨닫습니다. 오직 변화된 부분 (움직이는 사람) 에만 주의를 기울입니다.
이 모델은 가장 중요한 움직이는 부분들을 효율적으로 이어 붙여"시각적 캔버스"를 만듭니다. 이를 통해 지루하고 반복적인 부분을 무시하고'이야기'에 초점을 맞추기 때문에, 15 분짜리 동영상을 봐도 압도당하지 않고 시청할 수 있습니다.
3. "줄넘기"테스트
이 방식이 작동함을 증명하기 위해 연구자들은 JumpScore라는 새로운 테스트를 만들었습니다. 줄넘기를 하는 사람의 동영상을 상상해 보세요. 그들은 수백 번이나 위아래로 점프합니다. 일반적인 AI 에게는 모든 점프가 정확히 똑같이 보입니다. 사용자가 어떤 특정 점프를 묻고 있는지 구분하기 어렵습니다.
- 기존 AI는 혼란을 겪고 무작위로 추측하여 약 100 점 만점에 30 점을 받았습니다.
- LLaVA-OneVision-2는 줄이 땅에 닿거나 사람의 발 위치가 바뀌는 미세한 순간들을 포착했습니다. 100 점 만점에 75 점을 받았습니다.
이 모델은 단순히"점프"를 본 것이 아니라, 점프가 발생한 정확한 순간을 보았습니다.
4. "공간 항법자"
이 모델은 공간 이해 능력도 매우 뛰어납니다. "커피 컵과 노트북 사이의 빈 공간을 가리켜"라고 물으면, 높은 정밀도로 이를 수행할 수 있습니다. 심지어 동영상 속을 이동하는 물체 (예: 방을 가로지르는 달리는 고양이) 를 추적하여, 고양이가 부분적으로 가려지더라도 시선을 잃지 않고 계속 따라갈 수 있습니다.
큰 그림
연구자들은 단순히 더 큰 두뇌를 만든 것이 아니라, 보는 방식을 더 똑똑하게 만들었습니다.
- 이전: AI 는 하이킹 도중 1 분마다 사진을 찍으며 풍경을 놓치지 않기를 바라는 관광객과 같았습니다.
- 현재: AI 는 풍경이 어디에 있는지 정확히 아는 가이드와 같습니다. 그래서 풍경이 실제로 변할 때만 멈춰 사진을 찍습니다.
그 결과, 이전 모델들보다 긴 동영상을 이해하고, 빠른 액션 속 특정 순간을 찾아내며, 공간에 대해 훨씬 더 잘 추론하는 모델이 탄생했습니다. 이는 동일한 컴퓨팅 파워를 사용하면서도 가능합니다. 연구자들은 모든 코드, 데이터, 그리고 모델 자체를 누구나 무료로 사용할 수 있도록 공개했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.