← 최신 논문
💻 computer science

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV는 시간적 유사성 라우터(temporal similarity router)에 의해 유도되는 컴팩트한 시각적 업데이트 패러다임으로 전체 이미지 생성을 대체하고, 새로운 대규모 인터리브드 추론 데이터셋인 StructCoT에 의해 뒷받침됨으로써 추론 효율성과 성능을 향상시키는 통합 대규모 멀티모달 모델입니다.

원저자: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 친구와 함께 복잡한 "사이먼 세즈(Simon Says)" 게임을 하고 있다고 상상해 보세요. 하지만 단순히 듣기만 하는 것이 아니라, 게임에서 일어나는 모든 단계를 화이트보드에 그려서 친구에게 보여줘야 합니다.

과거의 방식: 과하게 그리는 화가
현재, 이미지로 문제를 해결하려는 대부분의 고급 AI 모델(예: 미로 찾기나 수학 퍼즐 풀기)은 매우 철저하지만 약간 비효효율적인 화가처럼 작동합니다. 예를 들어, 게임이 테이블 위에 컵이 놓인 그림으로 시작된다고 가정해 봅시다.

  • 1단계: AI는 컵이 놓인 테이블 전체를 그립니다.
  • 2단계: 게임 규칙이 "컵을 왼쪽으로 옮기세요"라고 말합니다. 하지만 AI는 컵을 겨우 1인치 움직였을 뿐인데도, 컵을 포함한 테이블 전체를 다시 그리기 위해 화이트보드 전체를 지워버립니다.
  • 3단계: "컵을 회전시키세요." AI는 모든 것을 지우고 다시 테이블 전체를 그립니다.

이것을 논문에서는 "전체 이미지 생성(full-image generation)"이라고 부릅니다. 저자들은 이것이 엄청난 에너지와 공간의 낭비라고 주장합니다. 이는 문장에서 단어 하나를 바꿀 때마다 사전 전체를 다시 쓰는 것과 같습니다. AI는 변하지 않은 것들을 다시 그리느라 대부분의 시간을 허비하며, 이 과정에서 이전의 모습을 잊어버려 컵의 색깔을 실수로 바꾸는 등 세부 사항을 망치는 일이 발생하기도 합니다.

새로운 방식: '스티커' 화가, DeltaV
이 논문은 DeltaV라는 새로운 모델을 소개합니다. DeltaV는 전체 장면을 다시 그리는 대신, 영리한 스티커 화가처럼 행동합니다.

  • 1단계: 테이블과 컵을 그립니다 (이것이 "기본 상태(Base State)"입니다).
  • 2단계: 컵을 움직여야 할 때, DeltaV는 테이블을 다시 그리지 않습니다. 대신 컵이 왼쪽으로 움직이는 아주 작은 "스티커"를 그려서 예전 위치 위에 붙입니다. 테이블 다리나 배경은 변하지 않았으므로 무시합니다.
  • 3단계: 컵을 회전시킬 때, 그냥 작은 "회전 스티커"를 추가합니다.

이 접근 방식을 **시각적 업데이트(visual updates)**라고 부릅니다. 논문은 오직 변화된 부분(즉, "델타(Delta)")만을 그림으로써 AI가 엄청난 양의 작업을 아낄 수 있다고 제안합니다. 이 방법은 테스트 결과, 이미지를 더 나쁘게 만들지 않으면서도 새로운 "그리기 토큰"(이미지를 생성하는 데 사용되는 디지털 잉크)의 수를 평균 55.6% 줄였습니다.

스마트한 "정지" 버튼: TSIM 라우터
"만약 변화가 너무 크다면 어떡하지? 만약 장면 전체가 폭발한다면?"이라는 의문이 생길 수 있습니다.
DeltaV에는 TSIM 라우터라는 내장된 스마트 관리자가 있습니다. 이것은 새로운 장면이 이전 장면과 얼마나 다른지 살펴보는 감독관과 같습니다.

  • 변화가 미미하다면(예: 컵을 움직임), 감독관은 "스티커를 몇 개만 사용하세요"라고 말합니다.
  • 변화가 거대하다면(예: 방 전체가 변함), 감독관은 "좋습니다, 제대로 하기 위해 스티커를 더 많이 사용하세요"라고 말합니다.

논문은 이를 이미지 재구성 능력을 확인하여 측정했습니다. 연구 결과, 특정 지점 이후로 토큰을 계속 추가하더라도 이미지가 더 좋아지지 않는다는 것을 발견했습니다. 따라서 TSIM 라우터는 "추가적인 노력"이 더 이상 보상을 주지 않는 시점에 토큰 추가를 멈춥니다. 이를 통해 AI가 단순한 단계에서 시간을 낭비하지 않으면서도, 복잡한 단계에서는 소홀히 하지 않도록 보장합니다.

훈련 장소: StructCoT
DeltaV가 이 방법을 익히도록 하기 위해, 연구진은 단순히 기존의 퍼즐 책을 사용할 수 없었습니다. 그들은 StructCo-T라는 거대한 새로운 훈련 세트를 구축했습니다.

  • 이 세트는 105만 개의 샘플을 포함하고 있습니다.
  • 논리 퍼즐, 수학 문제부터 로봇 계획, 과학 질문에 이르기까지 44가지의 서로 다른 유형의 작업을 다룹니다.
  • 논문은 기존 데이터셋들이 너무 작거나 미로와 같은 특정 분야에만 집중되어 있다고 주장하며, StructCoT는 AI에게 시각적 상태가 시간에 따라 어떻게 변하는지에 대한 훨씬 더 넓은 교육을 제공한다고 설명합니다 매듭짓습니다.

결과: 효과가 있었는가?
논문에 따르면 DeltaV를 테스트했을 때 다음과 같은 결과가 나타났습니다.

  • 멀티모달 추론 문제를 기존의 "모두 다시 그리는" 방식보다 3.3% 더 잘 해결했습니다.
  • DeltaV는 더 작은 모델(2B 파라미터)임에도 불구하고, 이러한 추론 작업에서 훨씬 더 큰 오픈 소스 모델들을 평균 8.4% 차이로 앞질렀습니다.
  • 또한, 유사한 모델인 Qwen3-VL-2B보다 외부 벤치마크에서 5.9% 더 높은 성능을 보였습니다.

이 논문이 부정하는 것들
저자들은 무엇이 효과가 없는지에 대해서도 명확히 밝히고 있습니다. 그들은 매 단계마다 고해 resolution의 전체 이미지를 생성할 필요가 있다는 생각에 명시적으로 반대합니다. 그들은 이러한 방식이 "시각적 토큰 중복(visual-token redundancy)"(디지털 잉크 낭비)을 초래하며, 중요하지 않은 것을 다시 그리느라 AI의 추론 능력을 오히려 저해한다고 제안합니다. 또한, 이 방법이 추론에는 훌륭하지만, 아주 미세한 디테일(예: 작은 먼지 한 점을 찾아내는 것)을 포착해야 하는 작업에는 전체 이미지가 여전히 필요할 수 있다고 언급했습니다.

핵심 요약
이 논문은 AI 추론의 미래가 세상을 매번 통째로 다시 그리는 것에 있지 않다고 제안합니다. 대신, "무엇이 변했는가?"라는 관점으로 생각하는 것에 달려 있습니다. 변화된 부분에만 집중함으로써, DeltaV는 더 빠르고 효율적이며, 훨씬 더 무거운 "전체 이미지 그리기" 모델들보다 놀랍게도 복잡한 퍼즐을 더 잘 풀 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →