← 최신 논문
💻 computer science

Token Warping Helps MLLMs Look from Nearby Viewpoints

이 논문은 픽셀 기반 왜곡의 한계를 극복하고 시각적 추론의 견고성을 높이기 위해 비전 트랜스포머 기반의 멀티모달 대형 언어 모델에서 토큰 단위의 역방향 워핑을 적용하여 새로운 시점에서의 장면 이해 능력을 획기적으로 향상시킨다는 것을 제안합니다.

원저자: Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 1. 문제: AI 는 "옆에서 보면 어떻게 보일까?"를 못 상상해요

지금까지의 AI 는 사진 한 장을 보고 "책 옆에 컵이 있네"라고 말은 잘합니다. 하지만, **"그 컵을 오른쪽으로 45 도 돌아가서 보면 책이 컵의 왼쪽에 있을 거야"**라고 상상하는 건 매우 어려워요.

기존 방법들은 사진을 픽셀 (화소) 단위로 비틀어서 새로운 각도를 만들려고 했습니다. 하지만 이건 마치 유리창을 비틀어서 구부리는 것과 같아요. 깊이가 조금만 틀려도 이미지가 찌그러지거나 (왜곡), 구멍이 생기고, AI 가 "이게 뭐지?"라고 헷갈려하게 됩니다.

🧩 2. 해결책: "토큰 (Token) 워핑"이라는 새로운 방법

이 논문은 **"픽셀을 비틀지 말고, '토큰'을 비틀자!"**라고 제안합니다.

  • 토큰 (Token) 이 뭐예요?
    AI 가 사진을 볼 때, 아주 작은 픽셀 하나하나를 보는 게 아니라, **작은 이미지 조각 (패치) 들을 하나의 '의미 있는 덩어리'**로 봅니다. 이를 '토큰'이라고 해요. 마치 퍼즐 조각을 보는 것과 비슷하죠.
  • 비유: 퍼즐 놀이
    • 기존 방법 (픽셀 워핑): 퍼즐 조각 하나하나를 잘게 부수고, 그 조각들을 비틀어서 다시 붙이려고 하면 모양이 망가집니다.
    • 이 방법 (토큰 워핑): 퍼즐 조각 (토큰) 자체를 통째로 들어 올려서, 새로운 각도에서 맞춰보는 것입니다. 조각이 찌그러지지 않고 원래 모양을 유지하니까 AI 가 내용을 잘 이해할 수 있어요.

🔄 3. 핵심 기술: "뒤에서 당기기" (Backward Warping)

이 연구는 토큰을 어떻게 옮길지 두 가지 방법을 비교했습니다.

  1. 앞으로 밀기 (Forward): 원본에서 토큰을 뽑아서 새로운 화면으로 밀어 넣는 방식.
    • 문제: 새로운 화면에 구멍이 생기고, 토큰들이 들쑥날쑥하게 흩어집니다. AI 가 "여기는 뭐지?"라고 혼란을 느낍니다.
  2. 뒤에서 당기기 (Backward): 이게 이 논문의 핵심입니다!
    • 새로운 화면 (목표) 을 먼저 완벽하게 그리기 위해 빈 칸을 채울 자리를 정합니다.
    • 그 빈 자리 하나하나마다 "원본 사진의 어디를 가져와야 할까?"를 계산해서 토큰을 가져옵니다.
    • 효과: 마치 새로운 창문을 만들고, 그 창문 너머로 원본 풍경을 비추는 것처럼, 새로운 화면이 깔끔하고 정돈되어 나옵니다.

🧪 4. 실험 결과: "토큰 워핑"이 압도적으로 잘해요

연구팀은 ViewBench라는 새로운 시험지를 만들어 AI 들을 테스트했습니다.

  • 결과: 토큰을 비틀어서 시점을 바꾼 방법 (Backward Token Warping) 이, 기존에 3D 데이터를 많이 학습한 AI 들이나, 새로운 이미지를 생성해내는 AI 들보다 훨씬 정확하게 답을 냈습니다.
  • 특이점: 깊이 정보 (Depth Map) 가 완벽하지 않아도 (약간 어긋나도) 토큰은 잘 견뎌냅니다. 마치 퍼즐 조각이 조금 비틀어져도 그 모양만 보면 "아, 이거 강아지 조각이구나"라고 알아보는 것처럼요.

🌟 5. 요약: 왜 이 연구가 중요할까요?

이 연구는 AI 가 **"머릿속으로 시점을 바꾸는 능력 (정신적 이미지)"**을 키우는 데 아주 효율적이고 간단한 방법을 찾았다는 점입니다.

  • 기존: 무거운 3D 모델을 학습시키거나, 새로운 이미지를 생성해내는 복잡한 과정을 거침.
  • 이 연구: "토큰"이라는 AI 가 이미 잘 이해하는 단위를 활용해서, 계산만 살짝 바꿔주면 시점 변경을 완벽하게 해결함.

한 줄 요약:

"AI 가 사진을 비틀어서 왜곡시키는 대신, 의미 있는 퍼즐 조각 (토큰) 을 통째로 옮겨서 옆에서 보면 어떻게 보일지 정확하게 상상하게 만들었습니다."

이 기술이 발전하면, 로봇이 한 장의 사진만 보고도 "내가 옆으로 가면 이 물체가 어디에 있을지"를 정확히 파악하여 더 똑똑하게 움직일 수 있게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →