← 최신 논문
💻 computer science

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

4DThinker는 주석 없는 데이터 파이프라인, 동적 이미지 미세 조정, 그리고 4D 강화 학습을 통해 내부적으로 시뮬레이션된 잠재적 정신 이미지를 활용하여 "4D 로 사고"할 수 있게 함으로써 비전 - 언어 모델의 동적 공간 추론 능력을 향상시키는 새로운 프레임워크입니다.

원저자: Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

비행기 영상을 보고 있다고 상상해 보세요. 한 대의 자동차가 붉은 건물을 지나갑니다. 표준 AI 에게 "자동차가 건물에 다가가는 것입니까, 아니면 카메라가 멀어지는 것입니까?"라고 묻는다면 AI 는 혼란스러워할 수 있습니다. 보통 AI 는 장면을 묘사하는 길고 말 많은 단락을 작성하여 답하려 합니다. 하지만 단어는 3 차원 공간에서 발생하는 복잡한 움직임을 설명하는 데는 둔탁한 도구입니다. 이는 무용수가 실제로 움직이는 모습을 보는 대신, 단지 발걸음만 적어 무용을 설명하려는 것과 같습니다.

4DThinker는 AI 에게 움직이는 영상에 대해 "생각"하는 새로운 방식을 가르치는 것입니다. 단순히 단어를 작성하는 대신, AI 는 문제를 해결하기 위해 자신의 뇌 안에 정신적 영화를 만들어냅니다.

다음은 이를 간단한 단계로 나누어 설명한 것입니다:

1. 문제: 단어 대 움직임

현재 AI 모델들은 읽고 쓰는 데는 뛰어나지만, 동적 공간 추론에는 어려움을 겪습니다. 이는 시간의 흐름에 따라 사물과 카메라가 서로에 대해 어떻게 움직이는지 이해하는 능력입니다.

  • 옛날 방식: AI 는 움직임을 완전히 텍스트로 설명하려 합니다. 이는 "위", "아래", "빠르다"라는 단어만 나열하여 롤러코스터 탑승 경험을 설명하려는 것과 같습니다. 종종 부정확하고 혼란스럽습니다.
  • 다른 옛날 방식: 일부 연구자들은 AI 에게 3 차원 형태를 보도록 돕기 위해 추가적인 "안경"(외부 기하학적 도구) 을 부착합니다. 하지만 이는 AI 를 느리고 둔하게 만듭니다. 이는 달리는 사람에게 무거운 배낭을 지워주는 것과 같습니다.

2. 해결책: "4D 로 생각하기"

4DThinker 는 AI 가 "동적 정신적 이미지"라고 불리는 것을 사용하여 내부적으로 움직임을 시뮬레이션하도록 가르칩니다.

  • 유사성: 자동차가 지나가는 모습을 보고 있다고 상상해 보세요. 단순히 "자동차가 왼쪽으로 움직였다"라고 말하는 대신, 눈을 감고 마음속에서 자동차의 경로를 시각화해 보세요. 자동차가 멀어질수록 작아지는 것을 보게 됩니다. 4DThinker 는 컴퓨터 코드 내부에서 정확히 이렇게 합니다. AI 는 정답을 찾기 위해 자신의 뇌를 통해 실행되는 숨겨진 보이지 않는 "영화"를 만들어냅니다.

3. 어떻게 가르쳤는지 (세 가지 단계)

단계 A: 연습 데이터 만들기 (사람 불필요)
AI 를 가르치기 위해 수천 개의 영상과 질문 및 답변이 필요했습니다. 보통은 사람들이 이러한 영상을 라벨링해야 하므로 느리고 비용이 많이 듭니다.

  • 비법: 그들은 원시 영상을 가져와 다른 AI 도구를 사용하여 움직이는 사물 (예: 자전거를 탄 사람) 과 정지된 사물 (예: 건물) 을 자동으로 찾아내는 자동화 파이프라인을 구축했습니다. 그런 다음 AI 가 정확히 무엇에 집중해야 하는지 보여주기 위해 영상 프레임의 "하이라이트"된 버전을 생성했습니다. 이로써 화면에 선 한 줄을 그은 사람 없이도 방대한 연습 문제 라이브러리가 만들어졌습니다.

단계 B: "워밍업" (DIFT)
먼저, AI 에게 단어와 정신적 영화를 연결하도록 가르쳤습니다.

  • 유사성: 이는 교사의 말을 들으며 그림을 배우는 학생과 같습니다. AI 는 영상 프레임을 보여주고, 동시에 "정신적 이미지"(시각을 나타내는 숨겨진 코드) 와 텍스트 답변을 생성해야 합니다. AI 는 올바르게 답하기 위해서는 말하기 전에 마음속에서 움직임을 "봐야" 한다는 것을 배우게 됩니다.

단계 C: "코치" (4D 강화 학습)
AI 가 기초를 익히면, 카메라와 사물 모두 움직이는 더 어렵고 복잡한 영상에서 연습하게 합니다.

  • 비법: 그들은 AI 에게 정답을 주지 않았습니다. 대신 코치처럼 행동했습니다. AI 가 정답을 맞추면 "보상"을 받았고, 틀리면 보상을 받지 못했습니다. AI 는 스스로 정신적 영화를 사용하여 보상을 얻는 방법을 터득했습니다. 중요한 점은, 이 연습 동안 AI 가 변경할 수 있는 것은 단어뿐이었으며, 혼란을 피하기 위해 "정신적 영화" 부분은 안정적으로 유지되었다는 것입니다.

4. 결과

이 논문은 이동, 거리, 방향에 관한 여러 어려운 영상 퀴즈에서 이 새로운 AI 를 테스트했습니다.

  • 결과: 4DThinker 는 매우 비싼 "독점" 모델을 포함한 다른 최상위 AI 모델들을 일관되게 능가했습니다.
  • 이유: 추가 도구나 무거운 배낭이 필요하지 않았습니다. 단순히 자신의 뇌 안에서 4D(3 차원 공간 + 시간) 로 장면을 "상상"하는 능력이 향상되었기 때문입니다. 이는 인간이 자신이 움직이는지 아니면 주변 세계가 움직이는지 파악하려 할 때와 똑같습니다.

요약

4DThinker 는 AI 모델들이 둔탁한 단어로 움직임을 설명하려 하지 않고, 자신의 마음속에서 움직임을 시뮬레이션하도록 하는 프레임워크입니다. AI 가 답변과 함께 "정신적 영화"를 생성하도록 훈련시킴으로써, 물리적 세계가 어떻게 움직이고 변화하는지 이해하는 능력이 크게 향상됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →