← 최신 논문
💬 NLP

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

STORMS 는 외부 도구나 명시적인 텍스트 연쇄 사고에 의존하는 방법보다 훨씬 낮은 추론 지연 시간으로 더 높은 정확도를 달성하도록, 동적 시각 증거를 경계 있는 연속 잠재 궤적으로 내재화하도록 훈련시킴으로써 비디오 - 언어 모델의 시공간 추론 능력을 향상시키는 2 단계 프레임워크입니다.

원저자: Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Bansal, Huaxiu Yao

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Bansal, Huaxiu Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 일상적인 비유를 통해 간단한 개념으로 분해한 TORM 논문에 대한 설명입니다.

큰 문제: 비디오는 '생각'하기 어렵습니다

누군가가 샌드위치를 만드는 비디오를 보고 있다고 상상해 보세요. *"다음에 무엇을 할까요?"*라는 질문에 답하기 위해 당신의 뇌는 손의 움직임, 재료의 순서, 그리고 초마다 변하는 장면의 변화를 추적해야 합니다.

현재의 AI 모델 (비디오 - 언어 모델) 은 이미지를 보는 데는 뛰어나지만, 비디오는 움직이는 퍼즐이기 때문에 비디오를 다루는 데는 어려움을 겪습니다.

  • 옛날 방식: 이 문제를 해결하기 위해 현재의 AI 는 종종 문제를 해결하기 위해 "말"로 풀어내려 합니다. 멈추고, 생각의 긴 목록 (텍스트 일지 같은 것) 을 작성하거나, 다시 보기 위해 특정 프레임을 선택하거나, 심지어 도움을 받기 위해 외부 도구를 호출합니다.
  • 단점: 이는 수학 문제를 풀 때 종이에 모든 단계를 적어내고, 지우고, 다시 쓰는 것과 같습니다. 느리고, 투박하며, 많은 에너지 (컴퓨팅 파워) 를 필요로 합니다.

해결책: TORM (내재화된 모델을 통한 시공간 추론)

저자들은 TORM(Spatial-Temporal reasOning via inteRnalized Modeling) 을 제안합니다.

AI 에게 생각을 적어내거나 도움을 요청하게 하는 대신, TORM 은 AI 가 숨겨진 간결한 코드를 사용하여 자신의 "뇌" 내부에서 비디오를 시뮬레이션하도록 가르칩니다.

이해하기 쉽게 비유해 보면 다음과 같습니다:

  • 옛날 AI: 증거를 찾기 위해 멈추고, 확대경을 꺼내 증거를 찍고, 보고서를 작성한 뒤 다시 사진을 찍어야 하는 탐정.
  • TORM AI: 눈을 감고 장면이 완벽하게 머릿속에서 재생되게 한 뒤 즉시 답을 주는 탐정.

작동 원리: 두 단계 훈련

이 논문은 AI 에게 이 "마음의 영화" 기술을 가르치기 위한 교묘한 두 단계 훈련 과정을 설명합니다.

1 단계: "선생님"이 영화를 보여줍니다

훈련 동안 시스템은 특별한 "생각 비디오"를 생성합니다.

  1. 실제 비디오와 질문을 가져옵니다.
  2. 강력한 AI 를 사용하여 답변과 관련된 부분만 보여주는 짧은 새로운 비디오를 생성합니다 (예: 음료를 섞는 손만 보여줌).
  3. 모델은 이 "생각 비디오"를 보여주고 다음과 같이 지시받습니다: "당신의 숨겨진 뇌 상태 (잠재 토큰) 는 이 비디오와 같아야 합니다."
  4. 비유: 선생님이 학생에게 골인 장면의 짧고 완벽한 클립을 보여줍니다. 선생님은 말합니다. "골인에 대해 단락을 쓰지 마세요. 대신 공이 그물을 때리는 느낌을 머릿속으로 상상하고, 당신의 '심상'이 이 클립과 일치하도록 하세요."

2 단계: "침묵" 연습

AI 가 이러한 비디오 클립과 자신의 내부 뇌 상태를 일치시키는 법을 배운 후, 훈련 방식이 바뀝니다.

  1. "생각 비디오"를 제거합니다.
  2. AI 에게 다시 질문을 던집니다.
  3. 다음과 같이 지시합니다: "머릿속으로 생각하세요 (배운 내부 상태를 사용하되), 비디오는 보여주지 마세요. 최종 답변만 주세요."
  4. 비유: 선생님이 더 이상 클립을 보여주지 않습니다. 이제 학생은 눈을 감고 1 단계에서 배운 마음의 영화를 재생하고 답을 외쳐야 합니다. 더 이상 메모를 하거나 화면을 볼 수 없습니다.

결과: 빠르고 효율적입니다

AI 가 테스트 (추론) 될 때:

  • 새로운 비디오를 생성하지 않습니다.
  • 프레임을 다시 보지 않습니다.
  • 외부 도구를 호출하지 않습니다.

그저 숨겨진 코드 내부에서 짧고 빠른 "시뮬레이션"(잠재 롤아웃) 을 실행한 후 답변을 말합니다.

왜 이것이 더 좋은가요?

  • 속도: 무거운 비디오 파일을 생성하거나 프레임을 검색할 필요가 없기 때문에 훨씬 빠릅니다. 논문은 외부 도구에 의존하는 방법보다 약 30 배 빠르다고 보여줍니다.
  • 정확도: 단순히 단어로 설명하는 것이 아니라 움직임과 타이밍을 내부적으로 "느끼는" 법을 배웠기 때문에 복잡한 비디오 질문에 대한 답변이 실제로 더 좋아집니다.

요약

TORM은 AI 가 비디오를 이해하도록 가르치는 새로운 방법입니다. AI 가 다음에 무엇을 할지 파악하기 위해 긴 이야기를 쓰거나 외부 도구를 사용하게 하는 대신, AI 에게 비디오의 침묵하는 내부 시뮬레이션을 실행하도록 가르칩니다. 훈련 중에는 "생각 비디오"를 보며 학습하지만, 실제 테스트에서는 빠른 정확한 답변을 주기 위해 내부 "마음의 영화"만 사용합니다.

핵심 포인트: 비디오 추론을 "소리를 내며 일을 하는"(느리고 messy 한) 방식에서 "침묵으로 생각하며 해결하는"(빠르고 효율적인) 방식으로 전환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →