← 최신 논문
💻 computer science

Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

본 논문은 Video-LLM 에서 모델이 근본적인 시각 신호는 유지하면서도 부호화된 운동 방향을 올바르게 해석하지 못하는 '방향성 운동 실명'을 규명하고, 새로 도입된 MoDirect 데이터셋에 대한 전문화된 지시 미세 조정을 통해 운동 방향 정확도를 크게 향상시키는 진단 기반의 프로젝터 수준 목적 함수인 DeltaDirect 를 제안합니다.

원저자: Jongseo Lee, Hyuntak Lee, Sunghun Kim, Sooa Kim, Jihoon Chung, Jinwoo Choi

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jongseo Lee, Hyuntak Lee, Sunghun Kim, Sooa Kim, Jihoon Chung, Jinwoo Choi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"어느 방향으로 움직였을까?"라는 제목의 논문에 대한 설명을 쉬운 언어와 창의적인 비유를 사용하여 제시합니다.

큰 문제: "방향 감각이 없는" 로봇

노란 공이 화면 왼쪽에서 오른쪽으로 굴러가는 간단한 비디오를 로봇에게 보여주고, "어느 방향으로 움직이고 있니?"라고 물어본다고 상상해 보세요.

사람이라면 즉시 "오른쪽으로!"라고 말하겠지만, 이 논문에 따르면 대부분의 현재 Video-LLM(비디오를 보고 그에 대해 이야기할 수 있는 AI 모델) 은 방향 감각이 없습니다.

이러한 AI 모델들이 공이 노랗고, 둥글며, 움직이고 있다는 사실을 알려줄 만큼 똑똑함에도 불구하고, 방향은 종종 무작위로 추측합니다. 마치 차를 완벽하게 묘사할 수는 있지만, 그 차가 앞으로 가고 있는지 뒤로 가고 있는지 전혀 모르는 사람과 같습니다. 이들은 방향을 정확히 맞추는 경우가 약 25% 에 불과합니다 (이는 단순히 추측하는 수준입니다).

저자들은 이러한 실패를 **"방향성 운동 맹시 **(Directional Motion Blindness)라고 부릅니다.

수사: 신호가 어디에서 사라지는가?

연구자들은 AI 가 왜 실패하는지 파악하기 위해 탐정처럼 행동했습니다. 그들은 AI 의 뇌 (신경망) 를 통과하며 "운동 방향" 신호를 추적했습니다.

  1. **눈 **(시각 인코더) AI 의 "눈"은 움직임을 완벽하게 감지합니다. 만약 눈에게 "오른쪽으로 움직이고 있니?"라고 물어본다면, 99% 의 확신으로 "YES!"라고 외칩니다.
  2. **번역기 **(프로젝터) 눈이 보는 것을 AI 의 내부 언어로 번역하는 부분도 신호를 강력하게 유지합니다.
  3. **뇌 **(LLM) AI 의 깊은 사고 층 내부에서도 "오른쪽으로 움직인다"는 정보는 여전히 사용되기를 기다리며 존재합니다.

실제 문제: 신호가 사라진 것이 아니라, 답변을 말할 때가 되면 무시당할 뿐입니다.

저자들은 이를 **"방향 결합 격차 **(Direction Binding Gap)라고 부릅니다.

  • 비유: "오른쪽으로 움직인다"는 제목의 책이 선반에 뚜렷이 놓여 있는 사서라고 상상해 보세요. 사서는 그 책을 완벽하게 볼 수 있습니다. 하지만 고객이 "선반에 있는 책은 무엇인가요?"라고 묻자, 사서는 다른 책을 무작위로 집거나 추측합니다. 정보는 이용 가능하지만, 사서가 그 특정 정보를 올바른 구두 답변에 **결합 **(연결)하지 못해 실패하는 것입니다.

진단: 결여된 책이 아니라 볼륨 문제입니다

연구자들은 AI 가 만화처럼 단순한 비디오로 테스트될 때 "오른쪽으로 움직인다"는 신호를 "오른쪽"이라는 단어와 연결하는 법을 배운다는 사실을 발견했습니다. 하지만 복잡한 실제 세계의 비디오 (예: 공원에서 걷는 사람) 를 보여주면 연결이 끊어집니다.

왜일까요?

  • 비유: "오른쪽으로 움직인다"는 신호를 라디오 방송국으로 생각해보세요. 단순한 비디오에서는 신호가 크고 명확합니다. 복잡한 실제 세계의 비디오에서는 신호가 여전히 존재합니다 (방송국은 여전히 송출 중입니다). 하지만 볼륨이 너무 낮게 조정되어 배경 풍경의 소음 속에서 AI 의 "스피커"(답변을 생성하는 부분) 가 그 신호를 들을 수 없을 정도로 작아집니다.

AI 는 방향을 알고 있지만, 시각적 장면이 복잡해지면 그 신호가 명확하게 들릴 만큼 충분히 강하지 않습니다.

해결책: DeltaDirect(볼륨을 높이기)

이를 해결하기 위해 저자들은 DeltaDirect라는 새로운 학습 방법을 개발했습니다.

  • 작동 원리: 학습 중에 AI 에게 단순히 "정답은 무엇인가요?"라고 묻는 대신, AI 의 번역기에 직접 속삭이는 특별한 "코치"를 추가했습니다.
  • 코치의 역할: 코치는 비디오의 연속된 두 프레임을 보고, 그 사이의 정확한 수학적 차이 (델타) 를 계산한 후, "이봐, 물체가 특정 벡터만큼 움직였어. 그 움직임에 대한 내부 신호가 크게 나오도록 해."라고 말합니다.
  • 결과: 이는 학습이 끝난 후 AI 의 작동 방식을 바꾸지 않습니다. 단지 AI 가 비디오가 복잡하고 messy 해지더라도 운동 신호의 "볼륨"을 높게 유지하는 법을 배우도록 강제할 뿐입니다.

결과

이 새로운 학습 방법을 사용한 후:

  1. 단순한 비디오: AI 는 무작위 추측에서 **85%**의 정확도로 정답을 맞추는 수준까지 향상되었습니다.
  2. 실제 세계 비디오: 학습 중에 실제 세계 비디오를 단 한 번도 보지 않았음에도 불구하고, AI 의 실제 비디오에 대한 정확도는 22 퍼센트 포인트 급증했습니다.
  3. 일반적인 능력: 중요하게도, AI 가 방향을 더 잘 파악하도록 만든 것이 다른 능력을 떨어뜨린 것은 아닙니다. AI 는 여전히 이전과 마찬가지로 이야기, 행동, 그리고 사물을 잘 이해합니다.

요약

이 논문은 Video-LLM 이 운동에 대해 맹시하는 것이 아니라, 상황이 복잡해지면 "볼륨 조절 노브"가 내려가 있을 뿐임을 밝힙니다. 저자들은 그 볼륨을 다시 올려주는 도구 (DeltaDirect) 를 구축하여, AI 가 이제야 사물이 어느 방향으로 움직이는지에 대한 내부 지식을 듣고 올바르게 구두로 말할 수 있게 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →