← 최신 논문
💻 computer science

Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

본 논문은 정적 단서에 의존하지 않으면서 진정한 시공간 민감도를 개발하도록 비디오 LLM 을 훈련시키기 위해 반사실적 비디오 변환과 관계 기반 보상을 활용하는 이중 분기 강화 학습 프레임워크인 반사실적 관계 정책 최적화 (CRPO) 를 소개합니다.

원저자: Dazhao Du, Jian Liu, Jialong Qin, Tao Han, Bohai Gu, Fangqi Zhu, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dazhao Du, Jian Liu, Jialong Qin, Tao Han, Bohai Gu, Fangqi Zhu, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 학생 (비디오 AI) 이 영화를 보고 그 내용에 대한 질문에 답하는 법을 가르친다고 상상해 보세요. 현재 이 학생은 시험에서 높은 점수를 받는 데는 능숙하지만, 실제로는 부정행위를 하고 있습니다. 영화 전체를 실제로 보고 사물의 움직임을 추적하는 대신, 단계를 생략하는 편법을 쓰고 있습니다. 예를 들어, 단일 프레임만 보고 질문의 문구에 기반해 추측하거나, 훈련 데이터를 바탕으로 '어떻게 되어야 한다'고 생각하는 것에 의존할 수 있습니다.

예를 들어, "공이 왼쪽으로 움직이는가 오른쪽으로 움직이는가?"라고 물으면, 학생은 '오른쪽'이 흔한 답변이거나 다른 비디오에서 공이 오른쪽으로 움직이는 것을 봤다는 이유만으로 매번 '오른쪽'이라고 추측할 수 있습니다. 그들은 실제로 공의 움직임을 추적하지 않습니다.

이 논문의 저자들인 CRPO는 표준 훈련 방법이 실제로 이런 부정행위를 더 악화시킨다는 점을 깨달았습니다. 학생이 정답을 맞혔다는 이유만으로 (비록 부정행위를 했더라도) "잘했다"는 보상을 받으면, 그들은 부정행위를 계속할 것입니다.

해결책: "만약에?" 게임

이를 해결하기 위해 연구자들은 **반사실적 (Counterfactuals)**을 기반으로 한 새로운 훈련 게임을 도입했습니다. (반사실적은 단순히 "만약에?"를 뜻하는 고급 단어입니다.)

게임의 진행 방식은 다음과 같습니다:

  1. 준비: 학생에게 비디오를 보여주고 질문을 던집니다.
  2. 반전: 학생이 답하기 전에 교사가 비밀스럽게 비디오를 특정 방식으로 변경합니다.
    • 거울 트릭: 비디오를 수평으로 뒤집습니다 (거울을 보는 것처럼). 공이 왼쪽으로 움직였다면, 이제는 오른쪽으로 움직이는 것처럼 보입니다.
    • 되감기 트릭: 비디오를 거꾸로 재생합니다. 꽃이 피어 있었다면, 이제는 닫히는 것처럼 보입니다.
  3. 시험: 학생은 변경된 비디오에 대해 동일한 질문에 답해야 합니다.

게임의 황금률칙:

  • 질문이 움직임에 관한 것이라면 (예: "공이 어느 방향으로 가고 있는가?"), 비디오가 뒤집히거나 거꾸로 재생될 때 학생은 반드시 답을 바꿔야 합니다. 원래 비디오에서 '오른쪽'이라고 답했다면, 거울 이미지에서는 '오른쪽'이라고 답하면 안 됩니다. '왼쪽'이라고 답해야 합니다.
  • 질문이 정적 사실에 관한 것이라면 (예: "공의 색깔은 무엇인가?"), 학생은 반드시 같은 답을 유지해야 합니다. 원래 비디오에서 공이 빨간색이라면, 거울 이미지에서도 여전히 빨간색입니다.

"이중 분기" 코치

연구자들은 이 게임을 두 개의 화면에서 동시에 수행하는 학생을 지켜보는 특수 코치 ( CRPO 라고 함) 를 만들었습니다.

  • 화면 A: 원본 비디오.
  • 화면 B: "만약에" 비디오 (뒤집히거나 거꾸로 재생된 것).

코치는 단순히 답이 맞는지 틀린지만 확인하지 않습니다. 두 답 사이의 관계를 확인합니다.

  • 학생이 답을 바꿔야 할 때 답을 바꿨습니까? (잘했습니다!)
  • 학생이 답을 유지해야 할 때 답을 유지했습니까? (잘했습니다!)

학생이 두 화면에 동일한 답을 주어 편법을 쓰려 하면, 코치는 벌점을 줍니다. 이는 학생이 실제로 비디오를 보고 사물이 어떻게 움직이고 시간에 따라 어떻게 변하는지 이해하도록 강제합니다.

새로운 시험: DyBench

학생이 더 이상 부정행위를 하지 않는다는 것을 증명하기 위해 연구자들은 DyBench라는 새로운 시험을 만들었습니다.

  • 단순히 한 가지 질문만 하는 대신, 원본 비디오에 대한 질문과 "만약에" 비디오에 대한 질문으로 이루어진 질문 쌍을 던집니다.
  • 시험에 통과하려면 학생은 두 가지 답을 모두 맞춰야 합니다.
  • 이는 엄격한 규칙입니다. 학생이 모든 것에 대해 '파란색'이라고 추측만 한다면, 운 좋게 하나는 맞출 수 있겠지만, 비디오가 변했을 때 두 가지 모두를 맞출 수 없기 때문에 질문 쌍에서는 실패할 것입니다.

결과

이 새로운 방법을 강력한 AI 모델 (Qwen3-VL) 에 테스트했을 때:

  • AI 는 움직임, 방향, 그리고 사건의 순서를 이해하는 능력이 크게 향상되었습니다.
  • 게으른 편법에 의존하는 것을 멈췄습니다.
  • 일반적인 질문에 답하는 능력을 잃지 않았으며, 단지 비디오를 어떻게 보는지에 대해 더 똑똑해졌습니다.

요약하자면: 이 논문은 비디오 AI 가 추측을 멈추고 실제로 보도록 가르칩니다. 이를 위해 세계가 어떻게 보이는지뿐만 아니라 어떻게 변하는지 이해해야 함을 증명하는 "만약에" 게임을 강제로 수행시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →