← 최신 논문
💻 computer science

Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation

Proprio 는 잠재적 교란 하에서 내부 흐름 잔차를 자기 점수 신호로 활용하여 추론 시간 정제 및 선택을 수행함으로써 고정된 비디오 생성기의 물리적 타당성을 향상시키는 훈련이 불필요한 프레임워크입니다.

원저자: Mariam Hassan, Kaouther Messaoud, Wuyang Li, Alexandre Alahi

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mariam Hassan, Kaouther Messaoud, Wuyang Li, Alexandre Alahi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마법 같은 화가가 처음부터 움직이는 그림(동영상) 을 그릴 수 있다고 상상해 보세요. 이 화가는 사물을 아름답고 사실적으로 묘사하는 데 탁월한 재능을 지니고 있습니다. 하지만 한 가지 맹점이 있습니다. 바로 실제 세계가 어떻게 작동하는지 항상 이해하지 못한다는 점입니다. 예를 들어, 아래로 떨어지는 대신 위로 떠오르는 공을 그리거나, 바닥에 닿기 전에 깨지는 컵을 그릴 수도 있습니다.

오랫동안 이러한 실수를 수정하기 위해 사람들은 화가를 감시하고 "아니오, 그건 틀렸어"라고 지적해 줄 "물리 선생님"(외부 AI 나 인간) 을 고용하려고 노력했습니다. 하지만 이 논문은 이는 화가의 숙제를 다른 사람이 채점하도록 요청하는 것과 같다고 주장합니다. 선생님 자신도 편견을 가질 수 있고, 화가와 같은 "언어"를 구사하지 못해 오해를 불러일으킬 수도 있습니다.

'프로프리오 (Proprio)'의 등장

저자들은 화가가 선생님을 고용하지 않고도 스스로 실수를 수정할 수 있는 새로운 방법을 제안합니다. 그들은 이 방법을 **프로프리오 (Proprio)**라고 부르는데, 이는 팔을 보지 않고도 팔의 위치를 아는 생물학적 감각인 '고유수용감각 (proprioception)'에서 이름을 따온 것입니다. 마치 자신의 움직임을 느낄 수 있듯이, 프로프리오를 통해 동영상 생성 모델은 자신의 창작물을 '느껴보며' 그것이 논리적인지 확인할 수 있습니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다.

1. "흔들기 테스트" (자기 채점)

화가가 그림을 완성했다고 상상해 보세요. 대신 선생님이 그림을 보게 하는 대신, 화가는 그림을 부드럽고 통제된 방식으로 살짝 흔들어 봅니다.

  • 논리: 그림이 물리적으로 정확하다면 (예: 공이 떨어지는 경우), 작은 흔들림은 화가를 혼란스럽게 하지 않습니다. 화가의 사물 운동에 대한 내부 규칙은 여전히 유효하게 작동합니다.
  • 결함: 그림이 잘못되었다면 (예: 공이 떠오르는 경우), 그 작은 흔들림은 화가의 내부 논리를 무너뜨립니다. 화가는 물리 법칙이 깨져 있기 때문에 이미지를 어떻게 "수정"해야 할지 혼란에 빠집니다.
  • 점수: 프로프리오はこの 혼란을 측정합니다. 동영상이 약간 교란되었을 때 화가가 얼마나 혼란스러워하는지에 기반하여 "점수"를 계산합니다. 낮은 점수는 동영상이 안정적이고 물리적으로 타당함을 의미하며, 높은 점수는 동영상이 불안정하고 틀릴 가능성이 높음을 의미합니다.

2. "조명" (동적 마스크)

동영상의 모든 부분을 균등하게 확인할 필요는 없습니다. 사람이 가만히 앉아 있는 동영상이라면 확인할 것이 없습니다. 하지만 자동차가 충돌하는 장면이라면 물리 법칙이 중요한 부분입니다.
프로프리오는 움직이는 부분에만 집중하는 동적 조명(마스크) 을 사용합니다. 정적인 배경은 무시하고 동작에 초점을 맞춰 "이 특정 움직임이 논리적인가?"라고 묻습니다. 이렇게 하면 "흔들기 테스트"의 정확도가 훨씬 높아집니다.

3. 예술을 수정하는 두 가지 방법

화가가 점수를 받으면, 프로프리오를 통해 동영상을 개선하는 두 가지 방법이 제시됩니다.

  • "최고의 N 개" 검색 (승자 선정):
    화가가 같은 장면의 16 가지 버전을 그렸다고 상상해 보세요. 프로프리오를 빠른 심사위원처럼 행동하여 각 버전에게 "흔들기 테스트" 점수를 매깁니다. 그런 다음 가장 낮은 점수 (가장 혼란이 적은) 를 가진 버전을 선택하고 "이것이 승자다"라고 말합니다. 이는 주사위를 16 번 굴려 가장 좋은 결과를 고르는 것과 같습니다.

  • "자기 정제" (예술 다듬기):
    단순히 승자를 고르는 대신, 프로프리오를 실제로 동영상을 미세하게 조정할 수 있습니다. 화가가 그림을 시작할 때 사용한 "노이즈"나 원재료인 가장 처음 단계로 돌아가서, 이 재료들을 약간 조정하고 화가에게 장면을 다시 그리도록 요청하여 혼란 점수를 낮추기를 바랍니다. 이는 조각가가 조각상의 도구나 훈련을 바꾸지 않고도 조각상이 더 자연스럽게 서 있도록 돌을 조금씩 깎아내는 것과 같습니다.

왜 이것이 중요한가

이 논문은 외부 AI 선생님 (대형 언어 모델 등) 에게 동영상을 평가하도록 요청하는 것보다 이 "자기 점검" 방식이 더 효과적임을 보여줍니다.

  • 내재성: 화가는 자신의 내부 규칙을 사용하여 자신의 작업을 평가하므로 언어 장벽이 없습니다.
  • 훈련 불필요: 화가를 재훈련시키거나 새로운 물리 법칙을 가르칠 필요가 없습니다. 화가의 기존 두뇌를 사용하여 오류를 찾고 수정하기만 하면 됩니다.
  • 결과: 공이 굴러가는 장면, 물체가 충돌하는 장면, 액체가 쏟아지는 장면 등을 테스트했을 때, 프로프리오는 인간이 더 물리적으로 사실적이라고 평가한 동영상을 성공적으로 선택하고 생성했습니다.

요약하자면: 프로프리오를 통해 동영상 생성 모델은 자신의 작업에 대한 "직감"을 갖게 됩니다. 자신의 창작물을 살짝 흔들어 혼란을 측정함으로써, 외부 선생님이 필요 없이 최고의 버전을 선택하거나 물리 법칙이 자연스럽게 느껴지도록 성분을 미세하게 조정할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →