← 최신 논문
💻 computer science

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

이 논문은 시각적 추론 작업과 구성 가능한 시각 기억 창구를 통해 비디오 생성 모델의 사후 훈련을 개선하고, 강화 미세 조정 파이프라인을 통해 긴 비디오에 대한 정확도를 획기적으로 높인 새로운 멀티모달 보상 모델 'VR-Thinker'를 제안합니다.

원저자: Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

게시일 2026-03-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

VR-Thinker: 비디오를 보고 '생각하는' AI 심사위원 이야기

이 논문은 VR-Thinker라는 새로운 인공지능을 소개합니다. 이 AI 는 단순히 영상을 보고 "좋다/나쁘다"라고 점수를 매기는 것이 아니라, 영상을 마치 사람이 직접 보고 분석하듯이 '생각'하며 평가합니다.

기존의 AI 심사위원들이 겪던 문제와 VR-Thinker 가 어떻게 해결했는지, 쉬운 비유로 설명해 드릴게요.


1. 기존 AI 의 문제: "너무 많은 정보를 한 번에 먹으려다 속이 더부룩해"

기존의 영상 평가 AI 들은 두 가지 큰 약점이 있었습니다.

  • 문제 1: "한 입에 너무 많이 씹으려다 맛을 놓침"
    • 비유: 10 분짜리 영화를 보고 평가를 하라고 하면, 기존 AI 는 시간이 부족해서 영화의 8 장짜리 스틸컷 (정지화면) 만 보고 전체를 판단하려 했습니다. 마치 영화 전체를 보지 않고 포스터와 예고편만 보고 "이 영화 재미있을 거야"라고 말하는 것과 비슷합니다. 중요한 디테일 (배우의 표정 변화, 배경의 미세한 움직임 등) 을 놓치기 쉽습니다.
  • 문제 2: "기억력 부족으로 헛소리 (환각) 를 함"
    • 비유: AI 가 영상을 처음에 한 번만 보고, 그 후로는 텍스트만 보고 생각합니다. 마치 영화를 본 후 "아, 저 장면에서 주인공이 빨간 모자를 썼지..."라고 생각하다가, 사실은 파란 모자를 썼는데 기억이 안 나서 틀린 내용을 말해버리는 경우입니다. 영상 정보를 다시 확인하지 못하기 때문에, 처음 본 정보를 잊어버리거나 엉뚱한 상상을 하곤 했습니다.

2. VR-Thinker 의 해결책: "스마트한 영상 탐정"

VR-Thinker 는 **'Thinking-with-Image(이미지로 생각하기)'**라는 새로운 방식을 도입했습니다.

  • 핵심 기능 1: "필요할 때 다시 찾아보는 능력 (프레임 선택)"
    • 비유: VR-Thinker 는 처음에 8 장의 스틸컷만 봅니다. 하지만 "어? 이 부분에서 손가락 움직임이 좀 어색한데?"라고 생각하면, 직접 "저기 12 번째, 16 번째 장면을 다시 보여줘!"라고 요청합니다. 마치 영화관에서 "저기 그 장면 다시 틀어줘!"라고 리모컨을 누르듯, 필요한 순간에 필요한 장면을 직접 찾아서 다시 보고 판단합니다.
  • 핵심 기능 2: "작은 메모장 (가변적 기억 창)"
    • 비유: 모든 장면을 한 번에 기억하면 뇌가 터집니다. VR-Thinker 는 가장 최근의 중요한 장면들만 작은 메모장에 적어두고, 오래된 건 지웁니다. 하지만 중요한 장면을 다시 찾아오면 그걸로 메모장을 업데이트합니다. 이렇게 하면 기억 용량 (컴퓨터 메모리) 을 절약하면서도, 중요한 정보는 놓치지 않고 긴 영상도 정확하게 평가할 수 있습니다.

3. 훈련 과정: "현직 전문가에게 배우는 3 단계 교육"

이 AI 를 가르치는 과정은 3 단계로 나뉩니다.

  1. 1 단계: 초급 교육 (Cold Start)
    • 비유: AI 에게 "영상을 보고 어떻게 생각해야 하는지"와 "도구를 어떻게 쓰는지"를 정답이 있는 교재로 가르칩니다. "이런 상황에서는 장면을 다시 찾아봐야 해" 같은 기본 규칙을 익힙니다.
  2. 2 단계: 실전 연습 (Rejection Fine-Tuning)
    • 비유: AI 가 스스로 문제를 풀게 합니다. 이때 정답을 맞춘 경우만 남기고, 틀린 답을 고른 것은 모두 버립니다. "정답을 맞춘 사람만 남아서 더 열심히 공부하게 하라"는 식으로, 고품질의 사고 과정만 남아서 AI 의 실력을 다집니다.
  3. 3 단계: 심화 훈련 (GRPO)
    • 비유: AI 에게 여러 번 답을 내게 하고, 가장 논리적이고 정확한 답을 낸 경우에만 "잘했다!"라고 칭찬합니다. 특히 "단순히 점수만 맞춘 게 아니라, 왜 그 점수를 줬는지 설명도 잘한 경우"를 더 크게 칭찬하여, AI 가 자발적으로 더 깊이 생각하도록 유도합니다.

4. 결과: "긴 영상도 척척!"

이 방법을 통해 VR-Thinker 는 기존 AI 들이 가장 힘들어하던 긴 영상이나 복잡한 상황에서도 가장 높은 점수를 받았습니다.

  • 기존 AI: "영상이 너무 길어서 8 장만 봤는데, 중요한 장면이 빠져서 틀렸어요."
  • VR-Thinker: "아, 중요한 장면이 빠졌네? 그럼 다시 찾아서 보고 다시 판단할게. 이번엔 정확해요!"

요약

VR-Thinker 는 "영상을 한 번 보고 끝내는 게 아니라, 궁금한 점이 생기면 직접 찾아보고, 기억을 정리하며 논리적으로 생각해서" 영상을 평가하는 초지능 심사위원입니다. 덕분에 우리는 더 길고 복잡한 영상 콘텐츠도 더 정확하게 평가하고 개선할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →