← 최신 논문
🤖 AI

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

이 논문은 현재의 비디오 거대언어모델(Video-LLMs)이 긴 영상 속에서 특정 캐릭터를 진정으로 추적하는 데 크게 실패하며, 대신 얕은 성별 단서에 의존하고 동일한 성별의 개인들을 구별하지 못한다는 점을 밝혀내며, 이는 벤치마크 점수가 모델의 실제 시계열 추론 및 정체성 추적 능력을 과대평가하게 만드는 원인이 된다.

원저자: Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

게시일 2026-07-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 70억에서 80억 개의 파라미터를 가진 아주 똑똑한 로봇 탐정을 고용해 *빅뱅 이론(The Big Bang Theory)*의 에피소드 전체를 지켜보게 했습니다. 당신의 임무는 로봇에게 매우 간단합니다. "쉘든(Sheldon)을 관찰하고, 그의 옷이 바뀌는 정확한 순서를 말해줘."

당신은 로봇이 매의 눈처럼 쉘든의 얼굴에 시선을 고정하고, 모든 장면을 추적하며, 옷차거 변화를 완벽한 정밀도로 기록할 것이라고 기대할 것입니다. 하지만 여기 반전이 있습니다. 로봇은 실제로 쉘든을 보고 있는 것이 아닙니다. 그저 매우 게으른 지름길을 이용해 추측하고 있을 뿐입니다.

거대한 "쉘든" 교체 작업

무슨 일이 일어나고 있는지 알아내기 위해, 연구진은 영리한 속임수를 썼습니다. 그들은 정확히 동일한 영상과 동일한 객관식 답안을 사용하되, 질문 속의 이름만 바꾸었습니다.

  • 원래 질문: "쉘든의 옷이 바뀌는 순서는?"
  • 교체된 질문: "**레너드(Leonard)**의 옷이 바뀌는 순서는?" (동일한 영상, 동일한 답안).

만약 로봇이 정말로 캐릭터를 추적하고 있었다면, "잠깐, 레너드는 쉘든과는 다른 옷을 입는데!"라고 판단하여 다른 답을 골랐어야 합니다. 하지만 결과는 어땠을까요? 로봇은 신경 쓰지 않았습니다.

성별이 같은 캐릭터를 교체했을 때(예: 쉘든을 레너드로 교체), 로봇이 답을 바꾼 경우는 약 **7%에서 17%**에 불과했습니다. 이는 주사위를 던져 찍는 것과 별반 다를 게 없었습니다. 로봇은 이름을 무시하고 그저 자신이 좋아하는 답을 고르고 있었던 것입니다.

"성별" 글리치

그렇다면 로봇이 사람을 보고 있는 게 아니라면, 무엇을 보고 있는 걸까요? 연구진은 로봇이 매우 거칠고 흐릿한 필터를 사용하고 있다는 것을 발견했습니다. 바로 성별입니다.

남성 캐릭터를 여성 캐릭터로 바꿨을 때(예: 쉘든을 페니로 교체), 로봇은 답을 바꿀 확률이 훨씬 높았습니다(20%에서 43%). 로봇은 마치 "오, 질문이 '남자'에서 '여자'로 바뀌었으니 옷도 달라지겠구나!"라고 생각하는 듯했습니다.

하지만 한 명의 남성을 다른 남성으로 바꿨을 때, 로봇은 완전히 길을 잃었습니다. 로봇은 쉘든과 하워드를 구분하는 능력이 고양이와 개를 구분하는 것보다도 못했습니다. 로봇은 "남성"과 "여성"은 보고 있었지만, "쉘든"은 볼 수 없었던 것입니다.

"마법 상자"의 환상

논문은 또한 로봇이 학습 데이터로부터 내용을 암기하여 속임수를 쓰고 있는지 확인했습니다. 연구진은 영상 없이 오직 질문의 텍스트와 쇼의 제목만 로봇에게 보여주었습니다. 로봇은 거의 무작위 확률 수준(약 18~20%)의 점수를 기록했습니다. 즉, 대본을 미리 읽어서 속임수를 쓴 것이 아니라, 단순히 시각적인 부분에 서툴렀던 것입니다.

또한 연구진은 로봇에게 더 많은 프레임(더 많은 "스냅샷")을 제공하여, 단순히 더 많은 정보가 필요한 것인지 테스트했습니다. 32 프레임을 주는 것이 16 프레임을 줄 때보다 옷을 포착하는 능력 자체는 약간 개선되었지만, 특정 캐릭터를 추적하는 능력은 여전히 나아지지 않았습니다. 그것은 마치 시각 장애인에게 더 좋은 안경을 씌워준 것과 같았습니다. 옷은 더 잘 보이게 되었지만, 여로도 누가 그 옷을 입고 있는지는 여전히 알지 못했습니다.

객관식의 함정

가장 놀라운 부분은 이것입니다: 로봇은 표준 테스트에서 **37~38%**의 정답률을 보였습니다. 이 수치는 매우 인상적으로 들립니다! 하지만 이 점수는 신기루였습니다.

연구진이 로봇에게 객관식 대신 자신의 언어로 직접 답을 써보라고 요청했을 때(주관식/Open-Ended), 점수는 18에서 25포인트나 폭락했습니다.

  • 객관식 점수: ~38%
  • 주관식 점수: 1319%

왜 점수가 떨어졌을까요? 객관식 테스트는 로봇에게 다섯 가지 선택지라는 "마법 상자"를 제공했기 때문입니다. 로봇이 그저 찍거나 자신이 좋아하는 답(예: "E" 또는 "A")을 고르는 것이라 해도, 5개 중 하나를 맞출 확률은 20%였기 때문입니다. 스스로 답을 생성해야 할 때, 로봇에게는 안전망이 없었고 완전히 실패했습니다. 실제로 오픈 소스 로봇들이 낸 151개의 주관식 답변 중 단 하나도 완전히 정답인 것이 없었습니다.

결론

이 논문은 이러한 비디오-언어 모델(Video-LLMs)이 실제로 캐릭터를 추적하고 있는 것이 아니라고 결론짓습니다. 이들은 이름과 영상 사이의 연결 고리를 "환각(hallucinating)"하고 있는 것입니다. 이들은 "사람이 셔츠를 입고 있다"는 것은 잘 포착하지만, "누가?"라는 질문에는 쥐약입니다.

연구진은 현재 벤치마크의 높은 점수들이 오해의 소지가 있다고 제안합니다. 그 점수들은 모델이 스토리를 얼마나 잘 따라가는지를 측정하는 것이 아니라, 성별 힌트를 이용한 추측이나 운 좋은 객관식 찍기 능력을 측정하고 있는 것입니다. 모델이 "이름 교체" 테스트와 "주관식" 테스트를 통과하기 전까지, 우리는 그 모델이 영상을 진정으로 "보고 있다"고 말할 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →