← 최신 논문
💻 computer science

VidHal: Benchmarking Temporal Hallucinations in Vision LLMs

이 논문은 비디오 기반 시각 대형 언어 모델 (VLLM) 의 시간적 환각 현상을 평가하기 위해 다양한 수준의 환각을 포함하는 캡션과 정밀한 순위 평가 과제를 도입한 새로운 벤치마크 'VidHal'을 제안하고, 이를 통해 기존 모델들의 심각한 한계를 규명합니다.

원저자: Wey Yeh Choong, Yangyang Guo, Mohan Kankanhalli

게시일 2026-04-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wey Yeh Choong, Yangyang Guo, Mohan Kankanhalli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎥 비디할 (VidHal): "영상 AI 의 환각 (Hallucination) 을 잡아내는 새로운 시험지"

이 논문은 **비전 대형 언어 모델 **(VLLM)이라는 AI 들이 영상을 볼 때 얼마나 자주 "망상"을 일으키는지 측정하는 새로운 기준을 제시합니다.

마치 AI 가 영화를 보고 줄거리를 요약해달라고 했을 때, 실제로는 없는 장면을 지어내거나 시간 순서를 뒤죽박죽 섞어 말하는 현상을 연구한 것입니다.


1. 왜 이 연구가 필요한가요? (배경)

지금까지 AI 연구자들은 주로 정지된 사진을 보고 AI 가 얼마나 헛소리를 하는지 측정했습니다. 하지만 영상은 다릅니다. 사진은 정적이지만, 영상은 시간이 흐르고 사물이 움직이며 사건이 순서대로 일어납니다.

  • 기존의 문제점: 기존 시험지들은 "사과가 빨간색인가?" 같은 단순한 질문만 냈습니다. 하지만 영상에서는 "사과가 왼쪽에서 오른쪽으로 굴렀는데, AI 가 오른쪽에서 왼쪽으로 굴렀다고 말하면?" 같은 시간적, 공간적 뉘앙스를 놓치는 경우가 많습니다.
  • 비유: 기존 시험지는 "이 사진에 고양이가 있니?"라고 물어서 "있어요"라고 답하는지 보는 것이었다면, **비디할 **(VidHal)은 "고양이가 3 초 전에 소파에서 뛰어내렸는데, 5 초 후에 책상 위에 앉아있다면 이 순서가 맞니?"라고 물어보는 것입니다.

2. 비디할 (VidHal) 이란 무엇인가요? (핵심 아이디어)

저자들은 **비디할 **(VidHal)이라는 새로운 '시험지'를 만들었습니다. 이 시험지는 다음과 같은 특징이 있습니다.

🎬 5 가지 시간적 요소 (Temporal Aspects)

AI 가 헛소리를 할 수 있는 5 가지 주요 영역을 집중적으로 테스트합니다.

  1. **행동 **(Action) "공을 차다" vs "공을 던지다"
  2. **방향 **(Direction) "왼쪽으로 간다" vs "오른쪽으로 간다"
  3. **순서 **(Order) "먼저 A 를 하고, 그다음 B 를 한다" vs "B 를 먼저 한다"
  4. **속성 **(Attribute) "옷이 빨간색" vs "옷이 파란색"
  5. **객체 **(Object) "개" vs "고양이"

📝 "진짜 vs 가짜" 캡션 순위 매기기 (Caption Ordering)

기존 시험지가 "정답/오답" (Yes/No) 이었다면, 비디할은 더 정교한 방식을 사용합니다.

  • 상황: AI 에게 하나의 영상과 세 가지 설명 (캡션) 을 보여줍니다.
    • A 설명: 완전히 사실 (진짜).
    • B 설명: 약간의 거짓 (예: 색깔을 살짝 다르게).
    • C 설명: 완전히 엉뚱한 거짓 (예: 아예 다른 사건).
  • 과제: AI 에게 "이 설명들을 진짜에 가까운 순서대로 나열해봐"라고 시킵니다.
  • 비유: 마치 **맛있는 음식 세 가지를 주고, "어떤 것이 가장 신선한 재료로 만들었는지 순서대로 말해봐"**라고 하는 것과 같습니다. AI 가 "가장 나쁜 것"과 "조금 나쁜 것"을 구분할 수 있어야 진짜로 영상의 흐름을 이해한 것입니다.

3. 실험 결과: AI 들은 어떻게 했나요?

저자들은 GPT-4, Gemini, LLaVA 등 23 개의 유명 AI 모델을 이 시험지에 도전시켰습니다. 결과는 놀랍도록 불완전했습니다.

  • 대부분의 AI 는 "약한 거짓말"과 "진짜"를 구별하지 못했습니다.
    • 예: "공이 오른쪽으로 굴렀다 (진짜)"와 "공이 왼쪽으로 굴렀다 (거짓)"를 구분하는 것은 잘했지만, "공이 오른쪽으로 굴렀다 (진짜)"와 "공이 오른쪽으로 살짝 미끄러졌다 (약한 거짓)"를 구분하는 데는 실패했습니다.
  • 특히 '방향'과 '순서'에서 약했습니다.
    • AI 들은 영상 속 사물이 어느 방향으로 움직였는지사건이 어떤 순서로 일어났는지를 이해하는 데 여전히 어려움을 겪고 있습니다.
  • **이미지 편향 **(Image Prior)
    • AI 들은 영상의 전체 흐름을 보기보다, **단 한 장의 프레임 **(사진)만 보고도 결론을 내리는 경향이 강했습니다. 마치 영화를 보지 않고 포스터만 보고 줄거리를 추측하는 것과 같습니다.

4. 이 연구의 의미 (결론)

이 논문은 우리에게 중요한 메시지를 줍니다.

"지금의 AI 는 영상을 볼 때 시간의 흐름을 제대로 이해하지 못하고, 작은 거짓말을 잡아내지 못합니다. 우리는 AI 가 단순히 '무엇이 있는지' 아는 것을 넘어, **'무엇이 언제, 어떻게 일어났는지'**를 정확히 이해하도록 만들어야 합니다."

한 줄 요약:

**비디할 **(VidHal)은 AI 가 영상을 볼 때 "시간을 왜곡하거나" "사건을 뒤섞는" 망상 (Hallucination) 을 찾아내기 위해 만든 정교한 '진실 탐정' 도구입니다. 이를 통해 우리는 더 똑똑하고 신뢰할 수 있는 영상 AI 를 만들 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →