← 최신 논문
🤖 AI

Distorted or Fabricated? A Survey on Hallucination in Video LLMs

이 논문은 비디오 대규모 언어 모델 (Vid-LLM) 에서 발생하는 환각 현상을 '동적 왜곡'과 '콘텐츠 위조'로 체계적으로 분류하고, 그 원인, 평가 방법, 완화 전략을 종합적으로 분석하여 향후 견고한 비디오 - 언어 시스템 구축을 위한 방향성을 제시합니다.

원저자: Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

게시일 2026-04-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 '비디오를 보고 설명하는 AI(비디오 LLM)'가 얼마나 자주 거짓말을 하거나 착각하는지를 분석한 보고서입니다.

이 AI 들은 책이나 정지된 사진을 볼 때는 꽤 똑똑하지만, 움직이는 영상을 보면 "아, 이거 내가 알고 있는 이야기랑 비슷하네"라고 생각해서 사실과 다른 내용을 지어내거나 (할루시네이션), 시간 순서나 사람 이름을 헷갈리는 문제가 생깁니다.

이 논문은 그 문제를 크게 두 가지 유형으로 나누고, 왜 그런 일이 일어나는지, 그리고 어떻게 고칠 수 있을지 재미있는 비유로 설명합니다.


1. 두 가지 종류의 '거짓말' (할루시네이션)

이 논문은 AI 의 착각을 크게 두 가지로 나눕니다.

① 동적인 왜곡 (Dynamic Distortion): "시간과 사람을 헷갈리는 AI"

이건 AI 가 사실은 보고 있는데, 내용을 잘못 해석하는 경우입니다. 마치 영화를 보다가 "아, 저 사람이 저기서 밥을 먹었지?"라고 기억을 잘못하는 것과 비슷합니다.

  • 시간 순서 뒤집기: "먼저 컵을 깨고, 그다음에 물을 마셨다"라고 말해야 하는데, "물을 마시고 컵을 깼다"라고 말해버립니다. (과거와 미래를 뒤섞음)
  • 시간 길이 착각: "10 초 동안 뛰었다"고 해야 하는데, "1 분 동안 뛰었다"고 과장하거나 반대로 줄여 말합니다.
  • 빈도수 세기 실패: "공을 3 번 차고"라고 해야 하는데, "공을 1 번만 찼다"거나 "10 번 찼다"고 잘못 셉니다.
  • 사람/장소 헷갈리기: 같은 영상 속에서도 "저 사람은 A 씨인데, B 씨인 척한다"거나, "거실 장면인데 부엌 이야기"를 섞어 말합니다.

비유: 마치 기억력이 나쁜 친구가 영화를 본 뒤, "주인공이 먼저 컵을 깼고, 그다음에 물을 마셨지?"라고 말하는데, 실제로는 그 반대였을 때의 상황입니다. 영화는 다 봤는데, 순서와 세부 사항이 꼬인 거죠.

② 내용 조작 (Content Fabrication): "상상력으로 지어낸 AI"

이건 AI 가 실제로 영상에 없는 것을, 내가 아는 지식이나 소리를 믿고 지어내는 경우입니다.

  • 상식적 착각: "사람이 개와 춤을 추고 있다"고 말하는데, 영상에는 개가 있을 뿐 춤은 추지 않습니다. "개와 사람이 있으면 춤을 출 것 같다"는 상식 때문에 거짓말을 한 것입니다.
  • 소리 때문에 속음: 영상 속 배경음악이 "축하 노래"인데, 화면에는 아무도 없는데 AI 가 "사람들이 축제를 열고 있다"고 말합니다. 시각적 증거가 없는데, 소리만 믿고 상황을 만들어낸 것입니다.

비유: 마치 소설가가 영화 대본을 읽지 않고, 제목만 보고 내용을 다 지어내는 경우입니다. "이 영화 제목이 '생일 파티'니까, 사람들이 케이크를 부수고 있을 거야!"라고 말하는데, 실제로는 케이크도, 파티도 없는 조용한 영상일 수 있습니다.


2. 왜 이런 일이 일어날까요? (원인)

  • 움직임을 못 봄: AI 는 정지된 사진은 잘 보지만, 시간이 흐르며 변하는 움직임을 제대로 이해하지 못합니다. 마치 정지된 사진만 보고 영화를 설명하라고 하는 것과 같습니다.
  • 기억력이 짧음: 영상이 길어지면 AI 가 앞부분을 잊어버려서, 처음에 본 사람과 나중의 사람을 헷갈립니다.
  • 지식 과신: AI 가 "이런 상황에서는 보통 이런 일이 일어난다"는 기존 지식을 너무 믿어서, 실제 영상과 다른 말을 합니다.

3. 어떻게 고칠 수 있을까요? (해결책)

논문은 이 문제를 해결하기 위해 몇 가지 방법을 제안합니다.

  • 움직임을 잘 보는 안경 쓰기: 정지된 사진만 보는 게 아니라, **움직임 ( Optical Flow 등)**을 잘 감지할 수 있는 새로운 AI 구조를 만듭니다.
  • 기억력 훈련: 긴 영상을 봐도 앞부분을 잊지 않도록 기억 장치를 강화합니다.
  • 상식 vs 사실 훈련: "네가 아는 게 맞을 수도 있지만, 지금 눈으로 보이는 게 사실이다"라고 가르치는 훈련을 시킵니다. 소리가 들린다고 해서 무조건 믿지 않고, 눈으로 확인하게 만드는 거죠.

4. 결론: 왜 이 연구가 중요할까요?

이 연구는 AI 가 자율 주행차로봇처럼 우리 삶에 직접 관여하는 분야에서, 잘못된 정보를 말하면 큰 사고가 날 수 있기 때문에 매우 중요합니다.

  • 현재 상태: AI 는 짧은 영상이나 간단한 질문에는 잘 대답하지만, 긴 영상이나 복잡한 상황에서는 여전히 많이 헷갈립니다.
  • 미래 전망: 앞으로는 AI 가 움직임을 정확히 파악하고, 기억력을 길러 우리가 믿고 의지할 수 있는 '진실한' 비디오 친구가 되도록 만들어야 합니다.

한 줄 요약:

"지금의 비디오 AI 는 영화를 보다가 순서도 헷갈리고, 없는 장면을 상상하는 '기억력 나쁜 친구' 같은데, 이 논문은 그 친구가 진짜 영화를 정확히 기억하고 설명할 수 있도록 도와주는 방법들을 정리한 지도입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →