← 최신 논문
💻 computer science

Exploring Audio Hallucination in Egocentric Video Understanding

본 논문은 체계적인 평가 프레임워크와 선별된 데이터셋을 도입하여 최첨단 오디오-비주얼 언어 모델이 자기 중심적 비디오 이해에서 시각적 단서로부터 실제 오디오가 아닌 소리를 추론하는 등 심각한 오디오 환각에 시달린다는 점을 규명함으로써, 다중 모달 시스템에서 강력한 신뢰성 평가의 시급한 필요성을 부각시킨다.

원저자: Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가상의 상황을 상상해 보세요. 당신의 가슴에 카메라를 부착하고, 당신의 시점에서 하루를 기록한다고 가정해 봅시다. 이를 '자아중심적 (egocentric)' 비디오라고 부릅니다. 때로는 카메라가 흔들리거나, 손에 가려지거나, 빈 벽을 향해 있기도 합니다. 이러한 순간에는 당신의 눈이 혼란스러울 수 있지만, 귀는 여전히 열심히 작동하고 있습니다.

이 논문은 컴퓨터에게 이러한 비디오를 듣는 법을 가르치는 것에 관한 것이지만, 연구자들은 재미있고 위험한 문제를 발견했습니다: 컴퓨터는 존재하지 않는 것들을 '듣고' 있습니다.

다음은 그들의 발견을 간단한 비유로 정리한 내용입니다:

1. 문제: 컴퓨터가 '듣는' 대신 '방을 읽고' 있습니다

최첨단 AI 모델 (초지능 컴퓨터 두뇌) 을 비디오를 바탕으로 미스터리를 해결하려는 탐정으로 생각해 보세요.

  • 이상적인 탐정: 오디오 테이프를 듣고 "개 짖는 소리가 들립니다"라고 말합니다.
  • 결함 있는 탐정 (이 논문의 AI): 비디오를 보고 개 사진이 보이면, 오디오 테이프가 완전히 무음이거나 바람 소리만 들리는 경우에도 즉시 "개 짖는 소리가 들립니다"라고 말합니다.

연구자들은 이를 **"오디오 환청 (Audio Hallucination)"**이라고 부릅니다. 이는 레몬 사진을 보고도 아무것도 냄새가 나지 않는 방에 있음에도 불구하고, 시트러스 냄새가 난다고 주장하는 사람과 같습니다. AI 는 자신이 보는 것에 너무 집착하여 사진과 일치하는 소리를 만들어냅니다.

2. 실험: '소리 퀴즈'

이를 입증하기 위해 연구자들은 이러한 AI 탐정들을 위한 특별한 테스트, 즉 팝 퀴즈를 만들었습니다.

  • 준비: 요리나 걷기 등 사람들이 행동을 하는 300 개의 실제 비디오를 가져와 10 초짜리 짧은 클립으로 잘랐습니다.
  • 질문: AI 에게 1,000 개의 구체적인 질문을 던졌습니다.
    • A 형 (진실): "지금 어떤 소리가 발생하고 있습니까?" (예: "믹서가 돌아가고 있습니까?")
    • B 형 (함정): "히이이 소리가 어디서 나고 있습니까?" (비디오에 히이이 소리가 전혀 없을 때).

연구자들은 AI 가 "히이이 소리는 없습니다"라고 말하거나, 비디오에서 가스레인지가 보였을 뿐인데 "아, 그건 아마 가스레인지일 거예요"라고 거짓말을 할지 확인하고 싶었습니다.

3. 결과: AI 는 함정에 실패했습니다

결과는 매우 형편없었습니다. 가장 똑똑한 AI 모델 (Qwen2.5 Omni 등) 도 이 부분에서는 매우 못했습니다.

  • 실제 소리에 대해 질문했을 때: AI 는 약 56% 에서 63% 의 정답률을 보였습니다. 실제로 일어나고 있는 일을 묘사하는 데는 나쁘지 않았습니다.
  • 가짜 소리 (함정) 에 대해 질문했을 때: AI 의 정확도는 27% 에서 39% 사이로 급락했습니다.

비유: 학생이 시험을 본다고 상상해 보세요. "하늘의 색은 무엇입니까?"라고 물으면 정답을 맞힙니다. 하지만 "보이지 않는 코끼리의 색은 무엇입니까?"라고 물으면, 코끼리가 어떻게 생겼을 것이라고 생각하는 것에 기반해 추측하기보다는 보이지 않는다는 것을 인정하는 대신, "파란색입니다"라고 자신 있게 말합니다.

AI 는 본질적으로 시각에 기반한 추측으로 빈칸을 채우고 있을 뿐, "나는 그 소리를 듣지 못합니다"라고 인정하지는 않습니다.

4. 두 가지 유형의 '가짜 청각'

연구자들은 이러한 실수를 두 가지 범주로 분류했습니다:

  1. "주인공" 실수 (전경): 비디오 속 사람이 마땅히 만들어야 할 소리를 AI 가 듣습니다.
    • 예시: 비디오에서 누군가 믹서를 사용하는 모습이 보입니다. AI 는 "기계적인 윙윙거리는 소리가 들립니다"라고 말합니다. 오디오가 고장 났거나 무음이라 하더라도, 믹서가 움직이고 있으므로 AI 는 그 소리가 있다고 가정합니다.
  2. "배경 소음" 실수 (배경): AI 는 실제로 존재하지 않는 환경의 소리를 듣습니다.
    • 예시: 비디오는 조용한 부엌을 보여줍니다. AI 는 창문이 보였을 뿐인데 "밖에 새들이 지저귀는 소리가 들립니다"라고 말합니다.

5. 이것이 중요한 이유

이 논문은 결론적으로 현재 이러한 AI 모델들은 신뢰할 수 없는 청자라고 말합니다. 그들은 귀보다 눈에 너무 많이 의존하고 있습니다.

이 기술을 실제 시나리오 (예: 시끄러운 작업장을 이해하는 로봇이나 시각 장애인의 주변 환경을 이해하는 것) 에 적용한다면, 로봇은 실제로는 빨간 불빛을 보고 있을 뿐인데 경고 사이렌 소리를 듣고 있다고 생각할 수 있습니다. 연구자들은 이러한 모델들이 소리를 통해 세상을 이해하도록 신뢰하기 전에 더 나은 '귀 확인' 시스템을 구축해야 한다고 말합니다.

간단히 말해: 이 논문은 오늘날 가장 똑똑한 비디오 AI 들이 입모양 읽는 데는 너무 능숙해서 목소리에 귀를 기울이는 것을 잊어버리고, 종종 자신이 보는 사진에 맞는 소리를 만들어낸다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →