VGGSounder: Audio-Visual Evaluations for Foundation Models
이 논문은 기존 VGGSound 데이터셋의 레이블링 및 정렬 한계를 극복하기 위해 설계된 포괄적으로 재주석 처리된 멀티 레이블 테스트 세트인 VGGSounder을 소개하며, 이를 통해 상세한 모달리티 분석과 새로운 혼동 지표를 통해 오디오-비주얼 파운데이션 모델에 대한 더욱 신뢰할 수 있고 정밀한 평가를 가능하게 한다.
당신이 로봇에게 비디오를 보여주며 세상을 이해하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 드럼이 두드려지는 것을 보고 '쿵' 하는 소리를 들으면, "저건 드럼이야!"라고 말해야 한다는 것을 알기를 원합니다.
오랫동안 연구자들은 이 로봇들을 테스트하기 위해 VGGSound라는 거대한 비디오 라이브러리를 사용했습니다. 하지만 이 논문의 저자인 Daniil Zverev와 그의 팀은 이 라이브러리가 마치 엉망진창으로 정리되지 않은 다락방과 같다는 사실을 발견했습니다. 여기에는 로봇이 실제로 똑똑한 것인지 아니면 그저 운이 좋았던 것인지 판단하는 것을 불가능하게 만드는 세 가지 큰 문제가 있었습니다.
"단일 라벨"의 함정: 이 라이브러리는 모든 비디오에 오직 하나의 태그만 붙이도록 강요했습니다. 하지만 현실 세계에서 비디오는 개가 짖는 동시에 자동차 경적 소리가 들릴 수도 있습니다. 기존의 라이브러리는 이 중 하나만 선택하고 나머지는 무시했습니다. 이는 페퍼로니와 버섯이 들어간 피자를 그저 "치즈 피자"라고만 설명하는 것과 같습니다.
"혼란스러운 이름" 문제: 어떤 라벨들은 쌍둥이처럼 닮아 있었습니다. 어떤 태그는 "개 짖는 소리"라고 되어 있고, 다른 태그는 "개 멍멍 소리"라고 되어 있을 수 있습니다. 로봇은 본질적으로 같은 것인데도 테스트에서는 서로 다른 것으로 취급되어 혼란을 겪었습니다.
"유령" 문제: 때때로 라이브러리는 영상 속에 실제로는 보이지 않거나 들리지 않는 소리가 있다고 주장했습니다. 예를 들어, 비디오는 "오케스트라"라고 라벨링되어 있지만, 악기는 보이지 않고 음악만 들릴 수 있습니다. 기존의 테스트는 이러한 불일치를 신경 쓰지 않았습니다.
해결책: VGGSounder
팀은 업그레이드된 새로운 라이브러리인 VGGSounder를 구축했습니다. 이것은 엉망인 다락방을 고도로 정돈된 최첨단 박물관으로 리모델링하는 것과 같습니다.
그들이 다르게 수행한 점은 다음과 같습니다:
멀티 라벨링(Multi-Labeling): 하나의 태그를 강요하는 대신, 모든 비디오가 필요한 만큼의 많은 태그를 가질 수 있게 했습니다. 하나의 비디오에 "드럼", "기타", "노래"를 동시에 태그할 수 있습니다.
모달리티 태그(Modality Tags): 모든 개별 태그에 특별한 "체크리스트"를 추가했습니다. 그들은 물었습니다: 이것이 보이는가? 이것이 들리는가? 이를 통해 연구자들은 로봇이 보는 것에 능숙한지, 듣는 것에 능숙한지, 혹은 두 가지를 모두 잘하는지를 테스트할 수 있습니다.
메타 라벨(Meta-Labels): 까다로운 상황을 위한 "경고 표지판"을 추가했습니다. 만약 비디오에 배경 음악, 내레이션, 또는 소리만 나오는 정지 화면이 있다면 이를 표시했습니다. 이는 연구자들이 로봇이 소음 때문에 주의가 산만해지는지 확인할 수 있게 해줍니다.
거대한 발견: "주의 분산" 효과
팀이 발견한 가장 놀라운 사실은 로봇들에게 눈과 귀를 모두 주었을 때 그들이 어떻게 행동하는가였습니다.
그들은 **"모달리티 혼란(Modality Confusion)"**이라는 새로운 점수를 만들어냈습니다. 당신이 오직 눈만을 사용하여 퍼즐을 잘 풀고 있다고 상상해 보세요. 그런데 누군가 당신에게 두 번째 퍼즐 조각(소리)을 건네주자 갑자기 첫 번째 퍼즐을 풀 수 없게 되었습니다. 그것이 바로 모달리티 혼란입니다.
발견 내용: 최신 기술이 집약된 "파운데이션 모델(Foundation Models)"(초지능 AI 로봇들) 중 상당수는 시각과 청각을 동시에 허용했을 때 오히려 성능이 저하되었습니다.
편향(Bias): 이 로봇들은 소리에 대해 "눈이 먼" 것처럼 보였습니다. 만약 개가 짖는 비디오를 보여주고 소리만 들려준다면, 그들은 실패했습니다. 하지만 개를 볼 수 있다면 성공했습니다. 시각과 청각을 모두 사용하려고 할 때, 소리는 종종 그들을 혼란스럽게 만들었고, 그들은 소리를 완전히 무시한 채 오직 보이는 것에만 의존했습니다.
이것이 왜 중요한가
이 논문은 우리가 단순히 로봇에게 방대한 데이터를 던져주고 스스로 배우기를 바랄 것이 아니라, 로봇이 정확히 어떻게 생각하고 있는지 알려주는 더 나은 테스트(VGGSounder)가 필요하다고 주장합니다.
기존 테스트 (VGGSound): 안개가 자욱하고 표지판이 없는 도로에서 치르는 운전 면허 시험과 같습니다. 운 좋게 통과할 수는 있지만, 당신이 안전한 운전자인지는 알 수 없습니다.
새로운 테스트 (VGGSounder): 명확한 표지판이 있고, 위험을 지적해 주는 부조종사가 있으며, 당신이 결정을 내릴 때 어떤 감각을 사용했는지 알려주는 성적표가 있는 운전 면허 시험과 같습니다.
저자들은 이러한 새로운 AI 모델들이 인상적이긴 하지만, 시각과 청각을 효과적으로 결합하는 데 어려움을 겪는 경우가 많다고 결론지었습니다. 이 모델들은 시각 정보가 있으면 소리를 무시하는 경향이 있는데, 이는 세상을 총체적으로 이해해야 하는 기계들에게 중대한 결함입니다. VGGSounder는 이러한 결함을 드러내어 엔지니어들이 이를 수정할 수 있도록 설계된 도구입니다.
기술 요약: VGGSounder: 파운데이션 모델을 위한 오디오-비주얼 평가
문제 정의
오디오-비주얼 파운데이션 모델의 등장은 이들의 다중 모달(multi-modal) 이해도를 평가하기 위한 신뢰할 수 있는 벤치마크를 필요로 합니다. VGGSound 데이터셋은 오디오-비주얼 분류를 위한 표준 벤치마크이지만, 저자들은 청각 및 시각적 역량의 평가를 왜곡하는 몇 가지 결정적인 한계를 식별했습니다:
불완전한 레이블링: VGGSound는 단일 레이블 분류 체계를 사용하지만, 비디오 콘텐츠는 본질적으로 다중 레이블(예: 비디오에 "드럼 세트 연주"와 "어쿠스틱 기타 연주"가 모두 포함될 수 있음)입니다.
중복 및 모호한 클래스: VGGSound의 309개 클래스에는 동의어 쌍(예: "timpani"와 "tympani"), 엄격한 하위 클래스(예: "cow lowing"과 "bull bellowing"), 그리고 상호 배타적이지 않은 의미론적 중복 개념이 포함되어 있습니다.
모달리티 불일치: 검증 단계를 거쳤음에도 불구하고, 상당 부분의 샘플(테스트 세트의 48.43%)은 레이블이 시각적으로 보이지 않거나, 청각적으로 들리지 않거나, 혹은 둘 다인 경우를 포함합니다. 흔한 혼란 요인으로는 배경 음악, 음성 내레이션(voice-over), 정지 영상 등이 있으며, 이는 두 모달리티 모두에서 정답 레이블과 일치하지 않는 단서를 생성합니다.
이러한 문제들은 다중 모달 모델, 특히 VGGSound에 특화되어 미세 조정(fine-tuning)되지 않은 파운데이션 모델의 성능을 체계적으로 과소평가하게 만들며, 모델이 오디오 대 시각적 단서에 의존하는 정도를 파악하는 것을 방해합니다.
방법론
이러한 한계를 해결하기 위해, 저자들은 VGGSound을 확장하여 포괄적으로 재주석(re-annotated)된 다중 레이블 테스트 세트인 VGGSounder를 소개합니다. 방법론은 다음과 같은 엄격한 주석 파이프라인을 포함합니다:
다중 레이블 분류로의 전환: 공존하는 이벤트를 수용하기 위해 벤치마크를 단일 레이블에서 다중 레이블 분류로 전환합니다.
인간 주석 파이프라인:
골드 스탠다드(Gold Standard) 생성: 참조 세트를 구축하기 위해 4명의 컴퓨터 비전 전문가가 417개의 샘플을 수동으로 레이블링했습니다.
제안 생성: 상태 최첨단(SOTA) 모델의 예측과 수동 휴리스틱을 결합한 하이브리드 전략을 사용하여 93% 이상의 재현율(recall)을 가진 레이블 제안을 생성했습니다.
크라우드소싱 재주석: 전체 VGGSound 테스트 세트(15.1k 클립)를 Amazon Mechanical Turk을 통해 재주석했습니다. 주석 작업자들에게는 다음 과업이 부여되었습니다:
배경 음악(background music), 음성 내레이션(voice-over), 또는 **정지 영상(static images)**의 존재 여부 확인(메타-레이블).
각 레이블 제안의 모달리티 결정 (Audible, Visible, 또는 Both).
제안된 내용에 없는 누락된 클래스 추가.
레이블 병합: 최종 레이블은 다수결 투표를 통해 병합되었습니다. 일관성을 보장하기 위해 동의어 클래스와 상위/하위 클래스 관계가 자동으로 적용되었습니다 (예: "cow lowing"이 존재하면 "cattle mooing"이 추가됨).
새로운 평가 지표:
표준 지표: 단일 모달(오디오 전용, 비주얼 전용) 및 다중 모달 입력에 대해 Subset Accuracy, F1-score, Hit score를 계산했습니다.
모달리티 혼란(μ): 두 번째 모달리티를 추가했을 때 발생하는 부정적인 영향을 정량화하기 위해 제안된 새로운 지표입니다. 이는 모델이 단일 모달리티로는 올바르게 분류했지만, 두 모달리티가 모두 존재할 때 잘못 분류하는 샘플의 비율을 측정합니다. 이는 모달리티가 성공적으로 결합되지 못해 발생하는 "주의 분산(distracted)" 모델을 드러냅니다.
주요 기여
VGGSounder 데이터셋: 상세한 레이블별 모달리티 주석(Audible/Visible)과 흔한 혼란 요인에 대한 메타-레이블(배경 음악, 음성 내레이션, 정지 영상)을 갖춘 다중 레이블 오디오-비주얼 분류 벤치마크입니다.
한계 분석: 모달리티 불일치율과 클래스 공존 현상을 포함한 VGGSound의 결함을 질적 및 양적으로 입증했습니다.
포괄적인 벤치마킹: 4개의 오디오-비주얼 임베딩 모델(CAV-MAE, DeepAVFusion, AV-Siam, Equi-AV)과 7개의 파운데이션 모델(Gemini 제품군, VideoLLaMA-2, Unified-IO-2, PandaGPT, Ola)을 포함한 11개의 최첨단 모델을 평가했습니다.
모달리티 혼란 지표: 모델이 추가적인 입력 모달리티에 노출되었을 때 성능 저하를 감지하기 위한 μ를 도입했습니다.
결과
저자들은 VGGSoldner에서 모델들을 벤치마킹하여 다음과 같은 핵심적인 발견을 도출했습니다:
파운데이션 모델 vs 임베딩 모델: 파운데이션 모델은 다중 모달 입력에서 전문화된 임베딩 모델과 유사한 성능을 보이지만, 단일 모달 성능은 크게 다릅니다. (VGGSound에 미세 조정된) 임베딩 모델은 오디오 단서에 크게 의존하는 반면, 파운데이션 모델은 비주얼 단서에 강한 편향을 보이며 오디오 전용 입력에서는 종종 낮은 성능을 보입니다.
모달리티 혼란: 모든 모델이 모달리티 혼란을 겪습니다. 주목할 만한 비율의 샘플(4~11%)이 단일 모달리티로는 올바르게 분류되지만, 두 모달리티가 모두 제공될 때 오분류됩니다. 대부분의 파운데이션 모델의 경우, 비주얼 입력에 오디오가 추가될 때 혼란이 더 높게 나타나는데(μA>μV), 이는 비주얼 정보가 있을 때 오디오 레이블을 망각함을 시사합니다.
메타-클래스의 영향:
배경 음악: 모든 모델이 배경 음악을 주요 오디오 소스로부터 분리하는 데 어려움을 겪으며, 이는 성능 저하로 이어집니다.
음성 내레이션: 임베딩 모델은 음성 내레이션 시 상당한 성능 저하를 겪는 반면, 파운데이션 모델은 덜 산만해지거나 오히려 성능이 향상됩니다.
정지 영상: 모든 모델의 비주얼 성능이 정지 영상에서 떨어지며, 이는 모델이 시간적 단서(temporal cues)에 의존함을 나타냅니다.
레이블 품질: 자동 생성된 동의어만을 사용하는 대신 인간이 큐레이션한 레이블을 포함함으로써, 가양성(false positives)을 크게 줄이고 원본 VGGSound보다 성능 프로파일링의 정확도를 높였습니다.
의의
본 논문은 VGGSounder가 차세대 오디오-비주얼 파운데이션 모델을 정확하게 평가하기 위한 필수적인 도구라고 주장합니다. 모달리티 인지 주석을 제공함으로써 다음과 같은 기능을 가능하게 합니다:
정밀한 프로파일링: 연구자들은 모델이 오디오, 비주얼, 또는 두 단서 모두에 의존하는지 구분할 수 있으며, 특정 실패 모드(예: 배경 음악에 의한 주의 분산)를 식별할 수 있습니다.
강건한 평가: 다중 레이블 설정과 불일치 샘플의 제거는 원본 VGGSound에서 발견된 왜곡된 모델 평가를 방지합니다.
진단적 통찰: 모달리티 혼란 지표(μ)는 모델이 모달리티를 얼마나 잘 통합하는지에 대한 정량적 척도를 제공하며, 두 번째 모달리티를 추가하는 것이 항상 성능을 향상시키는 것이 아니라 때로는 저하시킬 수도 있음을 강조합니다.
저자들은 VGGSounder가 모달리티 혼란 완화 전략 개발을 촉진하며, 다중 모달 이해를 평가하기 위한 더욱 신뢰할 수 있는 토대가 된다고 결론짓습니다.