← 최신 논문
🤖 AI

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

본 논문은 13 개 도메인에 걸친 60 시간의 실제 오디오 - 비디오 데이터로 구성된 포괄적이고 인간이 검증한 벤치마크인 SONIC-O1 을 소개하며, 이는 다중 모달 대규모 언어 모델의 요약, 질문 응답 및 시간적 추론 능력에 대한 성능 격차를 평가하고 드러내기 위해 고안되었습니다.

원저자: Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 비서를 고용하여 당신의 삶을 관리하도록 돕는다고 상상해 보세요. 당신은 두 가지 유형의 후보자를 가지고 있습니다: 슈퍼 전문가(Gemini 와 같은 폐쇄형 소스 모델)와 오픈소스 커뮤니티 팀(Qwen 또는 MiniCPM 과 같은 다양한 오픈소스 모델)입니다.

지금까지 당신은 주로 이들을 정적 사진(가족 초상화 등)으로 보여주고 "여기서 무슨 일이 일어나고 있나요?"라고 물어보며 테스트해 왔습니다. 하지만 실제 삶은 사진이 아닙니다. 그것은 소리가 있는 영화입니다. 목소리 톤, 멈춤, 배경 소음, 누가 언제 말하는지 등 모든 것이 중요한 대화입니다.

이 논문은 이러한 AI 비서들이 실제 세계의 비디오 및 오디오 대화를 얼마나 잘 이해하는지 테스트하기 위해 특별히 설계된 새로운 엄격한 "최종 시험"인 SONIC-O1을 소개합니다.

다음은 간단한 비유를 사용하여 시험의 내용과 결과가 무엇을 말해주는지 정리한 것입니다:

1. 시험: SONIC-O1

SONIC-O1 을 60 시간 분량의 실제 생활 녹음 라이브러리라고 생각하세요. 이는 가짜 대본이 아니라 13 가지 실제 시나리오에서 가져온 실제 영상입니다. 예를 들어:

  • "고위험" 공간: 법정, 비상 대응 전화, 정신 건강 상담.
  • "일상 업무" 공간: 구직 인터뷰, 고객 서비스 전화, 병원 진료.
  • "커뮤니티" 공간: 주민 총회 및 스포츠 해설.

이 시험은 세 가지 특정 기술을 점검합니다:

  • 요약자: AI 가 30 분짜리 비디오를 보고 무슨 일이 일어났는지 명확하고 정확한 요약을 작성할 수 있나요? (법정 속기사와 같은 역할).
  • 탐정 (객관식): AI 가 시각적 단서와 청각적 단서를 연결해야 하는 까다로운 객관식 질문에 답할 수 있나요? (예: "고객이 왜 화를 냈나요?"라는 질문은 제스처를 보는 것뿐만 아니라 톤을 듣는 것을 요구함).
  • 시간 추적자 (Temporal Localization): 이것이 가장 어려운 부분입니다. "의사가 진단을 언급한 정확한 시점은 언제인가요?"라고 물으면 AI 는 시계에서 정확한 초를 가리켜야 합니다. 심판에게 "반전 후반에 무언가 일어났다"가 아니라 "42.3 초에 반칙이 발생했다"고 말하게 하는 것과 같습니다.

중요하게도, 이 시험은 공정성도 점검합니다. 라이브러리에는 다양한 인종, 성별, 연령대의 사람들이 포함되어 있습니다. 연구자들은 다음과 같은 점을 알고 싶어 합니다: AI 가 20 대 흑인 여성이 말할 때와 40 대 백인 남성이 말할 때 똑같이 잘 작동할까요?

2. 결과: 누가 통과했나요?

"전문가"와 "아마추어" 사이의 격차

  • 슈퍼 전문가 (Gemini 3.0 Pro): 이 모델은 시험을 일관되게 완벽하게 통과했습니다. 긴 비디오에서 시간을 정확하게 추적하고 혼란에 빠지지 않고 복잡하고 감정적인 대화를 처리할 수 있는 유일한 모델이었습니다.
  • 오픈소스 팀: 최고의 오픈소스 모델 (Qwen3-Omni 등) 은 "요약자"와 "탐정" 작업에서는 decent 한 성과를 보였습니다. 하지만 "시간 추적자" 작업에서는 거대한 벽에 부딪혔습니다.
    • 비유: 오픈소스 모델에게 "축구 경기에서 골이 언제 발생했나요?"라고 물어본다고 상상해 보세요. "42 분에"라고 대답하는 대신, 종종 "42 초에"라고 말합니다 (비디오가 0:00 에서 시작되었음을 잊고 클립이 새로 시작된 것처럼 취급함). 그들은 타임라인에서 자신의 위치를 잃습니다.
    • 격차: 최고의 오픈소스 모델은 시간 추적 능력에서 폐쇄형 소스 모델보다 22.6% 나 더 나빴습니다.

"공정성" 문제
이제 시험이 진지해졌습니다. 연구자들은 AI 의 성능이 모든 사람에게 동일하지 않다는 사실을 발견했습니다.

  • "시간 추적자" 편향: 성능 격차는 누가 말하는지에 따라 매우 컸습니다. 예를 들어, 원주민 화자가 관련된 사건을 식별할 때, 일부 오픈소스 모델은 정확도가 **0%**로 떨어졌습니다 (완전히 실패함). 반면 폐쇄형 소스 모델은 여전히 약 40% 정도는 맞췄습니다.
  • "흑인 화자" 격차: 모델들은 아시아계 또는 백인 참가자가 등장하는 비디오를 요약하거나 질문에 답할 때보다, 흑인 참가자가 등장하는 비디오를 다룰 때 일관되게 더 나쁜 성과를 보였습니다.
  • 교훈: AI 는 일반적으로 "나쁜" 것이 아니라, 비디오에 누가 있는지에 따라 특정 맹점을 가지고 있습니다. 잘 조명된 방에서는 완벽하게 작동하지만 특정 조명 조건이 있는 구석에서는 실명하는 보안 카메라와 같습니다.

3. "오디오"의 놀라운 사실

많은 이전 테스트들은 오디오를 선택 사항으로 취급했습니다. 마치 영화를 보는 대신 대본만 읽는 것과 같습니다.

  • 발견: 연구자들이 모델들에게 실제 오디오(텍스트가 아닌) 를 듣도록 강요했을 때, 성능이 향상되었습니다.
  • 주의점: 더 크고 강력한 모델들이 오디오를 듣는 것에서 가장 큰 혜택을 보았습니다. 작은 모델들은 종종 혼란을 겪거나 크게 향상되지 않았습니다. 복잡한 악보를 마스터 음악가에게 주는 것 (더 좋아짐) 과 초보자에게 주는 것 (압도당함) 의 차이와 같습니다.

4. "감정" 점검

연구자들은 AI 에게 공감하는 (감정을 이해하는) 요약문을 작성하도록 요청하기도 했습니다.

  • 결과: 모델들은 매우 다른 "성격"을 보여주었습니다.
    • Gemini임상 의사와 같은 목소리를 냈습니다: 진지하고 사실적이지만 감정을 인정함.
    • Baichuan 과 OLA따뜻한 친구와 같은 목소리를 냈습니다: 매우 지지적이고 긍정적임.
    • 작은 모델들매뉴얼을 읽는 로봇과 같은 목소리를 냈습니다: 사실을 나열할 수는 있지만 대화의 감정적 톤을 실제로 "느낄" 수는 없었습니다.

요약

SONIC-O1은 AI 세계에 대한 현실 점검입니다. AI 가 사진 보기와 텍스트 읽기에는 능숙해지고 있지만, 영화를 보고, 소리를 듣고, 시간을 추적하며, 모든 사람을 공정하게 대하는 것에는 여전히 어려움을 겪고 있음을 증명합니다.

  • 폐쇄형 소스 모델(Gemini 등)은 현재 고위험, 실시간 이해에 신뢰할 수 있는 유일한 모델입니다.
  • 오픈소스 모델은 일반적인 이해 부분에서는 따라가고 있지만, 여전히 시간을 "환각"하고 특정 인구 통계 그룹에게 공정하지 못하게 실패하고 있습니다.
  • 오디오는 중요합니다: 자막만 읽어서는 안 됩니다. 대화를 진정으로 이해하려면 목소리를 들어야 합니다.

이 논문은 이러한 "시간 추적"과 "공정성" 격차를 해결할 때까지는 의료나 법률과 같은 실제 시나리오에서 AI 시스템이 중요한 결정을 내리는 것을 완전히 신뢰해서는 안 된다고 결론 내립니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →