← 최신 논문
💻 computer science

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

기존 비디오-텍스트-오디오 모델의 주요 한계를 극복하기 위해, 본 논문은 EchoFoley-6k 벤치마크와 EchoVidia 프레임워크에 의해 지원되는 계층적 제어를 갖춘 새로운 이벤트 중심 태스크인 EchoFoley를 소개하며, 이는 비디오에 기반한 사운드 생성의 제어 가능성과 지각 품질을 모두 유의미하게 향상시킨다.

원저자: Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

게시일 2026-06-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 스크린에서 상영 중인 무성 영화를 보고 있다고 상상해 보세요. 화면에는 고양이가 걷고 있고, 문이 쾅 닫히며, 자동차가 지나가는 모습이 보입니다. 이제 당신은 효과음을 추가하고 싶지만, 아무 소리나 넣고 싶은 것이 아닙니다. 고양이가 처음에는 부드럽게 야옹거리다가, 마법사가 주문을 외울 때 갑자기 사자처럼 포효하기를 원하며, 그 특정한 포효가 정확히 7초 지점에 발생하도록 하고 싶습니다. 또한 7초 이전의 소리들은 7초 이후의 소리들보다 더 크게 만들고 싶습니다.

현재의 AI 도구들은 "고양이"라는 말을 들으면 그냥 일반적인 "야옹" 소리 파일을 영상 전체에 쏟아붓는 서투른 음향 엔지니어와 같습니다. 이들은 당신의 구체적이고 세밀한 지시사항을 듣는 데 어려움을 겪습니다.

EchoFoley는 이를 해결하기 위해 설계된 새로운 프로젝트입니다. 작동 방식은 다음과 같이 간단한 개념으로 나누어 설명할 수 있습니다.

1. 문제점: "시각적 지배"의 함정

현재 만약 당신이 AI에게 "두 번째 야옹 소리를 사자처럼 바꿔줘"라고 말한다면, AI는 종종 혼란에 빠집니다. AI는 고양이(시각 정보)를 보고는 "알았어, 고양이 소리를 만들어야지"라고 생각합니다. 즉, 당신이 말하는 내용보다 눈에 보이는 것에 너무 의존하여 당신의 구체적인 텍스트 지시를 무시합니다. 이는 마치 요리사가 "소금을 더 넣어달라"는 요청을 무시하고 오직 눈에 보이는 재료로만 요리하는 셰프와 같습니다.

2. 해결책: "사운드 스크립트" (기호적 표현)

연구진은 AI와 대화하는 새로운 방법을 만들었습니다. 단순히 모호한 명령을 내리는 대신, AI에게 **"사운드 스크립트"**를 쓰도록 가르치는 것입니다.

이 스크립트는 음악 지휘자의 악보와 같다고 생각하면 됩니다. 단순히 "음악을 연주하라"고 말하는 것이 아니라, 소리를 아주 작고 구체적인 음표 단위로 나눕니다:

  • 언제: 소리가 발생하는 정확한 초(second)는 언제인가?
  • 무엇을: 고양이의 야옹 소리인가, 아니면 사자의 포효인가?
  • 어떻게: 소리가 큰가? 고음인가? 왼쪽에서 오는가, 오른쪽에서 오는가?

AI가 먼저 이 스크립트를 작성하도록 강제함으로써, AI는 "두 번째 야옹 소리를 사자 포효로 바꾸되, 첫 번째 야옹은 정상적으로 유지해줘"와 같은 복잡한 요청을 처리할 수 있게 됩니다.

3. 새로운 놀이터: EchoFoley-6k

AI에게 이 새로운 기술을 가르치기 위해, 팀은 EchoFoley-6k라는 거대한 학습 라이브러리를 구축했습니다.

  • 6,000개의 무성 영상이 담긴 도서관을 상상해 보세요.
  • 각 영상에 대해 단순히 한 문장의 설명만 적은 것이 아니라, 6,000개의 상세한 지시문42,000개의 아주 작은 소리 노트를 작성했습니다.
  • 전문가들을 고용하여 소리가 시작되고 끝나는 시점과 그 특성이 무엇인지 정확하게 라벨링했습니다. 이것이 AI가 배우는 "교과서"입니다.

4. 새로운 두뇌: EchoVidia ("느리게-빠르게" 생각하기)

팀은 이 라이브러리를 사용하기 위해 EchoVidia라는 새로운 AI 시스템을 만들었습니다. 이 시스템은 인간의 사고방식에서 영감을 얻은 영리한 "느리게-빠르게 생각하기(Slow-Fast Thinking)" 기법을 사용합니다.

  • 빠른 생각 (System 1): AI는 영상을 빠르게 훑어보며(초당 1프레임) 전반적인 분위기를 파악합니다. "아, 고양이 영상이구나."
  • 느린 생각 (System 2): 그다음 AI는 영상을 아주 느리게 재생하여(슬로우 모션처럼) 자세히 관찰합니다. "잠깐, 00:04초에 고양이 입이 벌어지네. 이때 야옹 소리가 나는구나. 그리고 00:07초에 마법사의 손짓이 있네."

이처럼 빠른 개요 파악과 느리고 상세한 검사를 결함함으로써, AI는 일반적인 장면을 바탕으로 추측하는 대신, 정확히 언제 소리를 넣어야 하는지, 그리고 그 소리가 무엇이어야 하는지를 정확히 짚어낼 수 있습니다.

5. 결과: 숙련된 음향 엔지니어

EchoVidia를 다른 최고 수준의 AI 모델들과 테스트했을 때의 결과는 다음과 같습니다:

  • 제어력: 구체적인 지시를 따르는 능력이 40% 더 뛰어났습니다. 특정 시간에 소리를 넣어달라고 요청하면 실제로 그렇게 수행했습니다.
  • 품질: 인간 청취자들에게 12% 더 자연스럽고 사실적으로 들렸습니다.
  • 균형: 다른 모델들이 텍스트 지시를 무시하고 영상에만 집중했던 것과 달리, EchoVidia는 영상과 당신의 구체적인 명령 둘 다 성공적으로 반영했습니다.

요약

이 논문은 AI가 영상에 대한 소리를 생성하는 새로운 방법을 소개합니다. AI가 단순히 그림을 보고 추측하게 두는 대신, 상세한 스크립트슬로우 모션 사고 과정을 부여하여 모든 소리가 사용자가 요청한 대로 정확한 시간, 정확한 톤으로 발생하도록 했습니다. 이는 단순한 추측과 확인의 과정을 정밀하고 창의적인 스토리텔링 도구로 탈바꿈시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →