Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing
이 논문은 계층적 토큰 생성과 텍스트 유도형 컨디셔닝을 활용하여 화자의 정체성과 운율을 보존하면서 음성 인페인팅 및 편집에서 최첨단 성능을 달성하는 멀티 코덱 이산 확산 모델인 SIEDD를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
좋아하는 노래를 듣고 있는데, 갑자기 멜로디의 몇 초가 사라지거나 누군가 당신이 듣고 싶지 않은 단어를 속삭였다고 상상해 보세요. 오디오 과학의 세계에서, 트랙의 나머지 부분을 망치지 않고 이러한 구멍을 메우는 것은 마치 찢어진 태피스트리를 수리하는 것과 비슷합니다. 단순히 새로운 천 조각을 위에 붙여넣는 것이 아니라, 새로운 실이 주변 직물의 색상, 짜임, 그리고 장력을 완벽하게 맞춰야 합니다. 수십 년 동안 컴퓨터는 이 작업에 어려움을 겪었습니다. 미세한 스크래치는 고칠 수 있었지만, 문장 전체가 누락된 경우에는 종종 로봇처럼 들리거나 화자의 목소리와 박자가 맞지 않는 경우가 많았습니다.
최근 과학자들은 이 문제를 해결하기 위해 "확산(diffusion)"이라는 영리한 기술을 사용하기 시작했습니다. 확산을 "전화 게임(telephone)"을 거꾸로 하는 것으로 생각해보세요. 투명한 사진이 서서히 정적 노이즈로 덮여 회색빛의 흐릿한 형체만 남게 되는 과정을 상상해 보세요. 확산 모델은 그 흐릿하고 회색빛인 혼란스러운 상태에서부터 단계적으로 노이즈를 벗겨내어 원래의 사진을 다시 나타나게 하는 방법을 학습하는 똑똑한 AI입니다. 이 방식은 이미지에서 매우 잘 작동하지만, 음성을 대상으로 할 때는 까다롭습니다. 왜냐하면 음성은 단순히 하나의 매끄러운 선이 아니라, 서로 다른 맛이 층층이 쌓인 케이크처럼 여러 층으로 구성되어 있기 때문입니다. 이 논문은 이 "역방향 노이즈" 게임을 사용하여 음성을 수정하되, 그 층들을 존중하는 특별한 변형을 가하는 방법에 대해 다룹니다.
이 연구를 진행한 연구자 이프타흐 쇼함(Iftach Shoham)과 그의 팀은 SIEDD(Discrete Diffusion을 통한 음성 인페인팅 및 편집)라는 새로운 시스템을 소개합니다. 그들의 주요 목표는 녹음의 누락된 부분을 채워 넣거나(inpainting), 단어를 새로운 단어로 교체(editing)하면서도 화자의 목음, 리듬, 감정을 정확하게 유지하는 도구를 만드는 것이었습니다. 그들은 이전의 방식들이 마치 선로 위의 기차처럼 단어 하나하나를 차례대로 만들어내려 할 때 오류가 누적된다는 점을 발견했습니다. 만약 AI가 첫 번째 단어를 약간이라도 틀리게 만든다면, 나머지 문장은 어색하게 들리게 됩니다.
대신, SIEDD는 "이산 확산(discrete diffusion)" 접근 방식을 사용합니다. 음성이 기차가 아니라 조각을 깎아내는 조각품이라고 상상해 보세요. AI는 기본적인 소리의 형태(거친 덩어리)에서 시작하여, 세부적인 디테일을 드러내기 위해 천천히 깎아 나갑니다. 이 논문의 큰 발견은 이러한 층(layer)들의 순서를 존중해야 한다는 것입니다. AI는 먼저 소리의 크고 거친 형태인 "조선(coarse)" 구조를 파악하고, 이를 견고한 토대로 고정합니다. 그러고 나서야 다음 층으로 넘어가 목소리의 특정한 질감과 같은 "미세한(fine)" 디테일을 추가합니다. 하위 층들을 깨끗하고 확정된 문맥으로 취급하고 현재의 층만을 "디노이징(denoising)"함으로써, 모델은 거친 형태가 결정되기 전에 미세한 디테일을 추측하려다 발생하는 혼란을 피할 수 있습니다.
연구팀은 손상된 녹음을 복구하거나 말한 내용을 바꾸는 것과 같은 현실적인 시나리오를 포함하는 벤치마크인 RealEdit를 통해 이를 테스트했습니다. 결과는 SIEDD가 제 역할을 충분히 수행하고 있음을 보여줍니다. 음성 편집 테스트에서 이 모델은 비교 대상이었던 방법들 중 전반적으로 가장 우수한 성능을 보였으며, 단어 오류율(WER)은 가장 낮았고 원본 화자와의 유사성은 가장 높았습니다. 누락된 부분을 채우는 작업에서도, 특히 여러 개의 간극을 동시에 채워야 할 때 다른 인기 있는 방법들보다 뛰어난 성능을 보였습니다. 저자들은 이러한 성공이 소리의 "계층 구조(hierarchy)"를 명시적으로 모델링한 데서 온다고 설명합니다. 즉, 어떤 오디오 코드가 큰 그림을 만드는 데 더 중요한지, 그리고 어떤 것이 아주 작은 디테일을 위한 것인지를 인지했다는 것입니다.
그들의 시스템 중 하나는 영리한 "국소적 가이드(localized guide)" 기법입니다. 문장을 편집하면서 "고양이(cat)"라는 단어를 "강아지(dog)"로 바꾸고 싶다고 가정해 봅시다. AI는 정확히 어느 부분의 소리를 바꿔야 하고, 어느 부분을 그대로 두어야 하는지 알아야 합니다. 연구진은 변경되는 특정 구간에만 주의를 집중하는 메커니즘을 구축하여, 새로운 단어가 주변의 대화를 망치지 않으면서 기존의 단어들과 완벽하게 어우러지도록 했습니다. 또한 새로운 단어의 길이를 예측하는 방법도 추가하여, 편집된 음성이 너무 빠르거나 늘어지지 않도록 했습니다.
요약하자면, 이 논문은 음성을 다층 구조의 케이크처럼 취급하고 아래에서 위로 층별로 수정함으로써, 컴퓨터가 이전보다 훨씬 더 자연스럽게 오디오를 복구하고 편집할 수 있음을 시사합니다. 비록 시스템이 완벽하지는 않지만(간극이 커질수록 여전히 다소 어려움을 겪습니다), 이는 AI가 덜 로봇처럼 들리고, 문장을 매끄럽게 고치거나 단어를 교체할 때 아무도 눈치채지 못하게 할 수 있는 인간다운 소리를 내도록 만드는 데 있어 중요한 진전을 의미합니다. 저자들은 이러한 "계층 인식(hierarchy-aware)" 접근 방식이 기존의 단계별 방식에 대한 유망한 대안이며, 단어가 바뀌더라도 화자의 목소리에 담긴 영혼을 보존할 수 있는 방법이라고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.