← 최신 논문
💬 NLP

GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech

GRAFT는 희귀하거나 어려운 단어의 발음 정확도를 크게 향상시키는 동시에 자연스러움과 화자 유사성을 유지하기 위해, 접목된 참조 오디오를 활용한 단어별 조건화 메커니즘을 사용하는 제로샷 텍스트 음성 변환 시스템입니다.

원저자: Antonis Asonitis, Francesco Verdini, Aref Farhadipour, Vijeta Avijeet, Pierre-Edouard Honnet, Marzieh Razavi, Juan Pablo Zuluaga Gomez

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Antonis Asonitis, Francesco Verdini, Aref Farhadipour, Vijeta Avijeet, Pierre-Edouard Honnet, Marzieh Razavi, Juan Pablo Zuluaga Gomez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 이야기를 소리 내어 읽도록 가르치고 있다고 상상해 보세요. 이 로봇은 매우 똑똑하며 특정 인물(예: 유명인이나 친구)의 목소리를 완벽하게 흉내 낼 수 있습니다. 하지만 이야기 속에 까다롭고 희귀한 단어(예: 외국 이름, 완전히 새로운 제품명, 또는 복잡한 과학 용어)가 포함되면, 로봇은 종-종 잘못 추측하곤 합니다. "Xylophone"이라고 적혀 있으면 로봇은 규칙에 따라 어떻게 발음할지 추측합니다. 하지만 희귀한 단어의 경우, 그 규칙들이 실패합니다. 심지어 발음 기호(사전처럼)를 제공하더라도, 로봇은 단어의 정확한 강세나 어조 같은 "풍미"를 놓치는 경우가 많습니다.

이 논문은 이 문제를 해결하는 새로운 도구인 GRAFT를 소개합니다. GRAFT를 로봇이 읽기 전에 특정 단어 위에 직접 붙일 수 있는 **"발음 패치"**라고 생각하면 됩니다.

작동 방식은 다음과 같습니다.

1. 문제점: 로봇의 "추측 게임"

현재의 로봇들은 텍스트에 의존합니다. 만약 "Xylophone"이라고 쓰여 있다면, 로봇은 규칙을 바탕으로 어떻게 말할지 추측합니다. 하지만 희귀한 단어의 경우, 그 규칙들이 작동하지 않습니다. 설령 로봇에게 발음 기호를 주더라도, 로봇은 단어의 정확한 강세나 어조 같은 "풍미"를 잃어버리는 경우가 많습니다.

2. 해결책: "오디오 포스트잇"

로봇에게 글자로 된 가이드를 주는 대신, GRAFT는 당신이 원하는 단어의 짧은 오디오 클립을 줄 수 있게 해줍니다.

  • 비유: 당신이 영화를 편집하고 있다고 상상해 보세요. 배우가 특정 대사를 해야 하는 장면이 있는데, 배우가 틀리게 말했습니다. 대본을 다시 쓰는 대신, 누군가(심지어 다른 배우라도)가 그 대사를 올바르게 말한 녹음본을 가져와서 대본에 "접합(graft)"하는 것입니다.
  • GRAFT의 작동 방식: 당신이 까다로운 단어(예: "Sushi")를 녹음합니다. 그리고 로봇에게 이렇게 말합니다. "'Sushi'라는 단어를 보면, 내 텍스트를 이 소리로 교체해 줘." 그러면 로봇은 문장의 나머지 부분은 선택한 대상의 목소리(당신이 고른 유명인의 목소리)로 말하되, "Sushi"는 당신이 녹음한 방식 그대로 말하게 됩니다.

3. 마법 같은 기술: "누구인가"와 "어떻게 말하는가"의 분리

이 부분이 가장 영리한 부분입니다. 보통 어떤 사람이 말하는 녹음본을 재생하면, 로봇이 실수로 그 사람의 목소리까지 따라 하게 되어, 전체 문장이 마치 두 명의 서로 다른 사람이 말하는 것처럼 들릴 수 있습니다.

저자들은 이를 해결하기 위해 로봇을 특별한 "믹스 앤 매치(mix-and-match)" 게임으로 훈련시켰습니다.

  • 훈련 과정: 그들은 A라는 사람이 말한 문장을 가져온 뒤, 음성 변조기를 사용하여 B라는 사람처럼 들리게 만들었습니다. 그런 다음, 그 변형된 버전에서 아주 작은 단어 클립을 추출하여 로봇에게 다음과 같이 지시했습니다: "이 단어는 B처럼 말하되, 나머지 문장은 A처럼 말해라."
  • 결과: 로봇은 발음(단어가 어떻게 들리는가)과 화자 정체성(누가 말하는가)을 분리하는 법을 배웠습니다.
  • 이점: 당신이 자신의 목소리(또는 아이의 목소리, 혹은 로봇의 목소리)로 까다로운 단어를 녹음하더라도, GRAFT는 당신의 목소리를 제거하고 오직 발음만을 남겨서, 대상 화자의 목사리에 완벽하게 삽입합니다.

4. 논문의 발견

연구진은 인간이 여러 로봇의 목소리를 듣고 어떤 것이 정답인지 맞히는 "블라인드 테스트"를 통해 실험했습니다.

  • 승자: GRAFT는 압도적인 차이로 1위를 차지했습니다. 인간들은 GRAFT가 다른 어떤 시스템보다 어려운 단어를 원래의 녹음본과 훨씬 더 가깝게 발음한다고 느꼈습니다.
  • 통계: GRAFT는 기존의 가장 뛰어난 시스템들과 비교했을 때 발음 오류를 22%에서 39%까지 줄였습니다.
  • 트레이드오프(절충): 로봇은 자연스럽게 들리는 능력이나 대상 화자의 목소리를 유지하는 능력을 잃지 않았습니다. 단지 어려운 단어를 말하는 능력이 훨씬 좋아졌을 뿐입니다.

요 요약

GRAFT는 텍스트 음성 변환(TTS) 로봇에게 사운드 바이트 형태의 "치트 시트(요약 노트)"를 주는 것과 같습니다. 이를 통해 누구나 음성학이나 언어학을 알 필요 없이, 단 한 번의 말하기만으로 로봇의 어려운 단어 발음을 교정할 수 있습니다. 그러면 로봇은 목소리의 일관성과 자연스러움을 유지하면서도 그 단어를 정확하게 말하는 법을 배웁니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →