← 최신 논문
💬 NLP

NaturalFlow: Reducing Disruptive Pauses for Natural Speech Flow in Simultaneous Speech-to-Speech Translation

본 논문은 내부 모델 신호를 활용하여 낮은 지연 시간과 자연스러운 음향 흐름 사이의 균형을 맞춤으로써, 번역 품질을 유지하면서도 청자의 인지 부하를 최소화하고 동시 음성-음성 번역에서의 흐름을 끊는 일시 정지를 줄이는 유창성 인지 최적화 프레임워크인 NaturalFlow를 소개한다.

원저자: Dongwook Lee, Youngho Cho, Sangkwon Park, Heeseung Kim, Sungroh Yoon

게시일 2026-06-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dongwook Lee, Youngho Cho, Sangkwon Park, Heeseung Kim, Sungroh Yoon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "버벅거리는" 번역가

실시간으로 경기를 중계하며 통역하는 스포츠 중계 방송을 보고 있다고 상상해 보세요.

  • 기존 방식 (순차적 번역): 번역가는 선수가 말을 마칠 때까지 기다렸다가 전체 내용을 번역합니다. 정확하긴 하지만, 너무 오래 기다려야 합니다. 마치 영화를 10초 지연된 상태로 보는 것과 같습니다.
  • 현재의 "동시" 방식: 번역가는 선수가 여전히 말하고 있는 동안에도 말을 하려고 시도합니다. 속도는 빠르지만, 종종 로봇 같고 끊기는 느낌을 줍니다. 번역가가 따라잡기 위해 서두르다 보니, 짧게 말을 내뱉었다가, 더 많은 정보를 듣기 위해 갑자기 멈췄다가, 다시 시작하기를 반복하기 때문입니다.

결과: 청자는 다음과 같은 말투를 듣게 됩니다: "득점은... (긴 휴지)... 그리고 골은... (긴 휴지)... 플레이오프 기간 동안 기록된... (긴 휴지)... 유지되었습니다."

이러한 빈번하고 어색한 휴지는 마치 모든 빨간불에서 차가 멈춰 서는 것과 같습니다. 설령 단어는 정확할지라도, 청자가 메시지를 이해하기 위해 더 많은 노력을 기울이게 만듭니다.

해결책: NaturalFlow

연구진은 NaturalFlow라는 새로운 시스템을 만들었습니다. 이것을 "거짓말을 하지 않으면서 침묵을 채우는 기술"을 배운 번역가라고 생각해보세요.

NaturalFlow는 단순히 정보를 기다리기 위해 멈추는 대신, 자신의 어휘력을 사용하여 시간을 법니다.

  • 비결: 만약 번역가가 다음에 이어질 화자의 말을 듣기 위해 몇 초의 시간이 더 필요하다면, 현재의 아이디어를 더 길고 상세하게 설명하는 문구를 선택할 수 있습니다.
  • 비유: 당신이 다리를 건너 걷고 있다고 상상해 보세요.
    • 기존의 번역가: 빠르게 걷다가, 다리 중간에서 멈춰 서서 반대편을 바라본 뒤, 다시 걷기 시작합니다.
    • NaturalFlow 번역가: 일정한 속도로 걷습니다. 만약 반대편을 봐야 한다면, 발걸음을 멈추는 대신 현재 자신이 있는 풍경을 조금 더 자세히 묘삭하며 속도를 약간 늦추거나 몇 걸음을 더 내디뎌서, 실제로 멈추지 않고 계속 움직임을 유지합니다.

AI를 가르치는 방법: "은메달" 전략

AI를 이렇게 가르치기 위해 연구진은 매우 신중해야 했습니다. 그들은 학생의 두 가지 서로 다른 답변에 점수를 매기고 "나는 이 답변이 더 좋아"라고 말하는 것과 같은 직접 선호 최적화(Direct Preference Optimization, DPO) 방식을 사용했습니다.

하지만 그들은 까다로운 문제에 직면했습니다:

  1. 함정: 만약 당신이 AI에게 "그냥 침묵을 없애버려!"라고 말한다면, AI는 입을 계속 움직이기 위해 엄청나게 빨리 말하거나 횡설수설하기 시작할 수도 있습니다. 이는 마치 러너가 너무 빨리 달리려다 넘어져 버리는 것과 같습니다.
  2. 은메달 전략: 연구진은 가장 "빠른"(침묵이 가장 적은) 답변을 최고라고 선택하는 대신, "은메달" 답변을 선택했습니다.
    • 너무 공격적인(너무 빨라서 번역의 질을 해칠 위험이 있는) 상위 20%의 답변은 무시했습니다.
    • 대신 그다음 그룹인 20~40% 범위의 답변들을 선택했습니다.
    • 이유는 무엇일까요? 이는 AI에게 목표가 단순히 모든 침묵을 제거하는 것이 아니라, 정확성을 희생하지 않으면서도 자연스럽게 흐름을 유지할 수 있는 **최적의 지점(Sweet Spot)**을 찾는 것임을 가르치기 위함이었습니다. 이는 러너에게 미친 듯이 전력 질주하는 법이 아니라, 일정한 속도로 편안하게 조깅하는 법을 가르치는 것과 같습니다.

결과

연구진은 짧은 클립부터 긴 강연에 이르기까지 다양한 데이터셋을 통해 이를 테스트했습니다.

  • 중단 감소: 새로운 시스템은 문장 사이의 어색한 휴지를 크게 줄였습니다.
  • 여전한 정확도: 번역 품질은 기존의 빠른 시스템들과 마찬가지로 우수하게 유지되었습니다.
  • 인간의 선호도: 실제 사람들이 녹음된 내용을 들었을 때, NaturalFlow 버전을 더 선호했습니다. 사람들은 정보는 동일함에도 불구하고, 이 버전이 더 자연스럽고 덜 "로봇 같다"고 느꼈습니다.

요약

NaturalFlow는 실시간 음성 번역기를 구축하는 새로운 방법입니다. 번역가가 고장 난 레코드판처럼 멈췄다 시작하는 대신, AI가 흐름을 부드럽게 유지하기 위해 단어를 사용하는 법을 가르칩니다. "은메달" 훈련 전략을 사용함으로써, 연구진은 AI가 횡설수설할 정도로 속도에 집착하지 않도록 보장했습니다. 그 결과, 기계보다는 인간처럼 들리는 번역기가 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →