← 최신 논문
🤖 AI

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

이 논문은 상대적 시간 간격, 하이브리드 미세 조정 전략, 그리고 마스크 학습 목적 함수를 활용하여 시간적 정렬 정확도와 강건성을 향상시킴으로써 음성 거대 언어 모델을 정밀한 단어 단위 타임스탬핑 기능으로 강화하는 새로운 접근 방식을 소개한다.

원저자: Quanwei Tang, Zhiyu Tang, Xu Li, Dong Zhang, Shoushan, Guodong Zhou

게시일 2026-08-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Quanwei Tang, Zhiyu Tang, Xu Li, Dong Zhang, Shoushan, Guodong Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 거대 언어 모델(large language model)이라고 알려진 특정 유형의 컴퓨터 프로그램은 인간의 음성을 이해하고 생성하는 데 매우 능숙해졌습니다. 이러한 시스템은 오디오를 듣고, 말해지는 단어들을 인식하며, 놀라운 정확도로 이를 받아 적을 수 있습니다. 하지만 오랫동안 이 기계들은 결정적인 시간 감각이 부족했습니다. 이들은 무엇이 말해졌는지는 알려줄 수 있지만, 대화의 흐름 속에서 각 단어가 정확히 언제 발생했는지는 파악하는 데 어려움을 겪는 경우가 많았습니다. 이 누락된 정보는 비디오의 정확한 자막 생성부터 시각적 장면과 오디오를 동기화하는 것에 이르기까지 많은 응용 분야에 필수적입니다. 문제는 기계가 복잡한 소리를 이해하고 문장을 형성하려고 노력하는 동시에 어떻게 일정한 내부 시계를 유지하도록 가르칠 것인가 하는 점이며, 이는 두 가지 매우 다른 종류의 정보를 균형 있게 다루어야 하는 과업을 요구합니다.

연구자들은 최근 컴퓨터가 시간을 표현하는 방식을 재고함으로써 이 문제를 해결했습니다. 전통적으로 시스템이 단어의 시점을 표시하려고 할 때, 0에서 시작하여 계속해서 올라가는 스톱워치와 유사한 절대적 타임스탬프(absolute timestamp)를 사용합니다. 만약 어떤 단어가 녹음의 맨 처음에 발화된다면 시스템은 이를 0.00초로 표시할 것이고, 다른 단어가 나중에 나온다면 15.42초와 같이 표시될 것입니다. 이 방식은 단순해 보이지만 컴퓨터에게는 큰 장애물을 만듭니다. 녹음이 길어질수록 숫자는 더 커지고 많아지며, 이는 시스템이 수천 개의 고유한 시간 표식을 암기해야 함을 의미합니다. 또한 이 접근 방식은 타이밍에서의 작은 실수가 누적되어 오디오가 계속 진행됨에 따라 시계가 점점 더 어긋나게 만드는 흔한 오류를 초래합니다.

이 문제를 해결하기 위해, 한 연구팀은 고정된 시계 위의 지점이 아닌 간격(intervals)에 의존하는 새로운 방식으로 시간에 대해 생각할 것을 제안했습니다. 컴퓨터에게 단어가 시작되는 정확한 초를 기억하게 하는 대신, 그들은 컴퓨터가 단어 사이의 간격을 측정하도록 훈련시켰습니다. 이 새로운 시스템에서 컴퓨터는 이전 단어와 현재 단어 사이의 휴지기가 얼마나 되는지만 학습하면 됩니다. 만약 화자가 다음 단어를 말하기 전에 0.5초 동안 멈춘다면, 시스템은 단순히 그 0.5초의 간격을 기록합니다. 이러한 작은 간격들을 모두 더함으로써, 컴퓨터는 음성의 전체 타임라인을 재구성할 수 있습니다. 이 방법은 컴퓨터가 끝없는 목록의 절대적 시간이 아니라 제한된 세트의 시간 간격만을 배워야 하므로 훨씬 더 효율적입니다. 이는 마치 모든 랜드마크까지의 정확한 거리를 외우는 대신, 자신의 발걸음을 세며 걷는 법을 배우는 것과 같습니다.

연구진은 강력한 음성 모델을 사용하여 이러한 상대적 시간 간격을 사용하도록 수정함으로써 이 접근 방식을 테스트했습니다. 그들은 컴퓨터가 정답을 볼 수 있게 허용할 뿐만 아니라, 가끔은 음성의 맥락과 이미 생성된 단어들을 바탕으로 타이밍을 추측하도록 강제하는 훈련 과정을 설계했습니다. 마스크 훈련(masked training)이라고 알려진 이 기술은 컴퓨터가 단순히 정답을 암기하는 것을 방지하고, 대신 인간 언어의 자연스러운 리듬을 이해하도록 가르칩니다. 연구팀은 또한 핵심적인 언어 이해 능력은 건드리지 않고 시간을 처리하는 부분만을 업데이트하는 특화된 훈련 전략을 사용했습니다. 이를 통해 시스템이 새로운 시간 감각을 얻으면서도 강력한 청취 능력을 유지할 수 있도록 보장했습니다.

이 연구의 결과는 놀라웠습니다. 긴 회의와 다양한 음성 샘플을 포함한 다양한 녹음물에 대해 테스트했을 때, 새로운 시스템은 기존 방식들을 크게 앞질렀습니다. 회의 녹음 데이터셋에서 이 모델은 단어의 타이밍을 91퍼센트 이상의 정밀도로 정확하게 식별해냈는데, 이는 이전 시스템들이 도달할 수 없었던 수준이었습니다. 더욱 중요한 것은, 예측된 시간과 실제 시간 사이의 평균 차이가 인간의 귀로 거의 인지할 수 없는 아주 짧은 시간인 30밀리초(ms)로 줄어들었다는 점입니다. 이 시스템은 또한 긴 녹음에서도 매우 안정적인 모습을 보이며, 오래된 방식들을 괴롭혔던 타이밍 오류를 피했습니다. 더욱 인상적인 것은, 모델이 높은 정확도로 단어 자체를 전사하는 능력을 유지했다는 점이며, 이는 시간을 갖는 기능이 음성을 이해하는 본연의 업무를 방해하지 않았음을 보여줍니다.

이러한 진보는 인공지능가 인간 의사소통의 시간적 구조를 더 잘 인식하게 만드는 유의미한 진전입니다. 경직된 절대적 시간 관점에서 유연한 상대적 시간 관점으로 전환함으로써, 연구진은 이러한 시스템이 더 길고 복잡한 오디오를 더 높은 신뢰도로 처리할 수 있게 했습니다. 이 결과는 우리가 기계가 인간의 지각을 모방하도록 설계할 때, 고정된 위치보다는 사건들 사이의 관계에 집중하는 것이 더 견고하고 효과적인 도구를 만들 수 있음을 시사합니다. 이 작업은 단순히 기술적인 지표를 개선하는 것을 넘어, 우리가 인간 청취자처럼 자연스럽게 대화의 흐름을 따를 수 있는 시스템을 만드는 데 한 걸음 더 다가가게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →