← 최신 논문
⚡ electrical engineering

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

이 논문은 로그 멜 스펙트로그램의 다음 패치 임베딩을 예측하도록 인과적 트랜스포머를 학습시킴으로써 오디오 및 음성 작업에서 최첨단 성능을 달성하는 미니멀한 자기지도 학습 프레임워크인 NAPE를 소개하며, 복잡한 사전 학습 레시피 없이도 단순한 자기회귀 패러다임이 확장 가능한 오디오 표현을 효과적으로 학습할 수 있음을 입증한다.

원저자: Umberto Cappellazzo, Xubo Liu, Stavros Petridis, Maja Pantic

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Umberto Cappellazzo, Xubo Liu, Stavros Petridis, Maja Pantic

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

소리는 시간에 따라 들려주는 이야기입니다. 공간 속에 한 순간을 박제하는 사진과는 달리, 오디오 신호는 일련의 사건들이 차례대로 펼쳐지며 리듬과 전개를 통해 의미를 전달합니다. 수십 년 동안 컴퓨터는 이 이야기를 이해하기 위해 고군분투해 왔으며, 종종 목소리나 사이렌 소리가 무엇인지 학습하기 위해 복잡하고 다단계적인 레시피에 의존해 왔습니다. 이러한 방식들은 대개 기계가 깨진 버전의 소리를 스스로 재구성하도록 가르치거나, 소리를 교사의 예시와 비교하도록 하는 방식을 취합니다. 이러한 접근법들이 효과적이긴 했지만, 그 잠재력을 온전히 발휘하기 위해서는 정교한 설정과 무거운 계산 도구들이 필요했습니다.

언어와 시각의 세계에서는 가장 강력한 인공지능 시스템들이 다음에 올 것을 예측함으로써 학습하는 새로운 경로가 나타났습니다. 이 시스템들은 그림이나 문장을 처음부터 다시 만드는 대신, 지금까지 본 것을 바탕으로 다음 조각을 추측합니다. 이 단순한 예측 행위는 모델로 하여금 데이터의 근저에 깔린 규칙, 즉 언어의 문법이나 시각적 장면의 구조를 이해하게 만듭니다. 연구자들은 오디오 역시 본질적으로 순차적이라는 점을 고려할 때, 이 단순한 논리가 소리에도 적용될 수 있을지 오랫동안 궁금해해 왔습니다. 임페리얼 칼리지 런던과 서리 대학교의 과학자 팀은 이제 이 단순한 전방향 예측에 집중하여 기존 오디오 시스템의 복잡성을 걷어낸 새로운 방법론으로 그 질문에 답했습니다.

연구진은 NAPE(Next-Audio-Patch-Embedding prediction, 차기 오디오 패치 임베딩 예측)라고 불리는 프레임워크를 도입했습니다. 이 방식이 어떻게 작동하는지 이해하기 위해, 주파수가 시간에 따라 변하는 지도로 보이는 '스펙트로그램'이라는 소리의 시각적 표현을 상상해 보십시오. 시스템은 이 지도를 작은 정사각형 타일들로 나눕니다. 그런 다음, 시간의 흐름을 존중하는 특정 순서에 따라 이 타일들을 컴퓨터 모델에 하나씩 입력합니다. 모델의 유일한 임무는 이미 본 타일들을 보고 바로 다음에 올 수학적 표현을 예측하는 것입니다. 모델은 원래의 음파를 재구성하려고 노력하지도 않으며, 자신의 추측을 인간이 라벨을 붙인 예시와 비교하지도 않습니다. 그저 다음 단계를 맞히려고 노력할 뿐입니다.

이 접근 방식은 의도적으로 미니멀리즘을 지향합니다. 대부분의 현대적인 오디오 학습 시스템은 거대하고 고정된 모델이 더 작은 모델을 안내하는 '교사-학생' 설정을 사용하거나, 숨겨진 특징으로부터 원시 오디오를 재구성하기 위해 복잡한 디코더를 사용합니다. NAPE는 이러한 모든 추가 구성 요소를 버립니다. 이 시스템은 관찰자이자 예측자로서 기능하는 단일 모델을 사용합니다. 모델이 단순히 입력을 암기하는 것이 아니라 소리의 구조를 학습하도록 하기 위해, 시스템은 모델이 미래를 보는 것을 방지합니다. 또한 모델이 다음 것을 예측하기 위해 현재의 타일을 단순히 복사하는 것을 막는 특정한 수학적 트릭을 사용하여, 과거와 미래 사이의 관계를 실제로 이해하도록 강제합니다. 모델이 받는 유일한 신호는 고차원 공간에서 두 수학적 벡터의 방향을 비교하여 계산된, 자신의 예측이 실제 다음 타일과 얼마나 가까운지에 대한 척도입니다.

이 단순한 설계의 결과는 놀라울 정도로 강력했습니다. 연구진은 비나 개 짖는 소리와 같은 환경음을 식별하는 것부터 음성 명령 인식 및 대화에서의 감정 탐지에 이르기까지 6가지 서로 다른 벤치마크에서 NAPE를 테스트했습니다. 연구진은 인터넷의 방대한 라벨 없는 오디오 클립 데이터셋으로 시스템을 훈련시켰습니다. 이 모델을 테스트했을 때, NAPE는 현재 사용 가능한 가장 복잡한 시스템들과 대등하거나 이를 능가하는 최첨단 성능을 달ert했습니다. 이러한 성공은 약 1,900만 개의 파라미터를 가진 작은 버전부터 3억 개 이상의 파라미터를 가진 큰 버전에 이르기까지 세 가지 다른 크기의 모델 모두에서 입증되었으며, 모델이 커질수록 성능이 향상되어 한계 효용 체감의 법칙에 부딪히지 않고 효과적으로 확장됨을 보여주었습니다.

연구에서 가장 흥-미로운 측면 중 하나는 모델이 정보를 조직하는 방식이었습니다. 시스템은 오직 다음 소리 조각을 예측하도록 훈련되었기 때문에, 스스로 의미 있는 오디오의 내부 지도를 개발했습니다. 연구진이 모델이 어디에 주의를 기울이는지 조사했을 때, 모델은 비록 그 소리가 무엇인지 배운 적이 없음에도 불구하고 유사한 음향적 특성을 공유하는 소리들을 자연스럽게 그룹화한다는 것을 발견했습니다. 모델은 특정 주파수가 시간에 따라 어떻게 진화하는지를 추적하는 법을 배웠으며, 이는 인간이 소리를 인지하는 방식과 유사하게 과거를 현재와 연결하는 방식이었습니다. 이는 모델이 인간의 라벨이나 복잡한 재구성 작업 없이도, 단순한 예측 행위를 통해 오디오의 근본적인 구조를 발견했음을 시사합니다.

또한 연구는 소리 타일이 제시되는 순서가 학습에 어떤 영향을 미치는지 탐구했습니다. 소리는 강력한 시간 축을 가지고 있기 때문에, 연구진은 스펙트로그램 타일을 스캔하는 다양한 방식을 테스트했습니다. 연구진은 왼쪽에서 오른쪽으로, 그리고 아래에서 위로 이동하는 것과 같이 시간의 흐름을 존중하는 방식으로 타일을 스캔하는 것이 가장 효과적이라는 것을 발견했습니다. 이는 오디오의 시간적 특성이 이 예측 기반 접근법을 성공시키는 핵심임을 확인시켜 주었습니다. 만약 시간 순서를 무시하는 방식으로 타일을 스캔하면 모델의 성능이 크게 떨어졌는데, 이는 이 방법이 소리의 자연스러운 진행에 의존하고 있음을 증명합니다.

아마도 가장 중요한 점은, NAPE가 학습한 특징들이 모델을 특정 작업에 맞춰 완전히 재학습시키지 않을 때도 매우 유용하다는 사실을 연구진이 발견했다는 것입니다. 모델을 고정하고 그 위에 간단한 분류기만을 훈련시키는 테스트에서, 시스템은 여전히 매우 우수한 성능을 보였습니다. 이는 모델이 새로운 문제에 쉽게 적응할 수 있는 견고하고 유연한 소리 표현을 학습했음을 나타냅니다. NAPE가 완벽한 분류기를 위해 설계된 것은 아니지만, 최소한의 추가 훈련만으로도 매우 효과적으로 사용될 수 있다는 사실은 예측 기반 접근법이 이전 방식들보다 오디오의 본질을 더 직접적으로 포착하고 있음을 시사합니다.

이 연구는 지난 수년간 오디오 머신러닝을 지배해 온 복잡한 다단계 레시피가 반드시 필요하지 않을 수도 있음을 보여줍니다. 시퀀스의 다음 단계를 예측하는 단순하고 인과적인 목표로 돌아감으로써, 연구진은 훈련하기 더 쉽고 학습에는 더 효과적인 시스템을 구축했습니다. 이 모델은 성공을 위해 교사도, 디코더도, 거대한 부가 규칙 세트도 필요로 하지 않습니다. 그저 앞을 내다보고 다음에 올 것을 추측하기만 하면 됩니다. 이 발견은 오디오 인공지능의 새로운 길을 열어주며, 기계에게 소리에 대해 가르치는 가장 강력한 방법은 한 번에 한 단계씩, 미래를 듣게 하는 것일 수도 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →