Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications
이 기술 보고서는 NVIDIA의 오픈 소스 Canary Flash 모델을 전화 특화 데이터셋으로 미세 조정하는 것이 기업용 보이스봇 배포를 위한 실시간 추론 속도를 유지하면서도, 노이즈가 있는 오디오와 비즈니스 핵심 용어에 대한 음절 오류율을 유의미하게 감소시킨다는 점을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
전화선을 통해 오가는 대화를 상상해 보십시오. 그 전선을 타고 흐르는 소리는 조용한 방에서 듣는 맑고 고음질인 목소리와는 다릅니다. 그것은 더 좁고, 종종 압축되어 있으며, 번화한 거리의 소음이나 저가형 수화기의 웅웅거리는 소리에 의해 빈번하게 방해를 받습니다. 수십 년 동안 컴퓨터는 이러한 특정한 유형의 오디오를 이해하는 데 어려움을 겪어 왔습니다. 인공지능이 팟캐스트나 회의의 깨끗한 음성을 받아쓰는 데는 놀라울 정도로 능숙해졌지만, 고객 서비스 전화의 무질서한 현실에 직면하면 종종 비틀거리곤 합니다. 이러한 격차는 음성 비서가 수백만 건의 전화를 처리하도록 만들고자 하는 기업들에게 큰 장애물이 되며, 특히 기술이 현지 언어나 현지 전화 네트워크의 특정한 소음에 대해 학습되지 않은 지역에서는 더욱 그러합니다.
태국의 봇노이 그룹(Botnoi Group) 연구진은 인간이 전화 통화 중에 하는 것처럼 들을 수 있도록 강력한 오픈 소스 컴퓨터 모델을 가르침으로써 이 문제를 해결하고자 했습니다. 그들은 전화 음성용 공공 데이터가 부족한 지역인 태국어를 중심으로 연구했습니다. 그들의 작업은 실제 전화 통화의 녹음본과 비즈니스 특화 어휘를 모델에 세심하게 입력함으로써, 범용 음성 인식기를 소음이 있는 컨택 센터에서도 안정적으로 작동하는 전문가로 변모시킬 수 있음을 보여줍니다. 그 결과, 이 시스템은 언어를 이해할 뿐만 아니라 정적을 무시하여, AI 에이전트가 지속적인 인간의 개입 없이도 이름이나 주소를 읽는 것과 같은 복잡한 작업을 수행할 수 있게 합니다.
그들 작업의 핵심은 이미 많은 언어를 잘 이해하고 있는 카나리(Canary)라는 거대하고 기존에 존재하는 인공지능 모델을 가져와 전문적인 교육을 시키는 것이었습니다. 연구진은 모델을 있는 그대로 사용하는 것만으로는 자신들의 요구를 충족할 수 없다는 것을 깨달았습니다. 해당 모델은 주로 깨끗하고 고품질인 오디오로 학습되었기에, 전화 연결의 왜곡에 대비가 되어 있지 않았습니다. 이를 해결하기 위해 그들은 독특한 학습 파이프라인을 구축했습니다. 그들은 두 가지 유형의 데이터를 수집했습니다. 실제 전화 통화의 진정한 혼돈을 포착한 자신들의 라이브 보이스봇 시스템의 녹음본과, 메시징 앱에 프롬프트를 말하는 사람들의 녹음본입니다. 앱 녹음본을 전화 통화처럼 들리게 만들기 위해, 그들은 전화 회선의 압축과 소음을 모사하는 디지털 필터를 적용했습니다. 이 과정을 통해 특정 부분집합인 이름과 주소 인식에 완전히 특화된 104시간의 데이터를 포함하여, 총 77시간의 전화 등급 오디오로 구성된 거대한 라이브러리를 구축했습니다.
이 맞춤형 데이터셋을 사용하여 팀은 카나리 모델을 미세 조정(fine-tuning)했습니다. 미세 조정은 컴퓨터가 새로운 사례로부터 학습하여 내부 규칙을 조정하는 과정으로, 마치 학생이 특정 시험을 준비하기 위해 특정 교과서를 공부하는 것과 같습니다. 그들은 세 가지 시나리오에서 태국어 음성을 인식하는 모델의 능력을 테스트했습니다. 첫째, 일반적인 언어를 이해할 수 있는지 확인했습니다. 둘째, 소음이 있는 전화 오디오에서 테스트했습니다. 마지막으로, 이름과 주소라는 특정 비즈니스 전문 용어에 대해 테스트했습니다. 결과는 극적인 개선을 보여주었습니다. 이 훈련 전에는 모델이 전화 오디오에서 약 23%의 오류를 범했습니다. 전화 데이터를 학습한 후, 그 오류율은 단 9%로 떨어졌습니다. 이는 상당한 도약이었으며, 모델이 전화 회선의 특정 음향 조건에 적응할 수 있음을 입증했습니다.
이름과 주소의 문제는 단어들이 종종 고유하며 서로 매우 비슷하게 들릴 수 있기 때문에 컴퓨터에게 특히 어려운 과제입니다. 초기 테스트에서 모델은 이러한 용어들에 대해 거의 17%에 달하는 오류를 범하며 어려움을 겪었습니다. 그러나 연구진이 이름과 주소 데이터셋에 집중하여 두 번째 라운드의 훈련을 제공한 후, 오류율은 4% 미만으로 급감했습니다. 이 수준의 정확도는 고객의 이름이나 주소에 대한 실수가 실패한 거래나 좌절한 사용자로 이어질 수 있는 기업용 애플리케应用에서 매우 중요합니다. 또한 연구는 두 가지 버전의 모델, 즉 더 작고 빠른 버전과 더 크고 복잡한 버전을 비교했습니다. 더 큰 모델이 약간 더 정확했지만, 작은 버전은 성능이 거의 비슷하면서도 훨씬 빠르게 실행되어, 즉각적인 응답이 필요한 실시간 시스템에 더 나은 선택이 되었습니다.
실험 전반에 걸쳐 연구진은 컴퓨터가 오디오를 처리하는 속도를 측정했습니다. 그들은 작은 모델이 표준 하드웨어에서 실시간보다 600배 이상 빠르게 오디오를 처리하며 놀라운 속도로 작업량을 처리할 수 있다는 것을 발견했습니다. 이는 단 하나의 컴퓨터 칩이 지연 없이 수천 건의 통화를 동시에 처리할 수 있음을 의미합니다. 이 연구는 강력한 사전 학습된 모델과 세심하게 수집된 도메인 특화 데이터셋을 결합함으로써, 이전에 소외되었던 언어와 환경을 위한 견고한 음성 시스템을 구축하는 것이 가능하다는 것을 확인시켜 줍니다. 이 작업은 음성 인식의 모든 문제를 해결했다고 주장하거나 시스템이 가능한 모든 상황에서 완벽하다고 제안하는 것이 아닙니다. 대신, 적절한 데이터가 있다면 기계도 전화상에서 인간만큼 잘 들을 수 있다는 것을 보여줌으로써, 일반적인 AI 도구를 특정하고 소음이 많으며 이해관계가 걸린 기업용 전화 환경에 적응시키기 위한 명확하고 입증된 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.