AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach
이 논문은 화자의 최종 의도를 보존하면서 불필요한 언어 습관을 제거하고 자기 수정을 해결하기 위해 전사 내용을 반복적으로 수정함으로써 실시간 음성 인식을 정교화하는 에이전트 기반 프레임워크인 AgenticASR을 소개하며, 이는 새로운 이중 언어 벤치마크를 통해 검증되었고 여러 ASR 프런트엔드에 걸쳐 우수한 성능을 입증하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 친구의 이야기를 받아 적으려고 한다고 상상해 보세요. 하지만 당신의 친구는 인간처럼 정확하게 말합니다. 단어를 더듬거나, "음", "어"라고 말하며, 문장을 시작했다가 실수를 깨닫고 중간에 내용을 수정하기도 합니다. 만약 당신이 그가 내뱉는 모든 소리를 그대로 적는다면, 불필요한 시작과 반복으로 가득 찬 지저ç스럽고 혼란스러운 전사본을 얻게 될 것입니다. 이것이 전통적인 음성-텍스트 변환(speech-to-text) 기술이 하는 방식입니다. 이는 메시지의 '의도'를 포착하는 것이 아니라 말의 '소리'를 기록하는 매우 문자 그대로의 서기 역할을 합니다. 반면에, 일부 최신 도구들은 텍스트를 깔끔하게 정리하려고 시도하지만, 대개 사람이 말을 완전히 마칠 때까지 기다렸다가 편집을 시작합니다. 이는 문제를 일으킵니다. 만약 친구가 "메리네 집에... 아니, 마리네 집으로 만나자"라고 말한다면, 끝날 때까지 기다리는 도구는 이미 "메리"라고 적어버린 상태일 것이고, 처음부터 다시 시작하지 않고서는 이를 수정할 수 없습니다. 이 연구의 목표는 실시간으로 경청하며, 실수가 발생하는 즉시 이를 포착하고, 사람이 말을 하는 동안에도 텍스트를 즉각적으로 수정하여 깔끔하고 읽기 쉽게 만드는, 아주 빠르고 주의 깊은 편집자처럼 행동하는 시스템을 구축하는 것입니다.
이 논문은 AgenticASR(에이전틱 음성 인식)이라고 불리는 새로운 접근 방식을 소개합니다. 이것을 실시간 방송을 진행하는 두 명의 팀이라고 생각해보세요. 첫 번째 사람은 "서기"(ASR 프런트엔드)로, 더듬거림이나 "음" 같은 소리를 포함하여 들리는 대로 빠르게 타이핑합니다. 두 두 번째 사람은 "정제자"(에이전틱 부분)로, 똑똑한 편집자입니다. 그는 서기의 최근 몇 문장을 끊임없이 살핍니다. 서기가 텍스트 한 덩어리를 입력하자마자, 정제자는 그것을 보고 엉망인 부분을 고친 뒤, 지저분한 버전을 깔끔한 버전으로 교체합니다.
여기 마법 같은 기술이 있습니다. 정제자는 현재 문장만 보는 것이 아니라, 마지막 몇 개의 텍ек스트 덩어리를 머릿속에 작은 "윈도우(창)" 형태로 유지합니다. 만약 서기가 "메리를 만나"라고 쳤고, 그다음 덩어리가 "잠깐, 마리"라고 들어온다면, 정제자는 즉시 그 연결 고리를 알아차립니다. 정제자는 첫 번째 덩어리가 실수였다는 것을 깨닫고, "메리"를 삭제한 뒤, 화자가 다음 생각을 마치기도 전에 전체 문장을 "마리를 만나"로 업데이트합니다. 이를 통해 시스템은 말이 끝날 때까지 기다리지 않고도 자기 수정과 설명을 즉각 처리할 수 있습니다.
이것이 실제로 작동하는지 테스트하기 위해, 저자들은 AASR-Bench라는 특별한 놀이터를 만들었습니다. 일상적인 대화와 고객 서비스 전화부터 기술적인 코딩 세션, 음성 검색에 이르기까지 917개의 다양한 시나리오가 있는 거대한 장애물 코스를 상상해 보세요. 그들은 결과물을 채점하기 위해 6,637개의 작고 구체적인 질문(루브릭)을 만들었으며, 다음과 같은 사항들을 확인했습니다: "'음'을 제거했는가?", "이름의 철자를 고쳤는가?", "최종적인 의미를 올바르게 유지했는가?" 그들은 단순히 단어가 얼마나 맞았는지만 본 것이 아니라, 텍스트가 얼마나 읽기 쉽고 유용한지를 보았습니다.
결과는 이 "에이전틱(Agentic)" 접근 방식이 중요한 진전임을 시사합니다. AgenticASR을 다른 시스템들과 비교했을 때, 이 시스템은 지속적으로 더 깔끔하고 정확한 텍스트를 생성했습니다. 예를 들어, 특정 설정(Qwen3-ASR-1.7B와 정제자 조합)을 사용했을 때, 이 시스템은 전체 벤치마크에서 79.95점을 기록하며 차세대 방식들을 여유 있게 앞질렀습니다. 연구에 따르면, 시스템은 한 번에 약 3개의 음성 덩어리를 보는 "윈도우"를 가질 때 가장 잘 작동했습니다. 이 윈도우 크기는 몇 초 전의 수정 사항(예: "메리"에서 "마리"로의 전환)을 포착할 수 있을 만큼 충분히 컸지만, 시스템의 속도를 유지할 수 있을 만큼 작았습니다. 즉, 최적의 지점이었습니다.
저자들은 또한 "정제자"의 크기가 중요하다는 것을 발견했습니다. 더 크고 똑똑한 편집자(40억 개의 파라미터 모델)는 복잡한 문장을 고치는 데 약간 더 나은 성능을 보였지만, 생각하는 데 시간이 조금 더 걸렸습니다. 그러나 더 작은, 더 빠른 모델들조차도 단순히 끝날 때까지 기다렸다가 편집하는 시스템들보다 훨씬 뛰어났습니다. 논문은 이 시스템이 완벽하지는 않다는 점을 강조합니다. 만약 초기 서기가 단어를 아예 놓쳤다면, 정제자가 그것을 마법처럼 다시 만들어낼 수는 없습니다. 하지만 우리가 실제로 말하는 지저분한 현실의 요소들—추임새, 더듬거림, 문장 중간의 수정—에 대해서, AgenticASR은 혼란스러운 인간의 언어 흐름을 실시간으로 다듬어진 이야기로 바꾸는 실용적인 방법을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.