← 최신 논문
💻 computer science

From Cascaded Speech Systems to Omni-Modal Agents: A Survey of Speech Interaction for Next-Generation Human-Computer Interaction

본 설문 조사는 전통적인 계단식 시스템에서 통합형 옴니모달 에이전트로의 음성 상호작용 진화를 추적하며, SpeechLLM과 Omni-MLLM의 아키텍처, 학습 전략 및 데이터 거버넌스를 체계적으로 분석하는 동시에 차세대 인간-컴퓨터 상호작용을 위한 주요 과제와 향후 방향을 식별한다.

원저자: Sisi Zhu, Yue Zhao, Hao Chen, Wensheng Gu, Tiancai Bai

게시일 2026-09-24
📖 5 분 읽기🧠 심층 분석

원저자: Sisi Zhu, Yue Zhao, Hao Chen, Wensheng Gu, Tiancai Bai

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 말을 들을 수는 있지만 당신의 어조는 듣지 못하고, 당신이 말하는 도중에 생각을 바꾸더라도 결코 말을 끊지 않으며, 오직 단조롭고 로봇 같은 목소리로만 대답할 수 있는 기계와 대화를 시도한다고 상상해 보십시오. 수년 동안 이것은 컴퓨터와 대화하는 현실이었습니다. 이러한 상호작용 뒤에 있는 기술은 전통적으로 세 명의 별개 주자가 달리는 계주 경기처럼 작동해 왔습니다. 먼저, 시스템이 당신의 목소리를 듣고 이를 텍스트로 변환합니다. 둘째, 별도의 컴퓨터 두뇌가 그 텍스트를 읽고, 당신의 의미를 파악하며, 답변을 작성합니다. 셋째, 다른 기계가 그 작성된 답변을 가져가서 당신에게 다시 말로 들려줍니다. 이 방식은 작동하기는 하지만, 느리고 서투릅니다. 당신의 목소리를 텍스트로 바꾸고 다시 목소리로 바꾸는 과정에서, 시스템은 인간의 대화를 자연스럽게 만드는 미묘한 단서들, 즉 당신의 목소리에 담긴 망설임, 음조의 높낮이, 말 뒤에 숨겨진 감정, 그리고 상대방이 아직 말하고 있을 때 끼어들 수 있는 능력 등을 놓치게 됩니다.

이제, 새로운 세대의 기술이 이 계주 경기를 하나의 통합된 마음으로 대체하려고 시도하고 있습니다. 연구자들은 텍-스트로 먼저 변환할 필요 없이, 듣고, 이해하고, 동시에 말할 수 있는 시스템을 구축하고 있습니다. 이 시스템들은 다중 감각을 통해 세상을 동시에 인지하도록 설계되어, 단순히 당신의 목소리뿐만 아니라 이미지, 비디오, 그리고 주변 환경의 소리까지도 처리하여 상황의 전체적인 맥락을 이해합니다. 마카오 시립 대학교와 민족 대학교의 연구진이 발표한 이 급변하는 분야에 대한 새로운 조사 보고서는 우리가 어떻게 여기까지 왔으며 어디로 가고 있는지를 보여줍니다. 저자인 주시시(Sisi Zhu), 자오위에(Yue Zhao) 및 동료들은 음성 상호작용이 경직된 단계별 프로세스에서, 기계를 조작하는 것이 아니라 사람과 대화하는 것처럼 느껴지는 유동적이고 연속적인 대화로 어떻게 변화하고 있는지를 보여주기 위해 최신 연구들을 수집했습니다.

이 논문은 이 기술의 역사를 네 가지 뚜렷한 단계로 추적합니다. 그것은 앞서 언급한 전통적인 "계단식(cascaded)" 시스템, 즉 세 개의 별개 모듈이 정보를 전달하던 방식에서 시작되었습니다. 연구진은 이 접근 방식이 구축하기는 쉬웠지만 근본적인 결함이 있었다고 설명합니다. 시스템이 목소리를 텍스트로 변환할 때마다 원래 소리의 풍부함을 일부 상실한다는 점입니다. 만약 계주의 첫 번째 주자가 실수를 한다면, 그 오류는 끝까지 이어지게 됩니다. 다음 단계는 "음성 거대 언어 모델(Speech Large Language Models)"을 도입했는데, 이는 목소리를 컴퓨터의 두뇌에 직접 통합하기 시작하여, 항상 텍스트로 바꾸지 않고도 음성을 이해할 수 있게 했습니다. 이는 화자의 감정과 스타일을 더 많이 보존할 수 있게 한 중요한 도약이었습니다.

그 후 이 분야는 음성과 함께 이미지와 비디오를 보고 이해하는 능력을 더한 "멀티모달 거대 언어 모델(Multimodal Large Language Models)"로 이동했습니다. 그러나 이러한 시스템들조차도 종종 서로 다른 유형의 정보를 별개로 취급하여, 이들을 매끄럽게 결합하는 데 어려움을 겪었습니다. 연구진이 가장 기대하고 있는 마지막이자 가장 진보된 단계는 "옴니모달 에이전트(Omni-Modal Agent)"입니다. 이들은 텍스트, 이미지, 비디오, 음성, 그리고 주변 환경의 소리를 모두 하나의 프레임워크 내에서 동시에 인지하도록 설계되었습니다. 한 번에 한 가지씩 처리하는 대신, 옴니모달 에이전트는 당신이 보여주는 비디오를 보면서 당신의 목소리를 들을 수 있고, 당신의 목소리가 화면상의 장면과 어떻게 일치하는지 이해할 수 있습니다. 이 조사는 이러한 시스템들이 인간처럼 말하기와 듣기를 동시에 할 수 있는 능력인 "전이중(full-duplex)" 상호작용을 지원하기 시작했음을 강조합니다. 이는 컴퓨터가 말을 하는 도중에 당신이 말을 끊으면 멈출 수 있거나, 답변을 구성하는 동안에도 당신의 말을 들을 수 있음을 의미하며, 훨씬 더 자연스러운 대화의 흐름을 만들어냅니다.

연구진은 단순히 이러한 기술들을 설명하는 데 그치지 않고, 그것들이 어떻게 구축되고 훈련되는지를 분석했습니다. 그들은 이러한 고급 시스템을 만드는 데 서로 다른 유형의 정보를 혼합한 방대한 양의 데이터가 필요하다는 것을 발견했습니다. 훈련 과정은 복잡합니다. 텍스트와 같은 한 가지 유형의 데이터를 이해하도록 모델을 가르치는 것부터 시작하여, 점진적으로 이미지, 오디오, 비디오를 도입합니다. 목표는 특정 소리가 시각적 사건과 어떻게 연결되는지와 같은 연결 고리를 모델이 이해하도록 가르치는 것입니다. 조사는 이러한 모델들이 믿기 힘들 정도로 유능해지고 있지만, 여전히 상당한 장애물에 직면해 있다고 언급합니다. 주요 과제 중 하나는 타이밍입니다. 실제 대화에서 모든 일은 순식간에 일어납니다. 연구진은 비디오 속의 시각적 동작과 말하는 단어의 타이밍을 맞추는 것이 어렵고, 눈에 띄는 지연 없이 즉각적으로 반응하도록 만드는 것이 여전히 진행 중인 과제라고 지적합니다.

이 논문의 또 다른 중요한 발견은 이러한 새로운 에이전트의 신뢰성과 안전성에 관한 것입니다. 이 시스템들은 매우 강력하기 때문에, 특히 서로 다른 출처의 정보를 결합하려고 할 때 정보를 "환각(hallucinate)"하거나 사실을 지어낼 수 있습니다. 예를 들어, 모델이 개의 사진을 보고 고양이 소리를 듣는다면, 사진 속에 고양이가 없더라도 자신 있게 고양이에 대해 설명할 수 있습니다. 저자들은 이러한 시스템에 대한 신뢰를 구축하는 것이 최우선 과제라고 강조합니다. 그들은 미래의 모델이 단순히 학습된 패턴에 기반해 추측하는 것이 아니라, 자신이 보고 듣는 실제 증거에 기반하여 답변을 검증할 수 있는 더 나은 방법을 갖추어야 한다고 주장합니다. 또한 이 조사는 개인정보 보호 문제도 다루며, 이 시스템들이 지속적으로 듣고 보고 있기 때문에 방대한 양의 민감한 개인 데이터를 수집하게 되어 보안 및 사용자 제어에 관한 중요한 질문을 제기한다고 언급합니다.

미래를 전망하며, 연구진은 다음 단계가 단순히 이러한 시스템을 더 똑똑하게 만드는 것이 아니라, 그 행동을 더 인간답게 만드는 것이라고 제안합니다. 그들은 음성 상호작용이 단순히 명령을 내리는 것이 아니라, 컴퓨터가 당신의 기분을 이해하고, 과거의 대화를 기억하며, 현실 세계에서 복잡한 업무를 도울 수 있는 진정한 지속적 대화가 되는 미래를 구상합니다. 조사는 결론적으로, 우리가 기계와 대화하는 오래되고 투박한 계주 방식에서 벗어나고 있지만, 그 여정은 결코 끝나지 않았다고 밝힙니다. 기술은 빠르게 진화하고 있지만, 진정으로 자연스럽고 신뢰할 수 있으며 안전한 상호작용을 달성하기 위해서는 연구자들이 속도, 정확성, 그리고 개인 데이터의 윤리적 사용과 관련된 문제들을 여전히 해결해야 합니다. 앞으로의 길은 단순히 강력한 시스템을 만드는 것을 넘어, 기계가 우리를 더 잘 이해하게 됨에 따라 우리의 일상생활에서 도움이 되고 안전한 파트너로 남을 수 있도록 신뢰할 수 있는 시스템을 구축하는 데 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →