← 최신 논문
💬 NLP

Liberating LLM Capabilities in Full-Duplex Speech Models

이 논문은 구조적 변경 없이 공유된 자기회귀형 LLM을 사용하여 실시간으로 듣고, 가시적인 구조화된 텍스트를 쓰고, 말하는 것을 동시에 수행할 수 있게 함으로써, 대화의 응답성을 유지하면서도 코드 생성 및 구조적 추론과 같은 텍스트 네이티브 역량을 해제하는 새로운 텍스트 우선 삼채널 패러다임인 Listen-Write-Speak(LWS)를 소개한다.

원저자: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하면서도 타자 실력이 뛰어난 동료와 회의를 하고 있다고 상상해 보세요. 현재 대부분의 AI 음성 비서는 오직 말하기만 할 줄 아는 동료와 같습니다. 만약 당신이 복잡한 컴퓨터 프로그램이나 상세한 차트를 작성해 달라고 요청하면, 그들은 말로 설명해야 합니다. "자, 함수를 시작하고, 변수를 정의하고..." 이는 느리고 따라가기 어려우며, 당신이 내용을 보관하고 싶다면 직접 받아 적어야만 합니다.

이 논문은 AI가 대화하는 새로운 방식인 **Listen-Write-Speak (LWS)**를 소개합니다. 이 새로운 AI를 세 가지 일을 동시에, 완벽하게 동기화하여 수행하는 동료라고 생각해 보세요:

  1. Listen (듣기): 그들은 당신이 말을 하는 동안에도 실시간으로 당신의 말을 듣습니다.
  2. Write (쓰기): 그들은 듣고 생각하는 동시에, 눈앞의 화면에 자신의 생각, 코드 또는 구조화된 노트를 실시간으로 타이핑합니다.
  3. Speak (말하기): 동시에, 그들은 자신이 타이핑하고 있는 내용을 자연스러운 대화체 요약본으로 말합니다.

"3차선 고속도로" 비유

저자들은 이를 **삼중 채널 패러다임(tri-channel paradigm)**이라고 설명합니다. 교통 흐름이 한 방향(대화의 타임라인)으로 흐르는 3차선 고속도로를 상상해 보세요:

  • 1차선 (듣기): 이 차선은 항상 열려 있습니다. AI는 말을 하는 중에도 당신의 말을 멈추지 않고 듣습니다. 이를 통해 "전이중(full-duplex)" 상호작용이 가능해지며, 즉 당신이 AI의 말을 끊더라도 AI는 혼란을 겪거나 멈추지 않습니다.
  • 2차선 (가시적 쓰기): 이것은 "생각"하는 차선입니다. AI는 자신의 생각을 블랙박스 안에 숨겨두는 대신, 화면에 직접 타이핑합니다. 만약 당신이 파이썬 스크립트를 요청하면 코드가 즉시 화면에 나타납니다. 만약 회의 요약을 요청하면 깔끔한 표가 나타납니다. 이것은 "제1순위(first-class)" 출력물로, AI가 자신의 작업물을 보여주는 주된 방식입니다.
  • 3차선 (말하기): 이 차선은 목소리를 전달합니다. AI는 당신이 내용을 읽는 동안 들을 수 있도록, 자신이 타이핑하고 있는 내용을 단순화된 구어체 버전으로 읽어줍니다.

어떻게 작동하는가 (마법의 기술)

논문은 이 방식이 완전히 새로운, 복잡한 로봇 두뇌를 구축할 필요는 없다고 주장합니다. 대신, 그들은 영리한 **토큰 스키마(Token Schema)**를 사용했습니다.

AI의 내부 언어를 레고 블록 세트라고 생각해 보세요. 보통 이 블록들은 말하기 기능만 수행합니다. 연구진은 특수한 "지시용 블록"(예: <unit>, <ls_cogn>, <speak>)을 발명했습니다. 이 블록들은 AI에게 다음과 같이 지시합니다. "지금 당신은 1초 단위의 시간 블록 안에 있습니다. 이 블록 동안, 당신은 이 오디오를 듣고, 이 텍스트를 타이핑하며, 이 문장을 말해야 합니다."

대화를 이 작은 1초 단위의 "단위(Units)"로 조직함으로써, AI는 엉키지 않고 세 가지 작업을 모두 수행할 수 있습니다. 이는 마치 지휘자가 오케스트라에게 *"다음 1초 동안 바이올린이 연주되고, 플루트가 연주되며, 타악기가 드럼을 두드려라"*라고 지시하는 것과 같습니다.

연구 결과

연구진은 이 새로운 AI를 다른 음성 모델들과 비교 테스트했으며, 다음과 같은 결과를 얻었습니다:

  • 더 나은 멀티태스킹 능력: AI가 말하는 동안 얼마나 잘 이해하고 추론하는지를 측정하는 테스트에서, LWS는 말하기만 하거나 말하기 전에 먼저 생각하는 모델보다 높은 점수를 기록했습니다.
  • 일관성: AI는 말하는 내용과 쓰는 내용이 서로 다르지 않았습니다. 92.6%의 경우에서, AI가 말한 내용과 쓴 내용이 완벽하게 일치했습니다.
  • 방해(중단) 처리 능력: AI는 말을 하는 중에도 계속 듣고 있기 때문에, 만약 당신이 말을 끊더라도 시스템이 멈추거나 당신이 끝날 때까지 기다리지 않고 매끄럽게 상황을 처리할 수 있습니다.

핵심 요약

이 논문은 AI가 생각하는 것을 쓰면서 동시에 말하게 함으로써, 우리는 두 가지 장점을 모두 얻을 수 있다고 주장합니다. 즉, 음성 대화의 속도와 자연스러움, 그리고 텍스트(코드나 데이터 테이블 등)의 정밀함과 구조를 결합한 것입니다. 이는 AI를 단순히 "말하는 머리"에서, 자신의 작업 과정을 실시간으로 보여주는 "협업 파트너"로 변화시킵니다.

참고 및 한계점: 저자들은 AI가 매초 실시간으로 이 모든 일을 수행해야 하기 때문에, 말을 하기 전 몇 시간 동안의 깊은 사고가 필요한 극도로 길고 복잡한 계획 수립 작업에는 최적화되지 않을 수 있다고 인정했습니다. 또한, 현재는 음성 입력만 허용하며 이미지나 파일은 받지 못합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →