← 최신 논문
💬 NLP

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

이 논문은 음성 언어 모델(SLM)이 답변을 말하는 동안 내부적인 추론 과정을 동시에 수행할 수 있도록, 음성 출력과 무언(unspoken) 추론 청크를 교차 생성하여 지연 시간(latency)을 최소화하면서도 추론 성능을 높인 'Stitch'라는 새로운 생성 방식을 제안합니다.

원저자: Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang

게시일 2026-02-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 배경: 기존 AI의 문제점 (말하기 전의 '정적')

우리가 어려운 수학 문제를 물어봤을 때, 똑똑한 사람은 바로 입을 떼지 않습니다. 잠시 "음... 그러니까... (머릿속으로 계산 중)" 하며 생각을 정리한 뒤에 아주 명쾌하게 대답하죠.

하지만 지금까지의 음성 AI(Spoken Language Models)는 두 가지 극단적인 방식 중 하나였습니다.

  1. 생각 없이 바로 말하기: 머릿속으로 정리할 시간이 없으니, 말이 꼬이거나 틀린 답을 툭 내뱉습니다. (마치 시험 문제를 읽자마자 아무 생각 없이 답을 적는 학생과 같습니다.)
  2. 생각 다 하고 말하기: 완벽한 답을 내기 위해 머릿속으로 모든 계산을 끝낸 뒤에야 입을 엽니다. 문제는 이 과정이 너무 길어서, 사용자는 AI가 대답할 때까지 한참 동안 "어... 왜 말이 없지?" 하며 기다려야 한다는 것입니다. (마치 수학 문제를 다 풀 때까지 입을 꾹 다물고 있는 학생과 같습니다.)

🧵 해결책: STITCH (말하면서 동시에 생각하기)

연구진은 이 문제를 해결하기 위해 **'STITCH(스티치)'**라는 기술을 제안했습니다. 'Stitch'는 '한 땀 한 땀 꿰매다'라는 뜻이죠. 이 기술은 "말하는 시간"과 "생각하는 시간"을 교묘하게 교차시켜서 하나로 이어 붙입니다.

💡 비유: "요리사 이야기"

이 기술을 **'요리사'**에 비유해 보겠습니다.

  • 기존 방식 (TBS): 손님이 주문을 하면, 요리사가 주방에서 요리를 완전히 다 만들 때까지 손님에게 아무 말도 안 하고 가만히 있습니다. 손님은 요리가 나올 때까지 배고픈 채로 기다려야 하죠.
  • STITCH 방식: 요리사가 요리를 시작하자마자 손님에게 말을 겁니다. "네, 주문하신 오므라이스 준비해 드릴게요! (말하기 시작)" 그러면서 요리사는 손님과 대화하는 그 짧은 틈틈이 머릿속으로 다음 재료를 어떻게 손질할지, 간은 어떻게 맞출지 **계속해서 계산(생각)**합니다.

즉, 입으로는 "첫 번째 단계"를 말하고 있고, 그 말을 하는 동안 머릿속으로는 "두 번째 단계"를 위한 생각을 하는 것입니다.


🛠️ 어떻게 작동하나요? (STITCH-R & STITCH-S)

논문에서는 두 가지 버전을 제시합니다.

  1. STITCH-R (생각 먼저 조금 하기): 아주 짧게 "음, 잠시만요..." 하고 머릿속으로 첫 단추를 끼운 뒤 바로 말을 시작합니다. 말을 하는 동안 다음 생각을 계속 이어갑니다.
  2. STITCH-S (말 먼저 하기): 기다리는 시간을 아예 없애기 위해, 일단 질문에 대한 반응(예: "네, 계산해 드릴게요!")을 먼저 말해버립니다. 그 말을 하는 동안 머릿속으로는 본격적인 계산을 시작합니다. 사용자 입장에서는 대기 시간이 '0'에 가깝게 느껴집니다.

🏆 결과: 똑똑해졌는데, 빠르기까지 하다!

이 기술을 적용했더니 놀라운 결과가 나왔습니다.

  • 지능 상승: 수학 문제 풀이 능력이 기존 방식보다 약 15%나 향상되었습니다. 머릿속으로 '생각(Reasoning)'을 하는 과정을 거치기 때문입니다.
  • 속도 유지: 그런데도 사용자가 느끼는 대기 시간은 기존에 생각 없이 바로 말하던 모델과 똑같습니다. 말하는 시간을 '생각하는 시간'으로 알뜰하게 활용했기 때문입니다.
  • 자연스러움: 일반적인 대화(상식 질문 등)를 할 때는 성능이 떨어지지 않고 아주 자연스럽게 대화할 수 있었습니다.

🌟 요약하자면?

STITCH는 AI에게 **"말하는 동안 머릿속으로 딴생각(계산)을 할 수 있는 능력"**을 준 것입니다. 덕분에 우리는 AI가 틀린 말을 할까 봐 걱정할 필요도 없고, 대답을 기다리느라 지루해할 필요도 없게 되었습니다. 마치 말 잘하고 똑똑한 사람과 실시간으로 대화하는 듯한 경험을 주는 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →