← 최신 논문
💻 computer science

Investigating the Representation of Backchannels and Fillers in Fine-tuned Language Models

본 논문은 주석 달린 대화 말뭉치에 언어 모델을 미세 조정함으로써 인간의 백채널과 필러를 구별하고 생성하는 능력을 향상시켜 일반 모델을 보다 효과적인 대화 에이전트로 전환한다는 것을 보여준다.

원저자: Yu Wang, Leyi Lao, Langchu Huang, Gabriel Skantze, Yang Xu, Hendrik Buschmeier

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yu Wang, Leyi Lao, Langchu Huang, Gabriel Skantze, Yang Xu, Hendrik Buschmeier

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자연스러운 대화를 할 수 있도록 로봇을 가르친다고 상상해 보세요. 당신은 로봇에게 방대한 양의 책들을 읽게 합니다. 로봇은 문법, 어휘, 사실들을 매우 잘 습득합니다. 하지만 문제가 하나 있습니다. 책들은 대체로 "정리된" 상태이기 때문입니다. 책에는 실제 사람들이 말할 때 내는 "어", "음", "응", "글쎄" 같은 거친 작은 소리들이 포함되어 있지 않습니다.

컴퓨터 과학의 세계에서는 이러한 소리들을 종종 노이즈로 취급합니다. 마치 라디오 선의 정적처럼 신호를 명확하게 만들기 위해 삭제해야 할 잡음처럼요. 하지만 실제 생활에서 이러한 소리들은 사실 사회적 접착제입니다. 이러한 소리는 상대방에게 "듣고 있어요", "동의해요", 또는 "생각 중이니 아직 방해하지 마세요"라고 전달합니다.

이 논문은 마치 연구자들이 로봇에게 이 "사회적 접착제"를 무시하지 않고 자연스럽게 사용하도록 가르치는 워크숍과 같습니다.

문제: 로봇이 너무 예의 바릅니다

연구자들은 표준 AI 모델 (즉, "로봇") 이 너무 예의 바르고 완벽하다고 발견했습니다. 대부분 정리된 텍스트로 훈련되었기 때문에, 주의를 기울이고 있음을 보여주기 위해 "응"이라고 하거나, 생각 중임을 보여주기 위해 "음"이라고 하는 법을 모릅니다. 그들은 커피숍에서 인간이 수다를 떠는 것이 아니라, 대본을 읽는 로봇처럼 들립니다.

실험: 로봇을 가르치는 세 가지 방법

이를 해결하기 위해 연구자들은 여러 다른 AI 모델 (작은 것부터 매우 큰 것까지) 을 가져와 영어와 일본어 화자들의 실제 대화 자료로 특별한 "완성 학교"를 제공했습니다. 그들은 세 가지 다른 교수법을 시도했습니다:

  1. 빈칸 채우기 게임 (마스킹): 연구자들은 대화를 가져와 "응"이나 "음" 부분을 가린 뒤, 로봇에게 문맥을 바탕으로 무엇이 빠졌는지 추측하도록 요청했습니다. 이는 로봇이 왜 그러한 소리들이 발생하는지 학습하도록 강요했습니다.
  2. 다음 단어 게임 (다음 토큰 예측): 연구자들은 로봇에게 대화를 읽게 한 뒤, "코끼리" 같은 큰 단어나 "어" 같은 작은 소리든 간에 바로 다음 단어를 예측하도록 했습니다. 이는 로봇에게 이러한 작은 소리들이 큰 단어만큼이나 중요하다는 것을 가르쳤습니다.
  3. 턴테이킹 게임 (턴테이킹 예측): 연구자들은 로봇에게 한 사람이 언제 말을 멈추고 다른 사람이 시작해야 할지 추측하도록 요청했습니다. "응"은 종종 청자가 말을 시작할 준비가 되었음을 나타내므로, 이는 로봇이 대화의 리듬을 이해하는 데 도움이 되었습니다.

결과: 로봇이 "인간적인" 느낌을 얻습니다

연구자들은 로봇에게 대화를 이어가게 하는 것뿐만 아니라, 수학적으로 로봇의 두뇌를 들여다보아 이러한 소리들에 대해 어떻게 사고하는지 관찰했습니다.

  • 훈련 전: 로봇의 두뇌를 모든 다른 "응"과 "음" 소리가 한 거대한 더미에 던져진 큰 방처럼 상상해 보세요. 로봇은 "동의"를 의미하는 "응"과 "놀람"을 의미하는 "응"의 차이를 구별할 수 없었습니다. 모두 똑같이 보였습니다.
  • 훈련 후: 특별한 수업 이후, 로봇의 두뇌는 그 messy 한 방을 정리했습니다. 이제 서로 다른 유형의 소리들은 각각 고유한 선반을 갖게 되었습니다. 로봇은 "응"(동의) 과 "음"(생각 중) 이 다르다는 것을 배웠습니다. 수학적 점수 (실루엣 점수라고 함) 가 상승하여 로봇이 마침내 이러한 미묘한 사회적 신호들을 구별하고 있음을 증명했습니다.

그들은 또한 로봇에게 대화를 이어가도록 요청하여 테스트했습니다.

  • 전: 로봇은 딱딱하고 로봇 같은 답변을 내놓았습니다.
  • 후: 로봇은 "응", "글쎄", "어"와 같은 자연스러운 소리들을 섞어 말하기 시작했습니다. 훨씬 더 인간처럼 들렸습니다.

결론

주요 발견은 간단합니다: 로봇에게 언어의 "거친" 부분을 구체적으로 가르침으로써 로봇을 더 인간처럼 만들 수 있습니다.

이러한 작은 소리들 (백채널과 필러) 이 "사과"나 "자동차"처럼 무거운 의미를 전달하지는 않지만, 거대한 사회적 의미를 담고 있습니다. 연구자들은 실제 대화 데이터로 모델을 미세 조정함으로써, AI 가 이러한 소리들을 사용하여 우리가 하듯이 대화의 흐름을 관리하도록 학습할 수 있음을 보여주었습니다.

이 논문이 말하지 않는 것:

  • 이 로봇들이 치료사나 의사가 될 준비가 되었다고 주장하지 않습니다.
  • 이것이 모든 AI 문제를 해결할 것이라고 말하지 않습니다.
  • 이 논문은 오직 이러한 소리들의 학습 과정내부 표현에 초점을 맞추어, 올바른 훈련을 통해 AI 가 이전보다 이러한 소리들을 더 잘 이해하고 생성할 수 있음을 증명합니다.

요약하자면, 연구자들은 "음"과 "어"를 쓰레기로 취급하지 않고 중요한 사회적 신호로 취급하기 시작하면, 당신의 AI 가 마침내 계산기처럼 들리는 것이 아니라 대화 상대처럼 들리게 된다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →