← 최신 논문
💻 computer science

Realistic Lip Motion Generation Based on 3D Dynamic Viseme and Coarticulation Modeling for Human-Robot Interaction

이 논문은 중국어 발음 이론과 ARKit 표준을 기반으로 3D 동적 비즘 (viseme) 라이브러리와 자음 - 모음 분리 및 에너지 변조를 활용한 협음기법을 개발하여, 인간형 로봇의 자연스러운 음성 기반 입술 동기화를 가능하게 하는 경량화된 프레임워크를 제안합니다.

원저자: Sheng Li, Jingcheng Huang, Min Li

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sheng Li, Jingcheng Huang, Min Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 로봇이 사람처럼 자연스럽게 입술을 움직이며 말을 할 수 있게 만드는 기술에 대해 설명합니다.

기존의 로봇들은 말을 할 때 입술 모양이 딱딱하거나, 말소리와 입 모양이 안 맞아서 "불쾌한 골짜기 (Uncanny Valley)" 현상을 일으키곤 했죠. 이 연구는 그 문제를 해결하기 위해 중국어 발음의 특성을 분석하고, 3D 입술 움직임 데이터를 활용하여 훨씬 더 자연스러운 로봇을 만들었습니다.

이 복잡한 기술을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 문제: 로봇은 왜 '부자연스러운' 입술을 할까?

기존 로봇의 입술 움직임은 마치 스틱 피규어 (Stick Figure) 가 움직이는 것과 비슷했습니다.

  • 과거의 방식: "ㄱ" 소리가 나면 입 모양을 'A'로, "ㄴ" 소리가 나면 'B'로 딱딱 바꿨습니다. 마치 슬라이드 쇼를 빠르게 넘기는 것처럼요.
  • 문제점: 실제 사람은 소리를 낼 때 입술이 부드럽게 미끄러지듯 움직입니다. 하지만 로봇은 소리와 입 모양이 딱딱 끊겨서, 마치 입술이 부딪히는 듯한 어색함을 줍니다. 특히 중국어처럼 소리가 이어지면서 입 모양이 변하는 '연음 (Coarticulation)' 현상을 처리하지 못해 더 어색해졌습니다.

2. 해결책 1: "입술의 무용극"을 기록하다 (3D 다이나믹 비셈 라이브러리)

연구팀은 로봇에게 단순히 '입 모양'을 가르치는 게 아니라, 입술이 움직이는 '전 과정'을 기록했습니다.

  • 비유: 기존 방식이 사진첩이라면, 이 연구는 고화질 무용 영상을 만든 것과 같습니다.
  • 어떻게?: 실제 사람이 발음할 때 입술이 어떻게 시작해서, 어떻게 변형되고, 어떻게 끝나는지 3D 로 정밀하게 찍었습니다. 이를 '3D 다이나믹 비셈 (3D Dynamic Viseme)'이라고 부르는데, 총 14 가지 핵심 입술 동작 패턴을 만들었습니다.
  • 효과: 로봇은 이제 정적인 사진이 아니라, 유연하게 움직이는 무용수의 동작을 따라 할 수 있게 되었습니다.

3. 해결책 2: "소리와 입술의 춤"을 연결하다 (연음 모델링)

중국어는 앞의 글자와 뒤의 글자가 만나면 입술 모양이 서로 영향을 주며 변합니다. (예: 'ba'라고 할 때, 'b'를 낼 때 이미 'a'를 위한 입술 둥글림이 시작됩니다.)

  • 비유: 이는 두 사람이 손을 잡고 춤을 추는 것과 같습니다. 한 사람이 발을 내디딜 때, 다른 사람은 이미 다음 동작을 준비하며 자연스럽게 연결되어야 합니다.
  • 기술: 연구팀은 '초성 (시작 소리)'과 '종성 (끝 소리)'을 분리해서 생각하되, 두 소리가 만나는 지점에서 **부드러운 교차 (Fusion)**를 일으키는 알고리즘을 만들었습니다.
  • 결과: 로봇이 말을 할 때 입술이 갑자기 튀어오르거나 멈추는 대신, 사람처럼 자연스럽게 흐르는 입술 움직임을 보여줍니다.

4. 해결책 3: "디지털 명령을 기계 팔로 옮기다" (매핑 및 조정)

가장 어려운 점은, 컴퓨터 속의 복잡한 3D 입술 데이터를 실제 로봇의 작은 모터 14 개에 어떻게 옮길지입니다.

  • 비유: 마치 **거대한 오케스트라 (27 개의 디지털 신호)**를 **작은 현악 4 중주 (14 개의 로봇 모터)**로 편곡하는 작업입니다. 모든 악기를 다 쓸 수 없으니, 가장 중요한 소리만 골라 조화롭게 연주해야 합니다.
  • 기술: 연구팀은 컴퓨터의 정교한 데이터를 로봇의 모터가 이해할 수 있도록 간소화하고, 로봇의 기계적 한계를 고려해 수동으로 미세 조정을 가했습니다.
  • 결과: 복잡한 알고리즘이 로봇의 작은 모터에서도 정확하고 자연스러운 입술 움직임을 만들어냅니다.

5. 실험 결과: 얼마나 잘할까?

연구팀은 이 기술을 실제 로봇에 적용하고 사람과 비교했습니다.

  • 부드러움 (Jerk): 로봇의 입술 움직임이 얼마나 매끄러운지 측정했습니다. 기존 방식은 입술이 떨리거나 뚝뚝 끊기는 현상이 많았지만, 이 기술을 적용한 로봇은 실제 사람과 거의 비슷한 수준의 부드러움을 보였습니다.
  • 자연스러움 (Accuracy): 입술 모양이 사람과 얼마나 비슷한지 측정했습니다. 이 새로운 방법은 기존 로봇들보다 약 37% 더 정확하고, 리듬감도 훨씬 좋아졌습니다.

요약

이 논문은 **"로봇에게 입술 움직임을 가르칠 때, 단순히 모양만 바꾸지 말고, 사람이 말하는 '흐름'과 '감정'을 담아야 한다"**는 것을 증명했습니다.

이 기술을 통해 앞으로 우리가 로봇과 대화할 때, 로봇의 입술이 사람처럼 자연스럽게 움직이며 소리와 시각이 완벽하게 일치하는 경험을 할 수 있게 될 것입니다. 이는 특히 시끄러운 환경에서 로봇의 말을 더 잘 이해하게 하거나, 청각 장애인이 로봇의 입술을 보고 말을 이해하는 데 큰 도움이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →