← 최신 논문
🤖 AI

LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans

본 논문은 에크만(Ekman)의 프레임워크를 기반으로 언어-비언어적 불일치에 대한 분류 체계를 제안하고, 가상 인간을 위해 맥락적으로 적절한 부조화 행동을 선택하는 데 있어 거대 언어 모델의 활용을 조사하며, 인간 대상 연구를 통해 의도한 관찰자 효과를 생성하는 데 있어 이들의 유효성을 검증한다.

원저자: Parisa Ghanad Torshizi, Stacy Marsella

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Parisa Ghanad Torshizi, Stacy Marsella

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

말과 말 사이의 고요한 공간에서, 인간의 의사소통은 종종 가장 복잡한 작업을 수행한다. 우리가 대화할 때, 우리는 단순히 정보를 전달하는 것이 아니라 얼굴, 눈, 그리고 자세를 통해 우리의 감정, 사회적 지위, 그리고 숨겨진 의도를 투영한다. 비언어적 행동이라고 알려진 이러한 침묵의 신호들은 우리가 하는 말을 강화할 수도 있지만, 때로는 그 말과 모순되기도 한다. 어떤 사람은 걱정으로 얼굴이 굳어진 채 "괜찮아요"라고 말하거나, 조롱을 암시하는 어조로 칭찬을 건넬 수도 있다. 입이 말하는 것을 몸이 배신하게 하거나, 예의 바른 미소 뒤에 진심을 숨기는 이러한 능력은 인간이 관계를 탐색하고, 갈등을 관리하며, 신뢰를 나타내는 근본적인 방식이다. 수십 년 동안 연구자들은 컴퓨터가 이러한 복잡성을 모방할 수 있도록 가르치려 노력해 왔으며, 사람처럼 움직이고 몸짓을 할 수 있는 가상 에이전트를 구축해 왔다. 그러나 이러한 디지털 캐릭터들은 대부분 단순한 규칙에 국한되어 왔다. 즉, 단어가 행복하면 얼굴도 행복해야 한다는 것이다. 그들은 때때로 사람이 말과는 다른 행동을 하는 것이 가장 정직한 행동이 될 수 있다는 사실을 이해하는 데 어려움을 겪는다.

노스이스트 대학교(Northeastern University)의 연구팀은 이러한 한계를 바꾸기 위해 나섰다. 그들은 거대 언어 모델(LLM)이라 불리는 일종의 인공지능을 사용하여, 가상의 인간이 이러한 미묘하고 모순적인 행동을 자동으로 생성하도록 가르칠 수 있는지 확인하고 싶었다. 이러한 모델은 방대한 양의 텍스트를 학습하여 문맥과 뉘앙스를 이해할 수 있는 강력한 시스템이다. 연구진은 구체적인 질문을 던졌다: 만약 컴퓨터에게 대화 내용과 상황에 대한 설명을 제공한다면, 컴퓨터가 좋은 말을 하면서도 왜 슬픈 표정을 지어야 하는지, 혹은 나쁜 소식을 전하면서도 왜 친근한 표정을 지어야 하는지를 파악할 수 있을까? 그들은 단순히 컴퓨터가 추측하기를 원한 것이 아니라, 컴퓨터가 인간 관찰자들에게 실제처럼 느껴지는 방식으로 이러한 선택을 할 수 있는지 확인하고자 했다.

이를 테스트하기 위해, 연구팀은 먼저 사람들이 말과 행동을 불일치시키는 다양한 방식에 대한 지도를 만들었다. 그들은 사람들이 왜 이런 행동을 하는지에 대한 네 가지 주요 이유를 식별했다. 때로는 화자가 누군가를 비난하기 위해 찬사를 사용하거나 애정을 표현하기 위해 비판을 사용하는 '아이러니(irony)'가 있다. 또 다른 경우에는, 상대의 기분을 상하게 하지 않기 위해 혹독한 비판을 따뜻한 미소로 완화하거나, 자신의 분노를 숨기기 위해 억지로 예의 바른 미소를 짓는 '체면 살리기(saving face)'가 있다. 또한, 비밀스러운 감정을 숨기려는 '기만(deception)'과, 내면에서 솟구치는 감정을 억제하려는 '감정 조절(emotional regulation)'도 있다. 이러한 범주를 사용하여 연구진은 업무량을 늘린 상사에게 보고하는 주니어 직원이나, 십 대 아들에게 피드백을 주는 어머니와 같은 여덟 가지 구체적인 시나리오를 설계했다.

그 후 연구진은 컴퓨터에게 행동 생성을 요청하는 세 가지 다른 방법을 테스트했다. 첫 번째 방법은 컴퓨터에게 오직 말하는 문장만을 제공하는 것이었다. 두 번째는 해당 문장 이전에 이어지는 대화의 이력을 추가하는 것이었다. 세 번째이자 가장 상세한 방법은 대화 이력에 더해 화자 간의 관계와 사회적 환경에 대한 서술형 설명을 제공하는 것이었다. '클로드(Claude)'라는 모델로 구동되는 컴퓨터는 각 문장에 대해 캐릭터의 얼굴과 눈이 어떻게 움직여야 하는지를 결정하도록 요청받았다. 결과는 명확했다. 컴퓨터에게 단어만 주었을 때는 단어가 행복하면 캐릭터를 행복하게, 단어가 슬프면 슬프게 만드는 경량의 패턴을 보였다. 하지만 연구진이 전체적인 맥락—권력 역학, 대화 이력, 사회적 압박—을 제공했을 때, 컴퓨터는 단어와 모순되는 행동을 선택하기 시작했다. 요구가 많은 상사에게 더 많은 업무를 수락해야 하는 주니어 직원의 시나리오에서, 컴퓨터는 작고 절제된 미소와 함께 시선을 잠시 돌리고 입술을 팽팽하게 조이는 동작을 선택했다. 컴퓨터는 직원이 "예"라고 말하면서도 속으로는 "아니오"라고 느끼고 있음을 이해한 것이다.

컴퓨터가 생성한 선택이 실제로 작동하는지 확인하기 위해, 연구진은 디지털 지침을 가상 인간의 비디오 클립으로 변환하여 사람들에게 보여주었다. 첫 번째 연구에서 참가자들은 비디오 쌍을 시청하고 어떤 화자가 더 긍정적인 태도를 가졌는지 결정하도록 요청받았다. 가상의 인간이 긍정적인 말을 하면서도 부정적인 표정을 지었을 때, 사람들은 인간이 행복한 표정을 지었을 때보다 태도가 덜 긍정적이라고 일관되게 평가했다. 반대로, 인간이 부정적인 말을 하면서도 따뜻하게 미소 지었을 때는 인간이 화난 표정을 지었을 때보다 태도가 더 긍정적이라고 평가했다. 두 번째 연구는 더 깊이 들어가서, 사람들이 보는 구체적인 감정을 평가하게 했다. 결과는 컴퓨터가 선택한 비언어적 신호가 화자의 감정에 대한 사람들의 느낌을 변화시킬 만큼 강력하다는 것을 보여주었다. 만약 컴퓨터가 행복한 문장에 미간을 찌푸리는 표정을 선택했다면, 사람들은 화자가 실제로 화가 났거나 비꼬고 있다고 느꼈다. 만약 컴퓨터가 슬픈 문장에 따뜻한 미소를 선택했다면, 사람들은 분노보다는 연민을 느꼈다고 보고했다.

이 연구는 인공지능에 대화의 전체적인 사회적 맥락을 제공하는 것이 단어만을 기반으로 할 때보다 훨씬 더 인간다운 비언어적 행동을 생성할 수 있게 해준다는 점을 확인시켜 준다. 컴퓨터는 단순히 문장의 감정을 반복하는 것이 아니라, 상황을 해석하여 불일치가 가장 정직한 반응이라고 결정했다. 연구진은 이 시스템이 제스처와 목소리 톤을 다루는 데 아직 개선이 필요하며 비디오가 짧았다는 점을 언급했지만, 핵심적인 발견은 매우 중요하다. 이는 가상 인간이 특히 치료사 훈련이나 협상과 같은 역할을 수행할 때, 진정으로 설득력을 갖추기 위해서는 입이 아닌 몸이 다른 이야기를 하게 할 수 있어야 함을 시사한다. 컴퓨터는 때때로 진실은 말이 아니라, 그 사이의 침묵 속에 있다는 것을 배웠다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →