← 최신 논문
💬 NLP

fog: Expressing Motion and Emotion through Function Composition of AI-Generated Code

이 논문은 사용자가 표현력이 풍부한 하이더-시멜(Heider-Simmel) 스타일의 움직임과 감정을 생성할 수 있도록 AI 생성 코드와 대화형 애니메이션 에디터를 활용하는 함수 합성 프레임워크인 "fog"를 소개하며, 이는 68%의 의미론적 인식 정확도와 향상된 사용자 제어력을 보여주는 지각 연구를 통해 검증되었다.

원저자: Vivian Liu, Lydia Chilton

게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vivian Liu, Lydia Chilton

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 화면 위에 떠다니는 도형들—삼각형, 원, 사각형—만을 이용해 이야기를 들려주려고 한다고 상상해 보세요. 당신은 원이 삼각형을 쫓아가며 '화가 난' 것처럼 보이게 하고 싶고, 삼각형은 도망치며 '겁에 질린' 것처럼 보이게 하고 싶습니다. 단순해 보이죠? 하지만 AI에게 "원을 화나게 만들어줘"라고 요청하면, AI는 그저 제자리에서 회전하거나 너무 빠르게 움직이는 등, '감정'을 놓친 채 움직임만 구현할 수도 있습니다.

이것이 바로 fog(연구자 Vivian Liu와 Lydia Chilton이 개발한 새로운 도구)가 해결하고자 하는 문제입니다. fog는 단순히 컴퓨터에게 모호한 지시를 내리는 대신, 움직임과 감정을 코드로 구축된 거대한 '레고 세트'처럼 다룹니다.

핵심 아이디어: 움직임은 마법 주문이 아니라 레시피다

연구진은 움직임과 감정이 무작위적인 혼돈이 아니라, 특정한 재료들로 이루어져 있다고 제안합니다. 요리에 비유해 볼 수 있습니다. 만약 당신이 매콤한 음식을 원한다면, 요리사에게 그냥 "매콤하게 만들어줘"라고 말하는 것이 아니라, 고추, 후추, 열기의 양을 구체적으로 조절하여 넣는 것과 같습니다.

fog에서 "재료"는 동사(예: 쫓다, 도망치다), 부사(예: 주저하며, 공격적으로), 제스처(예: 흔들기, 떨기), 그리고 감정(예: 분노, 두려움)입니다. 마법은 이 코드 블록들을 서로 결합할 때 일어납니다.

예를 들어, 당신이 어떤 도형이 다른 도형을 주저하며(chase) 쫓아가도록 설정할 수 있습니다. 시스템은 단순히 추측하는 것이 아니라, 도형이 앞으로 나아가다가도 불안하게 멈칫거리거나 약간 떨리는 구체적인 레시피를 구축합니다. 또는 분노와 **돌진(lunge)**을 결합하여, 에너지를 모았다가 강하게 타격하고 다시 움츠러드는 움직임을 만들어낼 수도 있습니다.

"마법" 테스트: 사람들이 실제로 감정을 느낄 수 있는가?

연구팀은 단순히 이것을 만들고 결과가 좋기를 바라기만 한 것이 아닙니다. 그들은 452개의 서로 다른 애니메이션을 가지고 대규모 맛보기 테스트를 실시했습니다. 그들은 수백 명의 사람들에게 이 움직이는 도형들을 보여주고, "이 도형이 무엇을 하고 있나요? 쫓고 있나요, 피하고 있나요, 아니면 싸우고 있나요?"라고 물었습니다.

결과는 꽤 멋졌습니다. 사람들은 68%의 확률로 정확한 의미를 맞혔습니다. 이것이 학교 성적으로 치면 C+처럼 보일 수도 있지만, 기억하세요. 만약 네 가지 옵션 중에서 무작위로 찍었다면 정답률은 **25%**였을 것입니다. 즉, fog의 애니메이션은 운 좋은 추측보다 2.68배 더 뛰어났습니다.

하지만 논문은 이것이 완벽한 해결책은 아니라는 점을 주의 깊게 언급합니다. 두 가지를 함께 섞으려고 할 때—예를 들어서 어떤 도형이 주저하면서 동시에 쫓아가게 만들 때—정확도가 약 **58%**로 약간 떨어졌습니다. 때때로 "재료"들이 충돌하기도 하는데, 마치 기름과 물을 섞으려는 것과 같았습니다. 연구진은 "주저함"의 코드와 "쫓기"의 코드가 움직임의 동일한 부분을 제어하려고 할 때, 서로의 효과를 상쇄시키는 경우가 있다는 것을 발견했습니다. 이는 시스템이 강력하긴 하지만, 아직 사람의 마음을 읽는 수준은 아니라는 점을 상기시켜 줍니다.

창작자들을 위한 "놀이터"

연구진은 실제 사람들이 이를 어떻게 사용하는지 확인하기 위해 놀이터(애니메이션 에디터)를 구축했습니다. 그들은 애니메이션 전문가부터 코딩을 전혀 모르는 사람까지 10명의 참가자를 초대했습니다.

그들은 fog를 일반적인 "원하는 것을 그냥 타이핑하는" AI 도구와 비교했습니다. 차이는 엄청났습니다.

  • 기존 방식: 사용자는 프롬프트를 입력하고, AI가 전체 장면을 생성할 때까지 기다려야 했으며, 결과가 마음에 들지 않으면 다시 기다려야 했습니다. 애니메이션의 새로운 버전을 보는 데만 약 1.75분이 걸렸습니다.
  • fog 방식: 사용자는 움직임을 즉각적으로 수정할 수 있었습니다. 슬라이더를 드래그하여 도형의 속도를 조절하거나, 도형이 따라갈 경로를 그리거나, 다양한 감정을 실시간으로 조합할 수 있었습니다. 새로운 버전을 보는 데 걸리는 시간은 단 0.36분으로 줄어들었습니다.

전문가들은 모든 세부 사항을 미세하게 조정할 수 있는 "원자적(atomic)"인 구성 요소를 가진 것 같다고 느끼며 제어력을 높게 평가했습니다. 초보자들은 빈 화면을 보며 무엇을 타이핑해야 할지 고민하는 대신, 미리 만들어진 "동사"와 "부사"의 그리드에서 선택하여 시작할 수 있는 안전망을 좋아했습니다. 한 초보자는 원이 불안해하다가 진정되는 모습을 애니메이션으로 만들며, "원 안에서 감정이 느껴져요"라고 말하기도 했습니다.

이것이 "아닌" 것 (그리고 아직 할 수 없는 것)

이 논문이 주장하지 않는 부분도 명확히 알아두어야 합니다.

  • 영화 제작 도구가 아닙니다: 이 애니메이션들은 여전히 원이나 삼각형 같은 단순한 도형들이 움직이는 것에 불과합니다. 논문은 68%의 정확도가 훌륭하긴 하지만, 100% 완벽함을 기대할 수는 없다고 명시합니다. 단순한 원 하나가 인간의 모든 감정이나 복잡한 이야기를 표현할 수는 없습니다.
  • AI의 "만능 해결사"가 아닙니다: 연구진은 AI가 스스로 코드를 "자기 개선(self-refine)"하여 충돌하는 재료들을 해결하도록 시도했지만, 큰 도움이 되지 않았습니다. 정확도는 거의 변하지 않았습니다.
  • 복잡한 로봇을 위한 것은 아닙니다 (아직은): 이 시스템은 이러한 추상적인 도형 이야기에서 가장 잘 작동합니다. 논문은 만약 관절과 조명이 있는 실제 로봇이나 얼굴이 있는 캐릭터를 애니메이션화하고 싶다면, fog가 아직 그 정도의 세밀함에는 준비되지 않았다고 언급합니다.

요약

fog는 우리가 감정을 코드 함수로 분해함으로써 컴퓨터에게 감정을 가르칠 수 있다는 점을 시사합니다. 이는 마치 감정을 위한 레시피 북과 같습니다. 이것이 모든 애니메이션 문제를 해결하는 완벽한 마법 지팡이는 아니지만, 매우 강력하고 새로운 놀이 방식입니다. 이는 "AI에게 무엇을 할지 말하는" 두렵고 모호한 과정을, 움직임의 재료들을 섞고 조합하며 즐기는 손에 잡히는 게임으로 바꾸어 놓았습니다. 이를 통해 전문가와 초보자 모두가 실제로 살아있는 듯한 느낌을 주는 도형들로 이야기를 들려줄 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →