CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning
CogPortrait는 고수준 레이블을 정밀한 얼굴 키 포인트로 변환하여 초고해상도 포트레이트 애니메이션에서 눈 영역의 역동성과 감정을 넘어선 상태를 세밀하게 제어하면서도 높은 시각적 품질과 정체성 일관성을 유지하도록 하는 계층적 멀티모달 대규모 언어 모델 에이전트를 활용하는 2 단계 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
한 사람의 정지된 사진을 말하고 움직이는 살아있는 모습으로 만들어 보라고 상상해 보세요. 대부분의 기존 방법은 감독에게 매우 모호한 대본을 주는 것과 같습니다. "그를 화난 표정으로 만들어라" 또는 "그녀를 행복한 표정으로 만들어라"는 식입니다. 결과는 나쁘지 않지만, 눈이 종종 죽어 있거나 움직임이 너무 매끄럽고 로봇처럼 보입니다. 반면, 어떤 방법들은 모든 작은 근육 운동을 제어할 수 있게 해주지만, 이는 감독에게 눈꺼풀과 눈썹의 픽셀 하나하나를 수동으로 움직이도록 요청하는 것과 같습니다. 이는 엄청나게 힘든 작업이며 많은 기술적 숙련도를 요구합니다.
CogPortrait는 완벽한 중간 지점을 찾으려 하는 새로운 시스템입니다. 이 시스템은 "그는 열심히 생각하고 있다" 또는 "그녀는 졸음이 온다"와 같은 간단하고 상위 수준의 지시를 입력하면, 눈과 머리가 어떻게 움직여야 현실적으로 보일지 자동으로 파악하여 사용자가 무거운 작업을 직접 하지 않아도 되도록 합니다.
다음은 두 가지 주요 장으로 나누어 설명한 작동 원리입니다.
제 1 장: "두뇌" (에이전트 팀)
동영상이 제작되기 전에, 이 시스템은 세 명의 AI "에이전트"(전문 제작 팀으로 생각하세요) 팀을 활용하여 단순한 아이디어를 상세한 움직임 계획으로 변환합니다.
- 기획자 (감독): 이 에이전트는 "인지적 노력"과 같은 간단한 라벨을 받아 시간표로 분해합니다. "먼저 1 초간 사람이 위를 보고, 그다음 눈살을 살짝 찌푸린 후, 왼쪽을 본다"고 결정합니다. 이는 사건의 스토리보드를 생성합니다.
- 작곡가 (도서관 사서): 이 에이전트는 실제 인간 행동 기록이 담긴 도서관으로 들어갑니다. "생각하며 눈살을 찌푸리는" 또는 "피곤할 때 천천히 깜빡이는" 사람들의 실제 사례를 찾아냅니다. 이러한 실제 생활의 단편들을 이어 붙여 현실적인 움직임 시퀀스를 생성하며, 눈이 이상하거나 로봇처럼 움직이지 않도록 보장합니다.
- 비평가 (품질 관리 검사원): 이 에이전트는 계획을 이중으로 점검합니다. "이게 실제로 누군가 생각하는 것처럼 보이나? 인간이 그렇게 빠르게 깜빡이는 게 물리적으로 가능한가?"라고 묻습니다. 계획이 이상하면 이를 작곡가나 기획자에게 보내 수정하도록 합니다.
이 팀의 결과는 컴퓨터가 눈꺼풀, 눈썹, 동공이 매 순간 정확히 어디에 있어야 하는지를 알려주는 정밀한 좌표 세트 (키포인트) 입니다.
제 2 장: "몸" (동영상 생성기)
움직임 계획이 준비되면 두 번째 단계가 시작됩니다. 이는 실제로 동영상을 그리는 부분입니다.
- 화가: 원래 사진, 오디오 (입술이 목소리에 맞춰 움직이도록 함), 그리고 1 장에서 나온 상세한 움직임 계획을 받습니다.
- 스마트 브러시 (동적 안내): 일반적으로 AI 가 그림을 그릴 때 얼굴 색상과 배경 색상이 섞이거나 눈이 흐릿하게 보일 수 있습니다. CogPortrait 는 눈에 추가적인 주의를 기울이는 "스마트 브러시"를 사용합니다. "배경은 안정적이고 자연스럽게 유지하되, 눈과 눈썹에는 추가적인 정밀도를 적용하여 깜빡임과 시선이 현실적으로 느껴지도록 하라"는 것입니다.
- 안전망 (KTO 정제): 때로는 AI 가 머리를 거의 완전히 옆으로 돌리거나 한쪽 눈썹만 올리는 것과 같은 까다로운 상황에서 어려움을 겪습니다. 이를 해결하기 위해 시스템은 특수한 "하드 모드" 데이터셋으로 훈련되었습니다. 이러한 어려운 사례에서 자신의 실수를 학습하여, 비정상적인 각도에서도 사람의 얼굴이 왜곡되지 않고 신원이 일관되게 유지되도록 했습니다.
이것이 왜 중요한가요?
이 논문은 이러한 시스템이 얼마나 잘 작동하는지 확인하기 위해 EMH(감정과 그 이상의 감정) 라는 새로운 테스트를 소개합니다. 이는 "행복"이나 "슬픔"과 같은 기본 감정은 물론 다음과 같은 미묘한 상태도 테스트합니다.
- 인지적 노력: 깊은 집중의 표정.
- 졸음: 무거운 눈꺼풀과 천천히 끄덕이는 모습.
- 회피 반응: 빠르게 시선을 피하는 모습.
결과에 따르면 CogPortrait 는 이전 방법들보다 눈을 제어하는 데 훨씬 뛰어납니다. 이는 캐릭터가 "피곤해 보이게" 또는 "생각하는 것처럼 보이게" 높은 정확도로 만들 수 있으면서도, 사람이 본래의 모습을 유지하고 동영상의 품질을 높게 유지합니다. 이는 "사용이 쉬움"(단순히 라벨 입력) 과 "매우 사실적임"(정밀한 눈 움직임) 사이의 간극을 연결합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.