Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair
본 논문은 폐쇄형 텍스트-비디오 모델의 정체성 표류(identity drift) 및 지시 이행 실패를 극복하기 위해 에이전트 기반 프롬프트 강화 모듈과 VLM 기반 시각적 의미론적 복구 모듈을 결합한 경량 프레임워크인 AESR(Agentic Enhancement and Semantic Repair)을 제안하며, 이를 통해 ACM MM 2026 Identity-Preserving Video Generation Challenge에서 1위를 달성하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 발전하는 세상에서, 특정 과제가 부상했습니다. 바로 기계가 단순히 글자로 된 이야기를 따르는 것을 넘어, 영상 전체에서 특정 인물이 정확히 그 자신처럼 보이도록 움직이는 영상을 만들도록 가르치는 것입니다. 컴퓨터에게 친구가 북적이는 시장을 걷다가 꽃을 사는 장면을 생성하라고 요청하면서, 동시에 영상 속의 얼굴이 변함없이 당신의 친구임을 확신할 수 있도록 유지하라고 요구한다고 상상해 보십시오. 현대의 도구들은 이미 놀라울 정도로 사실적인 움직임과 조명을 만들어낼 수 있지만, 이러한 일관성을 유지하는 데는 종종 어려움을 겪습니다. 캐릭터는 처음에는 당신의 친구였다가 서서히 다른 사람으로 변하거나, 명령어가 복잡해질 때 컴퓨터가 요청한 꽃을 넣는 것을 단순히 잊어버릴 수도 있습니다. 이는 매우 중요한 난제인데, 오늘날 사용 가능한 가장 강력한 비디오 생성기들은 내부 작동 방식이 숨겨진 '블랙박스'와 같은 폐쇄형 시스템이기 때문에, 연구자들이 단순히 코드를 수정하여 이러한 오류를 해결하는 것이 불가능하기 때문입니다.
베이킹 대학교(Peking University)의 연구팀은 이 블랙박스를 열 필요 없이 이 문제를 해결할 수 있는 새로운 접근 방식을 개발했습니다. 연구진은 비디오 생성기 자체를 바꾸려 하는 대신, 그 주변에서 작동하는 똑똑한 조수를 구축했습니다. AESR라고 불리는 이 시스템은 마치 숙련된 감독이자 편집자처럼, 촬영 전에 지침을 준비하고 첫 번째 테이크 이후에 실수를 바로잡는 역할을 합니다. 연구진은 컴퓨터에 전달되는 텍ext 프롬프트를 세심하게 다듬고, 생성된 비디오의 특정 오류를 수정하기 위해 시각적 참조를 사용함으로써 결과를 크게 개선할 수 있다는 것을 발견했습니다. 이 기술을 위한 주요 국제 대회에서 그들의 시스템은 1위를 차지하며, 지시를 내리고 출력을 수리하는 이 방법이 인물의 정체성을 실제와 같이 유지하는 데 실용적이고 강력한 방법임을 입증했습니다.
그들 솔루션의 핵심은 비디오가 생성되기 전과 후에 일어나는 두 가지 뚜렷한 단계에 있습니다. 첫째, 연구팀은 인간이 프롬프트를 작성하는 방식이 매우 중요하다는 것을 깨달았지만, 비디오 생성기마다 선호하는 작성 스타일이 다르다는 점에 주목했습니다. 이를 처리하기 위해 그들은 경험으로부터 배우는 디지털 '플레이북(playbook)'을 만들었습니다. 이 플레이북은 비디오 생성기 제작자들이 제공하는 공식 지침, 즉 시스템이 명령을 받는 방식을 알려주는 지침에서 시작합니다. 그러나 연구진은 여기에 실제 사례로부터 학습하는 층을 더하여 한 단계 더 나아갔습니다. 그들은 시스템이 비디오를 생성하고, 오류를 점검하고, 그로부터 배운 내용을 플레이북에 업데이트하는 자동화된 루프를 설정했습니다. 만약 시스템이 비디오 생성기가 특정 유형의 움직임을 자주 누락하거나 객체를 명확하게 설명하지 못한다는 것을 감지하면, 플레이북은 이 실패 사례와 다음번을 위한 해결책을 기록합니다. 시간이 흐름에 따라 이 지식의 집합은 성장하며, 여러 객체와 상호작作用하거나 일련의 동작을 수행하는 것과 같은 복잡한 장면을 위한 더 나은 지침을 만드는 데 도움을 줍니다.
더 나은 지침이 있더라도, 비디오의 첫 번째 버전에는 여전히 텍스트만으로는 해결할 수 없는 작은 오류들이 포함될 수 있습니다. 컴퓨터는 "카메라를 바라보는 여성"이라는 단어는 이해할 수 있지만, 결과물에서는 그녀가 다른 곳을 보고 있거나, 써야 할 특정 모자와 같은 중요한 세부 사항을 놓칠 수 있습니다. 이를 해결하기 위해 연구진은 '시각적 의미론적 수리(visual semantic repair)'라고 불리는 두 번째 단계를 도입했습니다. 이 단계에서는 별도의 인공지능 시스템이 비평가 역할을 하며, 초안 비디오를 관찰하고 원래의 요청 사항과 비교합니다. 시스템이 누락된 객체나 미세하게 변해버린 얼굴과 같은 문제를 발견하면, 단순히 새로운 설명을 쓰는 데 그치지 않습니다. 대신, 비디오의 특정 프레임을 선택하여 정확히 무엇이 있어야 하는지를 보여주도록 편집합니다. 이 편집된 이미지는 구체적인 시각적 목표가 됩니다. 시스템은 이 수정된 이미지와 원래의 비디오, 그리고 새로운 지침 세트를 비디오 편집 도구에 입력합니다. 이 도구는 편집된 이미지를 가이드로 삼아 비디오의 특정 구간을 수정하여, 최종 결과물이 프롬프트의 시각적 의도와 일치하도록 보장합니다.
최상의 결과를 보장하기 위해 연구진은 단 한 번의 시도에 의존하지 않았습니다. 그들은 개선된 지침과 수리 기술의 다양한 조합을 사용하여 각 비디오의 여러 버전을 생성했습니다. 그런 다음 선택 전략을 사용하여 후보들을 비교하며, 비디오가 텍스트와 얼마나 잘 일치하는지, 얼굴의 일관성이 얼마나 유지되는지, 그리고 움직임의 전반적인 부드러움과 같은 요소들을 가중치로 두어 평가했습니다. 이 그룹 중에서 단 하나의 최선책을 선택함으로써, 그들은 최종 제품의 품질을 극대화했습니다. 얼굴 정체성 보존을 포함한 200개의 도전적인 사례를 대상으로 테스트했을 때, 그들의 시스템은 기존 방식들을 능가했습니다. 결과에 따르면, 이 접근 방식은 피사체의 얼굴이 변하거나 주요 시각적 요소가 사라지는 오류를 성공적으로 줄였습니다. 팀의 성공은 MIPL_Video라는 이름의 시스템이 ACM MM 2026 Identity-Preserving Video Generation Challenge의 페이셜 아이덴티티 트랙에서 1위를 차지하며 확인되었습니다.
이 연구는 가장 강력한 도구들이 직접적인 수정이 불가능하도록 닫혀 있을 때조차도, 그것들을 더 나은 결과로 이끌 수 있는 효과적인 방법이 존재함을 보여줍니다. 지침을 개선하는 학습 시스템과 특정 실수를 고치는 시각적 편집기를 결합함으로써, 연구진은 가볍고 매우 효과적인 워크플로우를 만들어냈습니다. 그들의 연구 결과는 고품질의 정체성 보존 비디오 생성이 더 크고 복잡한 모델을 구축하는 것에 달려 있는 것이 아니라, 우리가 이미 가지고 있는 모델과 상호작용하는 더 똑똑한 방법을 개발하는 것에 달려 있을 수 있음을 시사합니다. 인물의 닮은 모습을 유지하면서 복잡하고 역동적인 이야기를 따라가는 능력은 스토리텔링과 콘텐츠 제작에 새로운 가능성을 열어주며, 세심한 준비와 표적화된 수정이 순수한 생성만으로는 달성할 수 없는 결과를 낼 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.