← 최신 논문
💻 computer science

ASemConsist: Adaptive Semantic Feature Control for Training-Free Identity-Consistent Generation

ASemConsist는 텍스트 임베딩을 선택적으로 수정하고 적응형 특징 공유를 채택함으로써 정체성 보존과 이미지별 프롬프트 정렬 사이의 절충 문제를 해결하여, 다양한 장면에서 고충실도의 정체성 일관성을 갖춘 이미지 생성을 달성하는 학습이 필요 없는 프레임워크이다.

원저자: Shin Seong Kim, Minjung Shin, Hyunin Cho, Youngjung Uh

게시일 2026-08-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shin Seong Kim, Minjung Shin, Hyunin Cho, Youngjung Uh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사진으로 이야기를 전달한다고 상상해 보십시오. 여기서 주인공은 배경이 비 내리는 거리에서 햇살 가득한 공원으로 바뀌더라도 모든 프레임에서 반드시 똑같이 생겨야 합니다. 이것이 바로 인공지능 분야에서 커지고 있는 과제인 '일관된 캐릭터 생성'의 핵심입니다. 수년 동안 가장 진보된 이미지 생성 도구들은 단순한 텍스트 설명으로부터 멋진 시각 자료를 만들어낼 수 있었습니다. 하지만 동일한 인물이나 동물이 등장하는 일련의 이미지를 생성해 달라는 요청을 받으면, 이 도구들은 종-종 어려움을 겪습니다. 캐릭터의 머리카락 색이 변하거나, 특징적인 흉터가 사라지거나, 한 사진에서 다음 사진으로 넘어갈 때 얼굴 구조가 바뀌기도 합니다. 이러한 불일치는 연속적인 이야기의 환상을 깨뜨려, 애니메이션, 만화 또는 상호작용형 서사에 이 도구들을 사용하는 것을 어렵게 만듭니다.

핵심적인 어려움은 인공지능 모델이 언어를 이해하는 방식에 있습니다. 사용자가 "짧은 털을 가진 작은 개"와 같이 특정 캐릭터를 요청하면, 컴퓨터는 이 문장을 복잡한 수학적 표현으로 변환합니다. 문제는 컴퓨터가 이 캐릭터 설명과 "물웅덩이를 뛰어넘는" 것과 같은 새로운 장면 설명을 결합하려고 할 때 발생합니다. 기존의 많은 시스템에서는 캐릭터에 대한 지침과 장면에 대한 지침이 서로 뒤엉키게 됩니다. 컴퓨터는 개의 정체성을 정의하는 부분과 물웅덩이를 뛰는 동작을 정의하는 부분을 쉽게 분리하지 못합니다. 결과적으로, 컴퓨터가 다음 이미지를 그리려고 할 때 새로운 장면 지침을 따르려다 실수로 개의 특징을 바꾸어 버리거나, 혹은 개의 모습을 유지하기 위해 새로운 장면 지침을 무시해 버리곤 합니다.

연세대학교의 연구진은 기존의 인공지능 모델을 다시 학습시킬 필요 없이 이 특정 문제를 해결하는 'AsemConsist'라는 새로운 방법을 개발했습니다. 이들의 접근 방식은 컴퓨터에게 새로운 그리기 방식을 강요하는 대신, 컴퓨터가 그림을 그리기 시작하기 전에 지침을 세심하게 조정하는 숙련된 편집자처럼 작동합니다. 연구진은 텍스트를 나타내는 수학적 코드들이 고정된 정보 블록이 아니라 여러 가지 층(layer) 또는 구성 요소로 이루어져 있다는 것을 발견했습니다. 어떤 층은 캐릭터의 정체성을 정의하는 데 도움을 주는 반면, 다른 층은 장면을 묘사하거나 캐릭터의 외형과 모순되는 정보를 담고 있습니다. 이전의 방법들은 지침 블록 전체를 한꺼번에 조정하려고 시도했기 때문에, 캐릭터의 정체성을 잃거나 장면 설명을 따르지 못하는 문제가 발생하곤 했습니다.

연구진의 해결책은 이미지가 생성될 때마다 자동으로 수행되는 3단계 과정을 포함합니다. 첫째, 지침을 개별 구성 요소로 분리합니다. 그들은 어떤 코드가 캐릭터의 일관성을 유지하는 데 필수적인지, 그리고 어떤 코드가 특정 장면을 묘사하는 데 필요한지를 식별합니다. 그런 다음 캐릭터의 정체성을 뒷받합하는 부분을 증폭시키는 동시에 장면을 묘사하는 부분을 강화하여, 두 요소 모두 강력하고 명확하게 만듭니다. 둘째, 그들은 보통 무시되는 컴퓨터 메모리 내의 '패딩(padding)'이라 불리는 숨겨진 공간을 찾아냈습니다. 그들은 이 공간이 캐릭터의 정체성을 방해하지 않으면서 장면의 세부 사항을 담을 수 있는 컨테이너로 사용될 수 있다는 것을 깨달았습니다. 장면의 세부 사항을 이 컨테이너에 기록함으로써, 장면 설명이 캐릭터의 특징을 덮어쓰는 것을 방지합니다.

마지막으로, 시스템은 언제 추가적인 도움을 적용할지 결정합니다. 만약 사용자가 "곱슬거리는 금발에 파란 눈을 가진 16세 소녀"와 같이 매우 상세한 캐릭터 설명을 제공한다면, 컴퓨터는 대개 스스로 그녀의 모습을 일정하게 유지할 수 있습니다. 하지만 "한 남자"와 같이 설명이 모호하다면, 컴퓨터는 캐릭터가 표류하는 것을 막기 위해 더 강력한 닻이 필요합니다. 이 새로운 방식은 설명이 얼마나 모호한지를 자동으로 감지하고, 필요할 때만 추가적인 제약을 적용합니다. 이는 시스템이 필요 이상으로 경직되지 않도록 하여, 캐릭터의 인지 가능성은 유지하면서도 포즈나 배경에서 더 자연스러운 다양성을 허용합니다.

연구진은 이들의 성과를 테스트하기 위해, 캐릭터의 일관성과 장면의 묘사 능력을 별도로 판단하는 것이 아니라 두 가지를 모두 고려하는 새로운 성공 측정 방식을 만들었습니다. 그들은 이 방식이 현재 가장 강력한 이미지 생성 모델 두 가지에서 기존의 최첨단 도구들보다 훨씬 더 뛰어나게 작동한다는 것을 발견했습니다. 테스트 결과, 이 새로운 접근 방식은 다양한 장면 속에서도 캐릭터의 정체성을 유지하면서 각 이미지에 대한 구체적인 지침을 정확하게 따랐으며, 이는 이전의 방법들이 어려워했던 균형 잡힌 결과였습니다. 이 결과는 컴퓨터가 언어를 처리하는 내부 구조를 이해함으로써, 완전히 새로운 시스템을 구축하지 않고도 더 일관된 시각적 이야기를 생성하도록 유도할 수 있음을 시사합니다. 이러한 발전은 인공지능이 영화, 게임, 디지털 스토리텔링에 필요한 시각적 서사를 안정적으로 생성할 수 있는 미래에 한 걸음 더 다가가게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →