← 최신 논문
💻 computer science

HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models

이 논문은 전역 주의력 조절 (GAR) 과 국소 주의력 이식 (LAT) 을 포함한 이질적 주의력 변조 (HAM) 기법을 도입하여 학습 없이도 콘텐츠의 정체성을 유지하면서 복잡한 스타일 참조를 효과적으로 전달하는 새로운 스타일 전이 방법을 제안합니다.

원저자: Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan

게시일 2026-03-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"HAM"**이라는 새로운 기술을 소개합니다. 이 기술은 인공지능이 그림을 그릴 때, 원래 그림의 얼굴 (정체성) 은 그대로 유지하면서, 원하는 화풍 (스타일) 만 완벽하게 입히는 방법을 개발한 것입니다.

기존의 방법들은 "스타일을 입히면 얼굴이 망가진다"거나 "얼굴을 지키면 스타일이 안 들어간다"는 딜레마에 빠졌는데, HAM 은 이 두 마리 토끼를 모두 잡았습니다.

이 복잡한 기술을 일상적인 비유로 쉽게 설명해 드릴게요.


🎨 HAM: 인공지능 화가의 '마법 가위'와 '접착제'

생각해 보세요. 당신이 좋아하는 친구의 초상화 (내용물) 가 있습니다. 그런데 이 친구를 반 고흐의 <별이 빛나는 밤> 스타일 (스타일) 로 그려달라고 요청했습니다.

기존의 인공지능들은 이 작업을 할 때 두 가지 실수를 자주 했습니다:

  1. 스타일만 강조: 친구의 얼굴이 반 고흐의 붓터치에 묻혀서 누구인지 알 수 없게 됨.
  2. 얼굴만 강조: 스타일은 전혀 반영되지 않고 그냥 친구 사진만 색칠됨.

HAM은 이 문제를 해결하기 위해 세 가지 단계로 이루어진 마법 같은 과정을 사용합니다.

1. 시작할 때: "혼합된 점토" (스타일 주입 노이즈 초기화)

그림을 그릴 때, AI 는 처음에 잡음 (노이즈) 상태에서 시작합니다. 보통은 친구 사진의 잡음만 쓰거나, 반 고흐 그림의 잡음만 썼는데, HAM 은 이 두 가지를 적당히 섞어서 시작합니다.

  • 비유: 마치 친구의 얼굴 모양을 가진 점토에 반 고흐의 색깔이 스며들게 만든 혼합 점토를 준비하는 것과 같습니다. 이렇게 시작하면 나중에 그림이 완성될 때, 친구의 얼굴이 흐트러지지 않으면서도 반 고흐의 분위기가 자연스럽게 배어듭니다.

2. 전체적인 조절: "거시적인 스타일 코디네이터" (전역 주의 조절, GAR)

그림을 그리는 과정에서 AI 는 그림의 전체적인 구조를 파악합니다. HAM 은 이때 **전체적인 분위기 (스타일)**를 반 고흐의 그림에서 가져와서 적용하되, **친구의 얼굴 위치와 형태 (내용)**는 절대 건드리지 못하게 막습니다.

  • 비유: 이는 마치 **화장실의 조명과 벽지 (스타일)**를 반 고흐 스타일로 바꾸되, **거울에 비친 내 얼굴 (내용)**은 그대로 유지하는 것과 같습니다. HAM 은 "전체적인 분위기는 바꿔줘도, 내 얼굴은 절대 왜곡하지 마!"라고 AI 에게 지시하는 거대한 지휘자 역할을 합니다.

3. 세부적인 수정: "정밀한 스타일 이식" (국부 주의 이식, LAT)

이제 가장 중요한 부분입니다. 전체적인 분위기는 잡았으니, 세부적인 붓터치나 질감을 어떻게 옮길까요? 기존 방법은 그림 전체를 뒤적거렸는데, HAM 은 **질문 (Query)**과 **답 (Key/Value)**을 분리해서 다룹니다.

  • 비유: 이는 **친구의 얼굴 특징 (질문)**은 그대로 유지하면서, **반 고흐의 붓터치와 색감 (답)**만 가져와서 붙이는 정밀한 이식 수술과 같습니다.
    • "누구인지 (질문)"는 친구에게서 가져옵니다.
    • "어떻게 그릴지 (답)"는 반 고흐에게서 가져옵니다.
    • 이렇게 하면 친구의 얼굴이 망가지지 않으면서, 반 고흐의 독특한 붓터치가 그대로 적용됩니다.

🌟 왜 이 기술이 특별한가요?

기존의 방법들은 **"스타일과 내용 중 하나를 희생해야 한다"**는 함정에 빠졌습니다. 하지만 HAM 은 학습 (Training) 없이도 이 균형을 완벽하게 잡습니다.

  • 학습이 필요 없어요: 새로운 스타일이 나오면 다시 AI 를 가르칠 필요가 없습니다. 이미-trained 된 모델을 그대로 쓰면 됩니다. (마치 새로운 옷을 입히기 위해 인형을 다시 조립할 필요 없이, 옷만 갈아입히는 것과 같습니다.)
  • 얼굴이 살아있습니다: 친구의 표정, 눈, 코, 입이 스타일 변환 후에도 선명하게 유지됩니다.
  • 스타일도 완벽합니다: 반 고흐, 피카소, 만화 스타일 등 어떤 스타일이라도 친구의 얼굴에 자연스럽게 녹아듭니다.

💡 결론

이 논문의 HAM 기술은 **"내 얼굴은 그대로, 내 옷은 내가 원하는 스타일로"**라는 소박한 소원을 인공지능이 실현하게 해주는 마법의 거울과 같습니다. 복잡한 수학적 공식 뒤에는, 우리가 원하는 그림을 더 쉽고 정확하게 만들어주는 따뜻한 기술이 숨어 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →