← 최신 논문
🤖 AI

When Few Steps Are Enough: Training-Free Acceleration of Identity-Preserved Generation

본 논문은 표준 28 단계 FLUX.dev 백본을 증류된 FLUX.schnell 버전으로 교체하되, 고정된 InfuseNet 신원 어댑터를 유지하고 분류기 없는 가이드를 비활성화할 경우 5.9 배의 지연 시간 감소와 함께 향상된 신원 충실도 및 시각적 품질을 달성하며, 신원 보존이 실제로 첫 번째 4~8 단계의 노이즈 제거 과정에서 확립됨을 보여준다.

원저자: Dongqi Zheng

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dongqi Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

특정 인물의 얼굴을 그림으로 재현하려는 마스터 셰프가 되어본다고 상상해 보세요. 전통적으로 얼굴이 정확히 보이게 하려면 몇 시간 (또는 컴퓨터 세계에서는 28 단계) 을 들여 세부 사항, 명암, 질감을 층층이 정성스럽게 추가해야 했습니다. 더 많은 시간을 투자할수록 그 사람의 정체성이 더 잘 드러날 것이라는 가정이 있었기 때문입니다.

이 논문은 그 모든 시간을 투자할 필요가 없다고 주장합니다. 사실, 단순히 그 사람을 알아볼 수 있게 만드는 것이 유일한 목표라면, 그 많은 시간을 보내는 것은 노력 낭비일 수 있습니다.

그들이 발견한 내용을 간단한 비유로 정리해 보겠습니다:

1. "빨리 감기" 레시피

연구진은 28 단계를 거쳐 이미지를 생성하는 매우 인기 있고 고품질의 AI 모델 (FLUX.1-dev) 을 사용했습니다. 그들은 한 사람의 얼굴이 그 사람처럼 보이게 하는 마법 같은 순간은 매우 일찍 일어난다는 것을 발견했습니다. 보통 4 단계에서 8 단계 사이입니다.

케이크를 굽는 것처럼 생각해보세요:

  • 1~4 단계: 반죽을 섞고 오븐에 넣습니다. 케이크가 기본적인 모양을 잡습니다. 이미 케이크입니다.
  • 5~28 단계: 이제 아이싱을 바르고, 스프링클을 뿌리고, 가장자리를 완벽하게 매끄럽게 다듬는 과정입니다.

논문의 말에 따르면: "케이크가 어떤 종류인지 (정체성) 만 알고 싶다면 완벽한 아이싱이 필요 없습니다. 4 단계에서 멈추면 됩니다."

2. "플러그 앤 플레이" 스위치

보통 더 빠른, '증류된' 버전의 모델 (FLUX.1-schnell, 4 단계만으로 완료하도록 설계됨) 로 전환하면, 작동하게 하려면 전체 시스템을 다시 훈련시켜야 합니다. 마치 새로운 자동차 엔진을 사서 이를 맞추기 위해 전체 차체를 다시 재건해야 하는 것과 같습니다.

저자들은 놀라운 사실을 발견했습니다: 아무것도 다시 재건할 필요가 없습니다.

  • '정체성 어댑터'(사람의 얼굴을 기억하는 소프트웨어 부분) 를 그대로 두었습니다.
  • 단순히 느린 28 단계 버전의 메인 엔진을 빠른 4 단계 버전으로 교체했습니다.
  • 빠른 버전이 필요로 하지 않는 하나의 특정 설정 ('클래스프리 가이드') 을 끄기만 했습니다.

결과: 코드에서 두 줄만 변경하면 되었습니다. 재훈련도, 새로운 데이터도, 추가 비용도 없었습니다.

3. 놀라운 결과: 더 빠르고 더 좋음

일찍 멈추면 얼굴이 흐릿해지거나 그 사람처럼 보이지 않을 것이라고 생각할 수 있습니다. 하지만 정반대가 일어났습니다.

  • 속도: 과정이 5.9 배 빨라졌습니다 (이미지당 약 10 초에서 2 초 미만으로 단축).
  • 품질: 얼굴은 실제로 원래 사람과 닮았으며 (더 높은 정체성 유사도), 느린 버전보다 시각적 아티팩트가 적어 이미지 품질 점수가 더 높았습니다.

왜 그럴까요? 느린 버전은 '아이싱'(선명도, 대비, 배경 세부 사항) 에 너무 많은 시간을 보내다가, 때로는 우연히 '케이크 모양'(정체성) 을 약간 망쳐버리기 때문입니다. 빠른 버전은 정체성이 여전히 완벽하고 신선할 때 멈춥니다.

4. 왜 이것이 작동할까요? (작동 원리)

연구진은 AI 가 각 단계에서 무엇을 하는지 살펴보기 위해 내부 구조를 들여다보았습니다:

  • 초기 단계: AI 는 얼굴의 '골격'과 구체적인 정체성을 빠르게 파악합니다. 이것이 완료되면 정체성은 '고정'됩니다.
  • 후기 단계: AI 는 정체성에 관심을 두지 않고 피부가 반짝이게, 배경이 선명하게, 조명이 극적으로 보이도록 만드는 데만 집중합니다.
  • 통찰: 정체성 보존을 위해 '후기 단계'는 이미 완벽하게 다듬어진 돌을 광내는 것에 불과합니다.

5. 이것이 모든 곳에서 작동할까요?

이 논문은 스타일과 객체를 위한 다른 유형의 AI 어댑터에서도 이를 테스트하여 유사한 패턴을 발견했습니다: 종종 결과의 95% 를 단계의前半에서 얻으며, 후반의 단계는 아주 미세한 개선만 가져옵니다.

결론

이 논문은 특정 인물의 이미지를 생성하는 데 있어 적은 것이 종종 더 많다는 것을 증명합니다. 더 빠른 모델로 전환하고 일찍 멈춤으로써, 엄청난 시간과 컴퓨팅 파워를 절약하면서도 사람의 얼굴을 알아볼 수 있게 유지한다는 특정 목표에 대해서는 실제로 더 나은 결과를 얻습니다. 이는 '훈련 불필요' 트릭으로, AI 에게 새로운 것을 가르칠 필요가 없다는 뜻입니다. 단지 일을 더 일찍 끝내게 하면 될 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →