← 최신 논문
💻 computer science

Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation

본 논문은 부정 프롬프트 주의 특징을 긍정 프롬프트 특징에 대해 직교화함으로써 원치 않는 개념을 억제하는 훈련 없는 텍스트-이미지 생성 방법인 직교 부정 안내를 제안하며, 이를 통해 이미지 품질과 프롬프트 정합성을 유지하면서 우수한 개념 제거를 달성합니다.

원저자: Jungmin Ko, Jungwon Park, Jimyeong Kim, Changin Choi, Wonseok Lee, Wonjong Rhee

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jungmin Ko, Jungwon Park, Jimyeong Kim, Changin Choi, Wonseok Lee, Wonjong Rhee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 레시피 (텍스트 프롬프트) 를 기반으로 요리를 만드는 천재 셰프 (AI) 라고 상상해 보세요. 당신은 '라면 한 그릇'을 맛있게 보이게 만들 수 있지만, 문제는 라면을 만들 때마다 고객이 요청하지 않았음에도 불구하고 자동으로 삶은 계란을 추가한다는 점입니다.

만약 단순히 셰프에게 "계란은 넣지 마세요!" (부정 프롬프트) 라고 말한다면, 셰프는 혼란을 느껴 실수로 계란을 더 많이 넣거나, 계란을 피하려다 전체 요리를 망칠 수도 있습니다. 이것이 현재 AI 이미지 생성기들이 겪고 있는 어려움입니다: 무엇을 포함하지 말아야 하는지 지시하는 것이 놀라울 정도로 어렵다는 것입니다.

이 논문은 직교 부정 안내 (Orthogonal Negative Guidance) 라는 새롭고 영리한 기법을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명하겠습니다.

1. 문제: '부족한 지우개'

'라면'에서 '계란'처럼 원하지 않는 것을 제거하는 현재의 방법들은 그림 위에 거대하고 투박한 지우개를 사용하는 것과 같습니다.

  • "프롬프트 부정 (Prompt Negation)" 접근법: 단순히 "계란은 안 돼"라고 말합니다. AI 는 종종 이를 무시하거나 혼란을 겪습니다.
  • "뺄셈 (Subtraction)" 접근법: 일부 방법은 '계란'이라는 개념을 '라면'이라는 개념에서 빼려고 시도합니다. 하지만 '계란'과 '라면'이 같은 잉크로 쓰여 있다고 상상해 보세요. '계란'이라는 단어를 지우려다 실수로 '라면'이라는 단어의 일부까지 지워져 흐릿하고 깨진 그림만 남을 수 있습니다.

2. 해결책: '스마트 필터' (직교 부정 안내)

저자들은 맹목적으로 지우는 대신, AI 가 이미지를 구축하는 데 사용하는 '재료' (수학적 특징) 를 살펴보는 스마트 필터전문 체처럼 작동하는 방법을 제안합니다.

  • 설정: AI 는 두 가지 정보 흐름을 사용하여 이미지를 구축합니다.

    1. 긍정적 흐름: "라면 한 그릇을 만들어 주세요."
    2. 부정적 흐름: "계란은 만들지 마세요."
  • 마법 같은 트릭 (직교화):
    '라면' 흐름을 특정 방향을 가리키는 벡터 (화살) 라고 상상해 보세요. '계란 금지' 흐름은 또 다른 화살입니다.

    • 때로는 '계란 금지' 화살이 '라면' 화살과 겹치는 방향을 가리킵니다. 단순히 '계란 금지' 화살을 빼면 '라면'이 망가집니다.
    • 이 새로운 방법은 '계란 금지' 화살을 계산한 후, '라면' 화살과 완벽하게 수직 (90 도 각도) 이 되도록 회전시킵니다.
    • 그런 다음 '라면'과 겹치지 않는 부분, 즉 '계란 금지' 화살이 옆으로 튀어나온 부분 만을 제거합니다.

비유: '라면'을 붉은 빛 빔으로, '계란'을 파란 빛 빔으로 생각하세요. 두 빛이 같은 벽에 비치고 있습니다.

  • 기존 방법들은 파란 빛을 끄려고 시도하지만, 그렇게 하는 과정에서 붉은 빛도 어둡게 만들어 버립니다.
  • 이 새로운 방법은 붉은 빛에 비추지 않는 파란 빛의 부분만을 찾아내어 그 특정 부분만 차단합니다. 붉은 빛 (라면) 은 밝고 선명하게 유지되는 반면, 파란 빛 (계란) 은 완전히 차단됩니다.

3. 달성하는 효과

이 방법은 매우 정밀하기 때문에 다른 방법들로는 불가능한 일들을 해낼 수 있습니다:

  • 다중 개념 억제: AI 에게 '계란'과 '젓가락'을 동시에 제거하라고 지시할 수 있으며, 이는 라면 한 그릇을 망치지 않고 둘 다 처리합니다.
  • 조정 가능한 강도: 계란을 얼마나 억제할지 결정하는 '다이얼'을 조절할 수 있습니다. "아마도 계란이 없을 것"에서 "분명히 계란이 없을 것"까지 이미지 품질이 망가지지 않고 조절할 수 있습니다.
  • 재학습 불필요: 가장 좋은 점은 AI 를 다시 가르칠 필요가 없다는 것입니다. 이는 이미지가 생성되는 동안 적용되는 '플러그 앤 플레이' 트릭입니다.

4. 결과

저자들은 DCS-Bench(다양한 개념 억제 벤치마크) 라는 벤치마크에서 이 방법을 테스트했는데, 이는 '청진기 없는 의사'나 '소파 없는 거실'과 같이 200 가지 다른 시나리오를 포함하는 시험과 같습니다.

  • 점수: 인간 평가에서 사람들은 이 새로운 방법을 다음으로 가장 좋은 방법보다 거의 19% 더 선호했습니다.
  • 품질: 이미지들이 흐릿하거나 기괴해지지 않았습니다. '라면'은 여전히 라면처럼 보였으며, 단지 원하지 않는 '계란'만 제거된 상태였습니다.

요약

간단히 말해, 이 논문은 나쁜 아이디어와 좋은 아이디어가 섞이기 전에 수학적 트릭을 사용하여 이를 분리함으로써 "AI 에게 무엇을 그리지 말아야 하는지" 말하는 문제를 해결합니다. 이는 클럽의 문지기처럼, VIP(라면) 를 실수로 내보내지 않으면서 원치 않는 손님 (계란) 의 입장을 정확히 막아내는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →