← 최신 논문
🤖 machine learning

Mitigating Diffusion Model Hallucinations with Dynamic Guidance

이 논문은 아티팩트가 발생하기 쉬운 방향을 따라 스코어 함수를 선택적으로 날카롭게 다듬으면서도 유효한 의미적 변이를 보존함으로써 디퓨전 모델의 환각 현상을 완화하는 새로운 생성 시간 기반 접근 방식인 Dynamic Guidance를 소개하며, 이를 통해 제어된 데이터셋과 자연 이미지 데이터셋 모두에서 기존 베이스라인들을 능가하는 성능을 보여준다.

원저자: Kostas Triaridis, Alexandros Graikos, Aggelina Chatziagapi, Grigorios G. Chrysos, Dimitris Samaras

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kostas Triaridis, Alexandros Graikos, Aggelina Chatziagapi, Grigorios G. Chrysos, Dimitris Samaras

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 재능 있지만 약간 혼란스러워하는 화가에게 그림 그리는 법을 가르치려 한다고 상상해 보세요. 이 화가는 '확산 모델(Diffusion Model)'이며, 아름다운 그림을 만들어내는 데는 뛰어나지만, 가끔 의도와는 다른 방향으로 너무 창의력을 발휘하곤 합니다. 손가락을 여섯 개 그리거나, 꼬리 없는 고양이를 그리거나, 다리가 세 개 달린 말을 그리는 식이죠. AI의 세계에서는 이러한 실수를 **"환각(hallucinations)"**이라고 부릅니다.

이 논문에 따르면, 화가가 이런 실수를 하는 이유는 너무 매끄럽게 그리려고 하기 때문입니다. 화가가 학습할 때, "개"의 사진과 "고양이"의 사진을 보게 됩니다. 이때 두 이미지를 별개의 뚜렷한 개념으로 유지하는 대신, 이를 흐릿한 중간 지점으로 섞어버리려 합니다. 때때로 이 흐릿한 중간 지점은 자연계에 존재하지 않는 기괴한 생명체로 변하게 됩니다.

스토니 브룩 대학교(Stony Brook University)와 위스콘신 대학교 매디슨(University of Wisconsin-Madison)의 저자들은 이를 해결하기 위해 **"동적 가이드(Dynamic Guidance)"**라고 불리는 새로운 기술을 제안합니다. 이 기술이 어떻게 작동하는지 쉬운 비유를 통해 설명해 보겠습니다.

문제점: "흐릿한 중간 지대(The Fuzzy Middle)"

화가의 마음을 "개"라는 높은 산과 "고양이"라는 높은 산이 있는 풍경이라고 생각해 보세요. 두 산 사이의 길은 매끄럽고 평평한 골짜기입니다.

  • 기존 방식: 화가가 무언가를 그리려 할 때, 가끔 이 평평한 골짜기에 갇히곤 합니다. 경로가 너무 매끄럽기 때문에 화가는 어느 방향으로 가야 할지 몰라 결국 개와 고양이를 이상하게 섞은 것을 그리게 됩니다. 이것이 바로 "환각"입니다.
  • 표준적인 해결책: 보통 사람들은 화가에게 "개를 그려!"라고 말합니다(이를 *분류기 가이드(Classifier Guidance)*라고 합니다). 하지만 만약 화가가 처음에 고양이에 더 가까운 무작위 스케치로 시작했는데 억지로 개를 그리라고 강요하면, 화가는 혼란을 느껴 개에게 고양이 꼬리를 붙이는 것과 같은 실수를 저지를 수 있습니다.

해결책: 동적 가이드 (The "Smart Navigator")

저자들은 더 똑똑한 접근 방식을 제안합니다. 처음부터 하나의 목적지(예: "개")를 정하고 무조건 그것만 고집하는 대신, 화가에게 그림이 생성되는 모든 단계마다 지도를 확인하는 **"스마트 내비게이터(Smart Navigator)"**를 제공하는 것입니다.

  1. 현재 상태 확인: 그림이 형성되는 매 아주 작은 순간마다, 내비게이터는 묻습니다. "지금까지 그려진 것을 보니, 이것이 개에 더 가깝습니까, 아니면 고양이에 더 가깝습니까?"
  2. 경로 조정: 현재 스케치가 "개" 쪽으로 기울어져 있다면, 내비게이터는 "개"라는 산을 향한 경로를 더 뚜렷하게 만듭니다. 만약 "고양이" 쪽으로 기울어져 있다면, "고고양이"를 향한 경로를 더 뚜렷하게 만듭니다.
  3. 흐릿한 골짜기 피하기: 목표를 끊임없이 조정함으로써, 화가는 결코 그 매끄럽고 혼란스러운 골짜기에 갇히지 않습니다. 화가는 반드시 실제적이고 유효한 형태를 향해 결단력 있는 발걸음을 내딛게 됩니다.

왜 특별한가?

이 논문은 이 방법의 세 가지 핵심 사항을 강조합니다.

  • 선택적임: 화가가 손을 그리고 있다고 상상해 보세요. 내비게이터는 피부의 색상을 바꾸는 것은 좋은, 유효한 변화(다양성)라는 것을 알지만, 손가락의 개수를 바꾸는 것은 나쁜 변화(환형)라는 것을 알고 있습니다. 동적 가이드는 "손가락 개수" 방향은 날카롭게 다듬으면서도, "피부 색상" 방향은 매끄럽고 다양하게 유지하여 나쁜 것은 고치되 좋은 것은 망치지 않습니다.
  • 그리는 도중에 일어남: 대부분의 다른 방법은 그림이 완성된 에 문제를 해결하려고 합니다(마치 나쁜 그림을 삭제하는 필터처럼). 하지만 이 방법은 그림이 그려지는 도중에 문제를 해결합니다. 이는 마치 경주가 끝난 후에 잘못 달렸다고 말하는 것이 아니라, 경주 중에 선수의 자세를 교정해 주는 코치와 같습니다.
  • 언어와 함께 작동함: 저자들은 이 방법을 텍스트-이미지 모델(예: "들판에 있는 말"이라고 입력하는 경우)에 테스트했습니다. 때때로 컴퓨터는 말이 서 있는 방식에 대해 혼란을 겪을 수 있습니다. 동적 가이드 시스템은 반쯤 완성된 말을 보고, 포즈가 모호하다는 것을 깨달은 뒤, 해부학적 구조가 말이 되도록 "질주하는 말" 또는 "누워 있는 말"과 같이 지침을 미묘하게 조정할 수 있습니다.

결과

논문은 다음 사항들에 대해 이 방법을 테스트했습니다.

  • 단순한 도형: 삼각형이나 사각형을 그리라고 했을 때, 이 방법은 AI가 두 도형을 이상하게 섞어서 그리는 것을 막아주었습니다.
  • 실제 이미지: 120만 장의 이미지로 구성된 방대한 데이터셋(ImageNet)에서, 이 방법은 더 현실적인 이미지를 생성했으며 "불가능한" 특징들을 줄였습니다.
  • 인간의 피드백: 사람들이 이 새로운 방법으로 생성된 그림을 보았을 때, 실수(예: 동물의 다리가 추가로 생기는 현상 등)가 더 적었으며 기존 방식보다 새로운 그림을 더 선호한다는 점에 동의했습니다.

요약하자면, **동적 가이드(Dynamic Guidance)**는 AI 화가에게 환각이 존재하는 오프로드 함정을 피해 실제의 길 위에 머물 수 있도록 끊임없이 경로를 재계산하는 GPS를 제공하는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →