← 최신 논문
🤖 AI

FARI: Robust One-Step Inversion for Watermarking in Diffusion Models

FARI는 역전 궤적의 낮은 곡률과 적대적 LoRA 미세 조정을 활용하여, 기존의 고단계 역전 방식에 비해 확산 모델에서 현저히 더 빠르고 견고한 워터마크 검증을 달성하는 강력한 일단계 역전 프레임워크입니다.

원저자: Jindong Yang, Han Fang, Weiming Zhang, Nenghai Yu, Kejiang Chen

게시일 2026-07-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jindong Yang, Han Fang, Weiming Zhang, Nenghai Yu, Kejiang Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 당신이 입력한 한 문장을 읽는 것만으로 그림을 그리고, 노래를 쓰고, 영화를 설계할 수 있는 세상을 상상해 보십시오. 이것은 "디퓨전 모델(diffusion models)"이라는 일종의 인공지능이 부리는 마법입니다. 이 모델은 혼란스러운 정적 노이즈 구름에서 시작하여, 단계별로 천천히 이를 정돈하여 선명한 이미지가 나타나게 합니다. 이것은 마치 조각가가 대리석 블록을 깎아내는 것과 비슷하지만, 그 반대 과정입니다. AI는 무작위 노이즈 블록에서 시작하여 그 "노이즈"를 깎아내어 완벽한 조각상을 드러냅니다. 이 기계들이 예술을 만드는 데 매우 뛰어나기 때문에, "이 그림이 인간이 만든 것인지 아니면 로봇이 만든 것인지 어떻게 알 수 있을까?"라는 우려가 커지고 있습니다. 이를 해결하기 위해 과학자들은 디지털 "워터마크"를 개발했습니다. 이것은 마치 조각가가 작업을 시작하기도 전에, 첫 번째 모래알(초기 노이즈) 속에 비밀 코드를 숨겨두는 것과 같습니다. 만약 당신이 그 조각상이 당신의 것이라는 것을 증명하고 싶다면, 완성된 조각상을 다시 원래의 모래알로 되돌리는 역과정을 거쳐 코드를 읽어내야 합니다.

문제는 이 과정을 되돌리는 것이 매우 어렵고 느리다는 점입니다. 이것은 마치 케이크를 다시 반죽으로 되돌리거나 스무디를 다시 재료 상태로 되돌리려는 것과 같습니다. 과정을 되돌리는 단계가 많아질수록, 실수하거나 재료를 쏟을 가능성이 높아집니다. 만약 케이크가 봉지에 눌려 찌그러졌다면(JPEG 압축이나 크롭으로 인해 왜곡되었다면), 그것을 다시 '역으로 굽는' 작업은 악몽이 됩니다. 기존 방식들은 매우 정밀하게 작동하려고 노력하며, 과정을 되돌리기 위해 수백 개의 미세한 단계를 거치지만, 이는 시간이 너무 오래 걸릴 뿐만 아니라 이미지가 손상되었을 때는 여전히 실패합니다. 이 논문은 이 "역으로 굽는" 과정을 수행하는 새로운 방법을 소개하는데, 이 방법은 매우 빠를 뿐만 아니라 놀라울 정도로 손상에 강합니다.

이 연구의 저자인 양진동(Jindong Yang)과 그의 팀은 AI가 걷는 경로에 대해 이상한 점을 발견했습니다. AI가 이미지를 생성할 때, 그것은 마치 안개가 자욱한 숲속을 헤매며 장애물을 피하기 위해 끊임없이 방향을 바꾸는 등산객과 같아서, 경로는 구불구불하고 예측 불가능합니다. 하지만 원래의 노이즈를 찾기 위해 과정을 되돌릴 때, 그 경로는 잘 닦인 고속도로를 달리는 등산객처럼 훨씬 더 직선적입니다. 이 "역방향 경로"는 매우 직선적이기 때문에, 수백 단계를 거칠 필요 없이 단번에 목적지에 도달할 수 있습니다.

팀은 이 새로운 방법을 FARI(Fast Asymmetric Robust Inversion)라고 부릅니다. 기존 방식들이 이미지를 되돌리기 위해 50단계의 느리고 신중한 과정을 사용하는 대신, FARI는 단 한 번의 단계만으로 이를 수행합니다. 이것은 집의 모든 방을 하나하나 다시 지나서 현관문으로 돌아갈 필요 없이, 그냥 창문으로 뛰어내려 현관에 착지할 수 있다는 사실을 깨닫는 것과 같습니다. 하지만 여기서 영리한 점은, 이 도약이 매우 빠르기 때문에 컴퓨터가 지저도 있고 손상된 이미지를 훨씬 더 잘 다루는 법을 "학습"할 수 있다는 것입니다. 그들은 단 하나의 강력한 그래픽 카드(NVIDIA RTX A6000)에서 약 20분 동안 시스템을 훈련시켜, 이미지가 찌그러지거나 흐릿해지거나 잘려 있더라도 이 한 번의 도약을 아주 잘 수행할 수 있도록 만들었습니다.

결과는 인상적입니다. 테스트에서 FARI는 손상된 이미지로부터 숨겨진 워터마크를 추출하는 데 있어 기존의 느린 50단계 방식보다 높은 성공률을 보였습니다. 예를 들어, "Tree-Ring"이라 불리는 특정 유형의 워터마크를 확인할 때, FARI는 이미지가 심하게 왜곡된 상태에서도 거의 **100%**의 확률로 숨겨진 코드를 정확히 식별해 냈으며, 반면 기존 방식들은 어려움을 겪었습니다. 이 논문은 불필요한 단계를 건너뜀으로써 시스템이 덜 견고해지는 것이 아니라 오히려 더 견고해진다고 시사합니다. 이것은 마치 빠른 직격 펀치가 느리고 복잡한 춤 동작보다 더 효과적이라는 것을 배우는 무술가와 같습니다.

저자들은 또한 다른 방식들이 깨끗한 이미지를 되돌리는 데는 완벽할지 몰라도, 이미지가 엉망이 되면 실패한다는 점을 지적합니다. FARI는 한 번의 도약이 깨끗한 이미지에는 완벽하지 않을 수 있음을 인정하지만, 혹독한 과정을 거친 이미지에 대해서는 훨씬 더 우월합니다. 그들은 AI에게 이 새로운 기술을 가르치기 위해 LoRA(Low-Rank Adaptation)라는 기법을 사용했습니다. LoRA를 AI의 뇌에 추가되는 작고 탈부착 가능한 부품이라고 생각하십시오. AI가 그림을 그릴 때는 이 부품이 꺼져 있어 예술 작품이 아름답게 유지됩니다. 하지만 누군가 워터마크를 확인하려고 할 때, 이 부-품이 켜져서 AI가 시작점으로 빠르고 정확하게 도약할 수 있도록 돕습니다.

요약하자면, 이 논문은 우리가 정확하기 위해 반드시 느리고 신중할 필요는 없다고 주장합니다. 시작점으로 돌아가는 경로가 끝으로 가는 경로보다 더 단순하다는 것을 이해함으로써, 우리는 빠르면서도 강인한 시스템을 구축할 수 있습니다. 연구팀은 이 접근 방식이 이미지가 변형되었을 때 워터마크를 검증하는 데 있어 현재의 최첨단 방식들보다 더 효과적이라는 것을 발견했습니다. 이는 때때로 문제를 해결하는 가장 빠른 방법은 단계를 과하게 생각하는 것을 멈추고, 대담하고 잘 훈련된 도약을 하는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →