← 최신 논문
💻 computer science

Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning

본 논문은 기존 방법들이 사전 훈련된 글리프 인코더에 의존하고 시각적 세부 사항을 간과하는 한계를 극복하기 위해, 원본 이미지에서 직접 스타일 및 글리프 프롬프트를 구성하여 컨텍스트 내 학습을 활용함으로써 오픈-보카불러리 스타일 일관성 장면 텍스트 편집을 달성하는 자기 프롬핑 확산 트랜스포머를 제안한다.

원저자: Hongxi Li, Tong Wang, Chengjing Wu, Tianbao Liu, Jiangtao Yao, Xiaochao Qu, Xinxiao Wu, Luoqi Liu, Ting Liu

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hongxi Li, Tong Wang, Chengjing Wu, Tianbao Liu, Jiangtao Yao, Xiaochao Qu, Xinxiao Wu, Luoqi Liu, Ting Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"카페"라고 적힌 간판의 사진이 있다고 상상해 보세요. 하지만 이를 "제과점"으로 바꾸고 싶다면, 단순히 새로운 단어를 쓰는 것만으로는 부족합니다. 중요한 것은 새로운 단어가 마치 처음부터 그곳에 있었던 것처럼 보이게 만드는 것입니다. 정확한 글꼴, 특정한 붉은색의 농도, 페인트의 질감, 그리고 글자에 비치는 빛의 반사까지 모두 일치해야 하며, 동시에 그 뒤의 벽돌 벽은 손대지 않은 것처럼 유지되어야 합니다.

이 논문은 바로 이러한 작업을 수행하는 새로운 AI 도구인 MSTEdit를 소개하며, 학습 방식에 있어 독특한 변주를 더했습니다.

문제: "빈 캔버스"의 실수

이전까지의 시도들은 간판의 오타를 고르라는 지시를 받은 화가가, 먼저 전체 간판을 하얀 빈 캔버스로 덮어씌우도록 강요당하는 것과 같았습니다.

  • 과거의 방식: AI 는 원래 텍스트를 완전히 지우고 주변 벽만 보고 새로운 텍스트가 어떻게 보여야 할지 추측하려 했습니다.
  • 결과: 새로운 텍스트는 종종 잘못되었습니다. 잘못된 글꼴이나 색상을 사용하거나, 위에 붙인 스티커처럼 보였습니다. 원래 간판의 "영혼"이 사라진 것입니다. 또한, 이러한 기존 시스템들은 특정 사전만 외운 학생들과 같았습니다. 만약 이전에 본 적 없는 단어 (희귀한 기호나 새로운 언어 등) 를 작성하라고 요청하면 실패했습니다.

해결책: "자기 프롬핑" 탐정

저자들은 **자기 프롬핑 (Self-Prompting)**이라는 방법을 제안합니다. 원래 텍스트를 지우고 추측하는 대신, AI 는 변경을 가하기 전에 범죄 현장을 연구하는 탐정처럼 행동합니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다.

1. "스타일 스냅샷" (스타일 프롬프트)
"카페"라는 단어를 "제과점"으로 바꾸고 싶다고 가정해 보세요. 간판을 건드리기 전에 AI 는 원래의 "카페" 글자 고해상도 사진을 찍습니다. 페인트 질감, 정확한 붉은색, 그리고 글꼴 스타일을 분석합니다. 그리고 "스타일 스냅샷"을 만들어 "좋아, 새로운 단어는 정확히 이렇게 보여야 해"라고 말합니다.

2. "청사진" (글리프 프롬프트)
AI 는 새로운 단어인 "제과점"을 가져와 단순한 흑백 청사진을 그립니다. 이는 화려한 사진이 아니라 글자의 명확한 윤곽선일 뿐입니다. 이는 AI 에게 무엇을 쓸지는 알려주지만, 어떻게 보여야 하는지는 아직 알려주지 않습니다.

3. "거장 화가" (확산 트랜스포머)
AI 는 "컨텍스트 학습"에 매우 뛰어난 강력한 엔진 (멀티모달 확산 트랜스포머) 을 사용합니다. 이 엔진을 스타일 복제에 탁월한 거장 화가로 생각하세요.

  • 화가는 청사진 (무엇을 쓸지) 을 봅니다.
  • 화가는 스타일 스냅샷 (어떻게 쓸지) 을 봅니다.
  • 화가는 주변 벽 (어디에 놓을지) 을 봅니다.

그런 다음 화가는 청사진을 구조로 삼되, 원래 "카페"의 페인트와 질감을 복사하여 새로운 단어 "제과점"을 벽에 직접 그립니다.

학습: 실습을 통한 학습

이 AI 를 이렇게 훌륭하게 가르친 방법은 무엇일까요? 그들은 **"쿨다운 학습 (Cooldown Training)"**이라고 부르는 두 단계 학습 과정을 사용했습니다.

  • 1 단계: 자기지도 학습 단계 (실습): 먼저 AI 는 수백만 장의 이미지에서 특정 스타일 매칭을 걱정하지 않고 단순히 글자를 그리는 법을 배우도록 했습니다. 다양한 언어의 글자 모양을 학습했습니다.
  • 2 단계: 쿨다운 단계 (최종 시험): 그다음, 인간이 간판을 완벽하게 편집한 "전후 (Before and After)" 이미지 쌍으로 구성된 작고 특별한 세트를 AI 에게 제공했습니다. AI 는 이러한 쌍들을 연구하여 스타일 매칭의 섬세한 기술을 배웠습니다. "아, 옛 단어에서 이 붉은 페인트 질감을 보면, 새로운 단어에도 똑같은 붉은 페인트 질감을 사용해야 해"라고 배운 것입니다.

특별한 점

  • 개념적 어휘 (Open Vocabulary): AI 가 고정된 단어 목록을 외우는 대신, 글자를 구성하는 선 (스트로크) 의 모양을 학습하기 때문에 이전에 본 적 없는 언어를 포함한 거의 모든 언어의 텍스트를 편집할 수 있습니다. 다른 AI 들이 막히게 되는 희귀한 문자나 기호도 처리할 수 있습니다.
  • 추가 도구 불필요: 폰트나 색상을 분석하기 위해 별도의 무거운 도구가 필요한 다른 방법들과 달리, 이 방법은 이미지 자체에서 직접 "프롬프트"(스타일 스냅샷과 청사진) 를 생성합니다. 자체적으로完備되어 있습니다.
  • 실제 결과: 이 논문은 영어, 중국어, 아랍어, 태국어, 러시아어 등 13 가지 언어로 이 방법을 테스트했습니다. 그 결과, 새로운 텍스트가 정확해 보이고 원래 스타일과 일치하는 데 있어 기존 어떤 방법보다 훨씬 우수함이 입증되었습니다.

요약하자면, 이 논문은 단순히 텍스트를 "대체"하는 AI 가 아니라, 새로운 단어가 기존 장면과 완벽하게 어울리며 자연스럽게 그곳에 속한 것처럼 보이도록 텍스트를 "이식"하는 AI 를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →