DreamOmni3: Scribble-based Editing and Generation
이 논문은 새로운 데이터 합성 파이프라인과 원본 이미지 및 스케치 이미지를 결합하여 정밀한 시각적 제어를 가능하게 하는 공동 입력 프레임워크를 통해 유연한 스크리블(scribble) 기반 편집 및 생성을 구현함으로써 GUI 기반 생성을 발전시키는 통합 모델인 DreamOmni3를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 무엇이든 그릴 수 있는 아주 똑똑한 화가와 대화하고 있다고 상상해 보세요. 만약 당신이 "고양이를 그려줘"라고 말하면, 그 화가는 그림을 그려냅니다. "고양이에게 모자를 씌워줘"라고 말하면, 그림을 수정합니다. 이것이 바로 AI 이미지 생성 및 편집의 세계이며, 컴퓨터가 당신의 단어를 바탕으로 이미지를 생성하고 수정하는 방법을 배우는 분야입니다. 오랫동안 이 디지털 화가들과 대화하는 유일한 방법은 텍cript(텍스트)를 통해서였습니다. 하지만 여기 문제가 있습니다. 단어는 때때로 서투릅니다. 새로운 물체를 정확히 어디에 둘지, 혹은 엉망인 그림의 특정 부분을 어떻게 바꿀지를 정확하게 설명하려고 노력하는 것은, 랜드마크가 없는 지도만 가지고 친구에게 길을 안내하려는 것과 같습니다. 당신은 "나무를 왼쪽에 놓아줘"라고 말할 수 있지만, AI는 나무를 너무 왼쪽 끝에 놓거나, 잘못된 왼쪽에 놓을 수도 있습니다.
이를 해결하기 위해 과학자들은 이 화가들과 소통하는 새로운 방법인 **낙서(scribbling)**를 탐구해 왔습니다. 단순히 타이핑하는 대신, 디지털 펜을 잡고 화면 위에 직접 원, 상자, 또는 엉성한 낙서를 그려서 AI에게 당신이 의미하는 바를 정확히 보여줄 수 있습니다. 이는 지도 위의 한 지점을 가리키며 이름 대신 "여기!"라고 말하는 것과 같습니다. 이 논문인 DreamOmni3는 이 "지시하고 그리기(point-and-draw)" 방식이 완벽하게 작동하도록 만드는 과정을 깊이 있게 다룹니다. 이 논문은 컴퓨터가 당신의 단어뿐만 아니라, 당신의 엉성한 손글씨 선까지 이해하도록 가르치는 까다로운 부분들을 해결하며, 이를 결합하여 놀라운 정밀도로 이미지를 생성하거나 편집합니다.
문제점: 단어만으로는 부족할 때
당신이 사진을 편집하는 게임을 하고 있다고 상상해 보세요. 당신은 빨간색 원 안에 있는 장난감을 핸드백으로 바꾸고 싶습니다. 만약 당신이 그냥 "여기에 핸드백을 넣어줘"라고 입력한다면, AI는 혼란에 빠질 수 있습니다. 어떤 장난감인가요? "여기"가 어디인가요? 원은 빨간색인가요 검은색인가요? 첫 번째 이미지인가요 두 번째 이미지인가요? 언어는 큰 아이디어를 전달하기에는 좋지만, 화면 위의 특정하고 작은 세부 사항을 가리키는 데는 형편없습니다.
이 논문의 저자들은 AI가 텍스트 지시를 따르는 데는 매우 능숙해졌지만, 상황이 복잡해지면 "어디에(where)"와 "어떻게(how)"를 놓치는 경우가 많다는 것을 깨달았습니다. 사용자들은 더 직접적인 방법이 필요합니다. 얼굴 주변에 원을 그려 "이 머리카락을 바꿔줘"라고 말하거나, 구불구불한 선을 그려 "여기에 자동차를 놓아줘"라고 할 수 있어야 합니다. 이것이 바로 **낙서 기반 편집 및 생성(scribble-based editing and generation)**의 개념입니다. 이는 사용자가 텍스트, 이미지, 그리고 자신의 자유로운 드로잉을 혼합하여 AI를 제어할 수 있도록 하는 것입니다.
해결책: DreamOmni3
DreamOmni3의 개발팀은 낙서를 텍스트나 이미지와 나란히 하나의 '일급 시민(first-class citizen)'으로 취급하는 모델을 구축하기로 결정했습니다. 하지만 큰 장애물이 있었습니다. 바로 데이터였습니다. AI 모델은 학생과 같아서, 학습하기 위해서는 수천 개의 예시를 보아야 합니다. 엉성한 손으로 그린 원을 어떻게 해석하여 완벽한 편집으로 바꿀 수 있는지 AI에게 보여주는 기존의 교과서(데이터셋)가 없었습니다.
그래서 저자들이 가장 먼저 한 일은 **데이터 공장(data factory)**을 발명하는 것이었습니다. 그들은 기존 이미지를 가져와 영리한 파이프라인을 사용하여 수백만 개의 새로운 학습 예시를 만들어냈습니다.
- 편집을 위해: 그들은 사진을 가져와서 물체를 찾은 다음, 수동으로(또는 보조 AI를 사용하여) 그 위에 원, 상자, 낙서를 그렸습니다. 그들은 네 가지 유형의 작업을 만들었습니다:
- 낙서 + 텍스트: "빨간 원 안에 자동차를 넣어줘."
- 낙서 + 텍스트 + 이미지: "이 사진에 있는 자동차를 빨간 원 안에 넣어줘."
- 이미지 퓨전(Image Fusion): 한 사진의 물체를 다른 사진에 낙서를 가이드 삼아 붙여넣기.
- 낙서 편집(Doodle Editing): 거친 스케치를 사진 속의 사실적인 물체로 바꾸기.
- 생성을 위해: 그들은 사진 대신 빈 흰 캔버스에서 시작하여, 당신이 낙서를 한 위치를 바탕으로 새로운 것을 그리도록 AI를 가르쳤습니다.
그들은 모델이 당신의 드로잉을 통해 마음을 읽는 법을 가르치기 위해, 이러한 예시들을 수만 개 포함하는 방대한 데이터셋(멀티모달 편집용 32,000개, 멀티모달 생성용 29,000개 및 기타 작업용 추가 데이터)을 생성했습니다.
마법의 기술: 모델이 낙서를 "보는" 방법
여기서 논문은 정말 영리해집니다. 보통 AI에게 이미지의 특정 부분을 편집하도록 하려면 **이진 마스크(binary mask)**를 사용합니다. 마스크를 스텐실이라고 생각하세요. 흰색은 "이 부분을 바꿔라", 검은색은 "이 부분은 그대로 두어라"를 의미하는 흑백 이미지입니다.
저자들은 마스크가 너무 경직되어 있다고 주장합니다. 한 사진에서 세 가지 다른 것을 바꿔야 한다면, 세 개의 서로 다른 흑백 마스크가 필요합니다. 이는 번거롭고 설명하기 어렵습니다. 대신, DreamOmni3는 **유색 낙서(colored scribbles)**를 사용합니다. 당신은 자동차를 위해 빨간 원을, 나무를 위해 파란 사각형을, 하늘을 위해 초록색 선을 그릴 수 있습니다. AI는 색상을 통해 이들을 쉽게 구별할 수 있습니다.
하지만 함정이 있습니다. 만약 당신이 자동차 위에 빨간 원을 그리면, 빨간 잉크가 자동차를 덮어버리기 때문에 AI는 더 이상 자동차를 볼 수 없습니다! 이를 해결하기 위해 DreamOmni3는 **결합 입력 체계(joint input scheme)**를 사용합니다.
- 이 모델은 AI에게 원본 사진과 낙서가 얹어진 사진, 즉 두 개의 이미지를 동시에 입력합니다.
- 또한, "이 이미지의 빨간 원이 저 이미지의 자동차와 정확히 같은 위치에 있다"라고 알려주는 특수한 인코딩 시스템(픽셀 라벨링 방식)을 사용합니다.
- 이를 통해 AI는 낙서를 보고(당신이 원하는 것을 알기 위해) 동시에 원본 픽셀을 확인하여(무엇을 바꾸는지 알기 위해) 편집을 수행함으로써, 편집은 정밀하게 수행하면서 나머지 부분은 완벽하게 유지할 수 있습니다.
두뇌: "엉성함"을 이해하도록 AI 가르치기
저자들은 또한 인간의 그림이 종종 엉성하다는 점을 깨달았습니다. 원이 달걀 모양처럼 보일 수도 있고, 선이 구불구불할 수도 있습니다. AI가 이러한 불완전한 드로잉을 이해하도록 돕기 위해, 그들은 추론에 능숙한 AI 유형인 **시각 언어 모델(Visual Language Model, VLM)**을 도입했습니다.
그들은 이미지 생성기와 함께 이 VLM을 훈련시켰습니다. VLM은 번역가 역할을 합니다. VLM은 당신의 낙서와 당신이 쓴 글을 살펴보고, 당신이 정말로 의도한 바(예: "아, 이 사람이 구불구불한 원을 그렸지만, 분명히 자동차를 원하는구나")를 파악한 다음, 이미지 생성기에게 정확히 무엇을 해야 할지 알려줍니다. 이 **결합 훈련(joint training)**은 AI가 단순히 규칙을 맹목적으로 따르는 것이 아니라, 낙서 뒤에 숨겨진 의도를 실제로 이해하도록 보장합니다.
결과: 효과가 있는가?
연구팀은 실제 세계의 이미지와 까다로운 작업들로 구성된 새로운 벤치마크를 만들어 DreamOmni3를 테스트했습니다. 그들은 GPT-4o나 Nano Banana와 같은 유명한 상업용 모델을 포함한 다른 최고 수준의 모델들과 비교했습니다.
결과는 인상적이었습니다. DreamOmni3는 오픈 소스 모델들을 지속적으로 능가했으며, 많은 영역에서 상업적 거물들과 대등하거나 그들을 앞질렀습니다.
- 인간 평가자(실제 사람들)는 편집 작업에 대한 DreamOmni3의 성공률을 **55.88%**로 평가했는데, 이는 GPT-4o(한 지표에서 59.56%였으나 DreamOmni3는 다른 지표에서 더 일관적이었음)보다 높았고, Omnigen2(2.94%)와 같은 다른 모델들보다 현저히 높았습니다.
- 생성 작업에서 DreamOmni3는 54.55%의 성공률을 달성하며 역시 대부분의 경쟁자를 물리쳤습니다.
- 논문은 상업용 모델들이 강력하긴 하지만, 특정 낙서 지시사항을 처리할 때 어려움을 겪어 최종 이미지에 낙서가 남아있거나 비율이 틀리는 경우가 종종 있다고 언급했습니다. 반면, DreamOmni3는 이러한 미세한 차이를 처리하도록 특별히 설계되어, 낙서가 사라지고 편집이 자연스럽게 보이는 더 깔끔한 결과를 만들어냈습니다.
이것이 왜 중요한가
DreamOmni3는 단순히 AI를 더 똑똑하게 만드는 것이 아니라, AI를 더 인간답게 만드는 것에 관한 것입니다. 이는 우리가 상상하는 것과 우리가 설명할 수 있는 것 사이의 간극을 메워줍니다. 드로잉하고, 가리키고, 낙서하게 함으로써, 이 모델은 이미지 편집을 기술적인 작업에서 창의적인 대화로 변화시킵니다. 이 논문은 텍스트, 이미지, 자유로운 드로잉을 스마트한 데이터 합성 및 결합 훈련과 결합하는 이 방식이 디지털 창작 도구와 상호작용하는 미래가 될 것임을 시사합니다. 컴퓨터가 우리의 모호한 단어를 이해하도록 강요하는 대신, 우리의 직접적인 행동을 보도록 허용할 때 결과가 훨씬 더 마법스러워질 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.