← 최신 논문
🤖 machine learning

Draw This First

이 논문은 전형적인 스트로크 순서 결정 과정을 역전하여 드로잉 시퀀스를 정의하는 2D 필드를 예측함으로써, 텍스트나 이미지로부터 특정 드로잉 지침을 준수하는 순서가 있는 벡터 스케치 생성을 가능하게 하는 새로운 스케치 생성 방식을 소개한다.

원저자: Dazhi Zhong, Rowan Bradbury, Grant Davis

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dazhi Zhong, Rowan Bradbury, Grant Davis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마술사가 캔버스에 그림을 그리는 모습을 지켜보고 있다고 상상해 보세요. 보통 우리가 컴퓨터가 그림을 그린다고 말할 때, 우리는 컴퓨터를 단순히 최종 결과물을 한 번에 쏟아내거나, 혹은 슬로 모션 타임랩스처럼 픽셀 하나하나를 쌓아 올리는 예술가라고 생각합니다. 하지만 그림을 그리는 데는 다른 방식의 사고가 있습니다. 바로 선이 만들어지는 '이야기'입니다. 예술가가 윤곽선을 먼저 그렸나요, 그다음 눈을 그렸나요, 아니면 모자를 그렸나요? 아니면 모자를 먼저 그리고, 눈을 그린 다음, 윤곽선으로 마무리했나요? 이 '이야기'를 **그리기 순서(drawing order)**라고 부릅니다.

오랫동안 컴퓨터는 최종 그림을 제대로 만드는 데는 뛰어났지만, 그 '이야기'를 파악하는 데는 서툴렀습니다. 어떤 선이 먼저 왔는지 알지 못했던 것이죠. 이것은 매우 중요합니다. 왜냐하면 컴퓨터가 당신의 그림을 돕게 하고 싶거나, 사진을 로봇이 펜으로 실제로 '따라 그릴 수 있는' 간단한 스케치로 되돌리고 싶다면, 당신은 그 순서를 알아야 하기 때문입니다. 이것은 완성된 퍼즐을 건네주는 것과 퍼즐 조각을 어떻게 맞추는지에 대한 설명서를 건네주는 것의 차이와 같습니다. 이 논문은 컴퓨터 비전(computer vision)과 생성형 AI(generative AI)의 세계, 즉 기계가 이미지를 이해하고 창조하려고 노력하는 영역에 속해 있습니다. 여기서 핵심적인 질문은 이것입니다: 우리가 컴퓨터에게 단순히 '무엇을' 그릴지뿐만 아니라, 인간처럼 단계별로 '어떻게' 그릴지를 가르칠 수 있을까?

이 논문의 핵심 아이디어: 시간으로 그리기

Krea.ai와 Wand Technologies의 도구들을 활용하여 연구한 이 논문의 저자들은 컴퓨터가 스케치를 생성하는 방식의 판도를 바꾸기로 했습니다. 다음 문장의 단어를 하나씩 예측하는 것(마치 문장에서 다음 단어를 추측하는 것과 같은 방식) 대신, 그들은 다른 질문을 던졌습니다. "만약 우리가 컴퓨터에게 모든 선을 정확히 언제 그려야 하는지 알려주는 지도를 그릴 수 있다면 어떨까?"

이것을 그림을 위한 '히트맵(heat map)' 또는 '신호등 시스템'이라고 생각해 보세요. 빈 종이가 있다고 가정해 봅시다. 컴퓨터는 단순히 고양이를 그리는 것이 아닙니다. 컴퓨터는 먼저 종이 위에 보이지 않는 다채로운 층(layer)을 칠합니다. 이 층에서 각 픽셀의 색상은 그 그림의 특정 부분이 얼마나 '오래되었는지(시간상 어느 단계인지)'를 컴퓨터에게 알려줍니다.

  • 빨간색 픽셀은 "이 부분을 먼저 그려라"라는 의미일 수 있습니다.
  • 노란색 픽셀은 "그다음으로 이 부분을 그려라"라는 의미입니다.
  • 파란색 픽셀은 "이 부분을 마지막에 그려라"라는 의미입니다.

이것이 핵심적인 기술입니다. 그들은 시간(그리기 순서)을 색상으로 변환했습니다.

컴퓨터를 어떻게 학습시켰는가

이 작업이 가능하게 하려면 팀에게는 선생님이 필요했습니다. 그들은 인터넷에서 흔히 볼 수 있는 지저도한 "낙서" 데이터셋을 사용하지 않았습니다. 대신, 그들은 50명의 전문 예술가를 고용하여 47,318개의 고품질 스케치를 그리게 했습니다. 예술가들은 새부터 찻주전자까지 다양한 것을 그렸으며, 컴퓨터는 그들이 선을 긋는 매 순간의 움직임을 정확하게 기록했습니다.

컴퓨터는 이 그림들을 관찰하며 특수한 "시간-색상" 지도를 만들었습니다. 컴퓨터는 실제 그림을 가져와서, 잉크의 밝기와 색조가 그림의 과정을 이야기하도록 만드는 기묘하고 다채로운 이미지를 만들어냈습니다.

그 후, 그들은 강력한 AI 모델(추측하고 스스로 수정하며 배우는 방식인 '디퓨전 트랜스포머')을 사용하여 처음부터 이러한 다채로운 지도를 생성하는 법을 학습시켰습니다. 그들은 AI에게 두 가지를 가르쳤습니다:

  1. 텍text-to-Sketch (텍스트 투 스케치): 만약 당신이 "고양이"라고 입력하면, AI는 고양이를 그리는 방법을 알려주는 다채로운 지도를 생성해야 합니다.
  2. Image-to-Sketch (이미지 투 스케치): 만약 당신이 고양이 사진을 보여주면, AI는 그리기 순서를 파악하여 지도를 생성해야 합니다.

마법의 기술: 지도 읽기

AI가 이 다채로운 "시간 지도"를 생성하고 나면, 컴퓨터는 이를 다시 실제 그림으로 변환해야 합니다. 여기서 그들의 특별한 디코더(decoder)가 등장합니다. 디코더는 색상을 살펴보고, 어떤 픽셀이 빨간색(첫 번째)인지, 어떤 픽셀이 노란색(두 번째)인지 등을 파악합니다. 그런 다음 점들을 연결하여 매끄럽고 순서가 있는 선 그림을 만들어냅니다.

가장 멋진 점은 무엇일까요? 당신은 AI에게 이야기를 바꾸라고 명령할 수 있다는 것입니다. 만약 당신이 "꼬리를 먼저 그리고, 그다음 몸통을 그려라"라고 입력한다면, AI는 그 말을 듣습니다. AI는 단순히 그림을 바꾸는 것이 아니라, 최종 그림은 동일하게 유지하면서도 선이 나타나는 순서를 바꿉니다. 이것은 마치 이야기꾼에게 결말부터 시작해서 거꾸로 이야기를 진행하라고 말하는 것과 같지만, 이야기는 여전히 앞뒤가 맞게 됩니다.

결과 (성공한 점과 미흡한 점)

결과는 매우 인상적이지만, 저자들은 무엇이 작동하고 무엇이 작동하지 않는지 명확히 밝히고 있습니다.

  • 지시 사항에 매우 잘 작동합니다: 그들이 AI에게 특정 순서(예: "머리, 그다음 몸통, 그다음 꼬리")로 그리라고 명령했을 때, AI는 그 명령을 거의 완벽하게 따랐습니다. 선의 순서는 무작위 추측보다 훨씬 더 명령과 일치했습니다.
  • 원래 예술의 '분위기'를 유지합니다: AI가 그리는 방식을 바꾸더라도, 원래 모델의 예술적 스타일과 지식을 그대로 유지했습니다. AI는 순서 지침을 따르는 것만으로도 본 적 없는 사물도 그려낼 수 있었습니다.
  • 아직 완벽하지는 않습니다: 저자들은 AI가 큰 지시(예: "머리를 먼저 그려라")는 잘 따르지만, 단일 부분 내부의 아주 세밀한 디테일(예: 머리 내부의 선들의 정확한 순서)에 대해서는 가끔 혼란을 겪는다는 점을 인정했습니다. 또한, 컴퓨터는 하나의 매끄러운 선을 몇 개의 작은 조각으로 나누기도 하여, 최종 그림이 원래 예술가가 의도했던 것보다 더 많은 선을 갖게 되기도 합니다.

이것이 왜 중요한가

이 논문은 우리가 컴퓨터에게 결과물뿐만 아니라 그림을 그리는 과정을 가르칠 수 있음을 보여줍니다. 시간을 색상으로 변환함으로써, 그들은 AI가 예술을 만드는 방법에 대해 지시를 따르게 만드는 영리한 방법을 찾아냈습니다. 이는 컴퓨터가 단순히 인간의 예술을 흉내 내는 것을 넘어, 한 번에 한 획씩 인간의 사고방식을 이해하도록 만드는 단계로 나아가는 것입니다.

저자들은 이 방법이 사진을 편집 가능한 벡터 스케치로 바꾸거나 로봇이 그림을 배우는 데 도움을 줄 수 있다고 제안하지만, 이것이 완전히 해결된 문제라고 주장하지는 않습니다. 그들은 적절한 훈련과 약간의 "색상 코드로 된 시간"이 있다면, 기계가 인간처럼 한 단계씩 차근차근 그림을 그리기 시작할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →