← 최신 논문
💻 computer science

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

이 논문은 시각적 충실도와 의미론적 편집성 사이의 균형을 효과적으로 맞춤으로써 래스터 이미지를 구조화된 편집 가능 그래픽으로 재구성하도록 설계된 DrawAI-Bench 벤치마크와 DrawAI-Flow 에이전트 워크플로를 포함하는 포괄적인 프레임워크인 DrawAI를 소개한다.

원저자: Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미래 도시를 그린 아름답고 고해상도인 그림을 보고 있다고 상상해 보세요. 정말 멋져 보이죠? 하지만 이제 딱 한 가지만 바꾸고 싶다고 상상해 봅시다. 예를 들어, 빨간색 우주선을 파란색으로 바꾸거나, 마천루를 거리 반대편으로 옮기고 싶다고 말이죠. 만약 이 그림이 일반적인 디지털 사진(즉, "래스터 이미지")이라면, 당신은 우주선을 잡아서 그냥 움직일 수 없습니다. 컴퓨터에게 우주선은 별개의 객체가 아니라, 하늘이나 건물과 뒤섞여 있는 특정 색상 점들의 패턴일 뿐이기 때문입니다. 이를 해결하려면 전체 그림을 다시 그리거나 처음부터 다시 시작해야 합니다. 이것이 현대 AI가 만들어내는 대부분의 이미지들이 가진 좌절스러운 현실입니다. 즉, 이미지는 아름답지만 "평면적"이며, 전체를 망치지 않고는 수정하는 것이 불가능하다는 것입니다.

이 논문은 **인공지능(AI)**과 컴퓨터 비전의 세계에 있으며, 특히 어떻게 하면 AI가 생성한 이미지를 단순히 예쁘게 만드는 것을 넘어 유용하게 만들 수 있는지에 초점을 맞추고 있습니다. 핵심 아이디어는 평면적인 사진을 마치 모든 스티커, 단어, 도형을 집어 들고 움직일 수 있는 디지털 스크랩북처럼, 모든 요소가 분리된 "레이어" 파일로 변환하는 것입니다. 연구자들은 평면 사진을 어떻게 마법처럼 편집 가능한 부품들의 집합으로 재구축하면서도 원래의 모습을 잃지 않을 것인가라는 까다로운 퍼즐을 풀고자 합니다. 그들은 이를 "이미지-투-편집 가능 재구성(image-to-editable reconstruction)"이라고 부릅니다. AI가 학교 프로젝트, 과학 논문, 발표 자료를 위한 시각 자료를 만드는 능력이 향로됨에 따라, 우리는 그 시각 자료가 단순히 바라보는 대상이 아니라 인간이 수정하고 개선할 수 있도록 유연해지기를 원하기 때문에 이 연구는 매우 중요합니다.


논문의 핵심 아이디어: 평면 사진을 편집 가능한 레고 세트로 바꾸기

베이징과 칭화 대학교의 연구진들은 큰 격차를 발견했습니다. AI는 이제 놀라운 그림을 그릴 수 있지만, 그 그림들은 "평면 모드"에 갇혀 있습니다. 만약 오타를 고치거나 차트를 옮기고 싶다면, 전체를 다시 그리지 않는 한 방법이 없습니다. 그래서 그들은 이 문제를 해결하기 위해 DrawAI라는 새로운 시스템을 만들었습니다. DrawAI를 똑똑한 디지털 건축가라고 생각해보세요. 이 건축가는 평면 사진을 보고 이렇게 말합니다. "이게 지금은 단단한 벽처럼 보이지만, 나중에 분해할 수 있도록 나는 이것을 레고 브릭으로 다시 만들겠습니다."

그들은 시스템의 성능을 증명하기 위해 단순히 추측하는 대신, DrawAI-Bench라는 거대한 테스트장을 구축했습니다. 과학 다이어그램, 발표 슬라이드, 포스터, 순서도라는 네 가지 유형의 도전 과제가 있는 거대한 장애물 코스를 상상해 보세요. 그들은 이 코스를 40개의 이미지(각 도메인당 실제 이미지 10개와 AI 생성 이미지 10개)로 채웠고, 결과를 채점하기 위한 39가지의 엄격한 규칙을 가진 점수 체계를 만들었습니다. 이 규칙들은 두 가지 주요 사항을 확인합니다:

  1. 충실도(Fidelity): 재구축된 버전이 원본과 똑같이 보이는가? (색상이 일치하는가? 텍스트가 읽히는가?)
  2. 편집 가능성(Editability): 실제로 편집할 수 있는가? (텍스트가 클릭 가능한 실제 텍스트 박스인가? 화살표가 움직일 수 있는 실제 선인가?)

연구 결과, 이 두 목표는 종종 서로 충돌한다는 것을 발견했습니다. 이미지를 하나의 덩어리로 통째로 복사하면 완벽하게 보이지만(높은 충실도), 아무것도 편집할 수 없습니다(편집 가능성 0). 반대로 너무 많은 작은 조각으로 나누면 모든 것을 편집할 수 있지만, 그림이 지저분해지거나 원래의 스타일을 잃을 수 있습니다. 과제는 그 사이의 최적의 지점을 찾는 것입니다.

구현 방법: 2단계 로봇 팀

연구진은 하나의 AI에게 한꺼번에 모든 일을 맡기는 대신(이는 종종 실수를 유발합니다), DrawAI-Flow라고 불리는 2단계 워크플로우를 구축했습니다. 그들은 이 문제를 두 명의 전문 작업자가 참여하는 건설 프로젝트처럼 다루었습니다:

  1. 파서 에이전트 (탐정): 먼저, 이 에이전트는 평면 사진을 살펴보고 특수 도구(모양을 위한 돋보기와 텍스트를 위한 스캐너 등)를 사용하여 사진에 무엇이 있는지 파악합니다. 이 에이전트는 단순히 추측하는 것이 아니라, 상세한 "설계도" 또는 계획을 만듭니다. 이 에이전트는 "좋아, 이 부분은 텍스트 박스이고, 이것은 원이며, 저것은 크롭이 필요한 사진이다"라고 결정합니다.
  2. 재구성 에이전트 (건축가): 이 에이전트는 설계도를 받아 건축을 시작합니다. 여기서 흥кси로운 점은, 단순히 최종 이미지를 내뱉는 것이 아니라 그림을 그리기 위한 코드(마치 레시피와 같은)를 작성한다는 것입니다. 이 에이전트는 조금 그려보고, 제대로 되었는지 확인한 뒤, 틀렸다면 코드를 수정하고 다시 시도합니다. 그림이 완벽하고 완전히 편집 가능해질 때까지 '그리기-확인-수정'의 과정을 반복하며 루프를 돕니다.

연구 결과: 단순히 AI 모델만의 문제가 아니다

연구팀은 5가지 "하네스"(AI를 실행하는 데 도움을 주는 툴킷 또는 운영 체제와 같은 것)를 사용하여 13가지의 서로 다른 AI 모델(OpenAI, Anthropic, Google 등의 유명 기업 제품)을 테스트했습니다. 여기서 발견한 사실은 다음과 같습니다:

  • 단일 승자는 없다: 모든 면에서 최고인 단 하나의 AI 모델은 없었습니다. 어떤 모델은 그림을 실제처럼 만드는 데(충실도) 뛰어났지만 편집 가능성은 형편없었습니다. 또 다른 모델은 편집에는 뛰어났지만 원본과 닮게 만드는 데는 부족했습니다. 예를 들어, GPT-5.6 Sol이라는 모델은 원본과 닮은 정도에서 94.0점을 받았지만 편집 가능성에서는 85.1점만을 받았습니다. 반대로 Claude Opus 4.8은 편집 가능성에서 91.6점을 받았지만, 닮은 정도 점수는 더 낮았습니다.
  • 툴킷이 생각보다 중요하다: "하네스"(AI를 실행하는 데 사용되는 도구)는 엄청난 차이를 만들었습니다. 적절한 툴킷을 사용하는 것만으로 모델의 점수를 13점 이상 높일 수 있었습니다. 이는 숙련된 목수가 무딘 톱을 사용하는 것과 날카로운 톱을 사용하는 것의 차이와 같습니다. 목수(AI 모델)는 같지만, 도구에 따라 결과가 완전히 달라집니다.
  • 워크플로우가 핵심 비결이다: 단 한 번에 작업을 수행하게 하는 대신, 그들의 특별한 2단계 워크플로우(DrawAI-Flow)를 사용했을 때 결과가 훨씬 좋아졌습니다. 구체적으로, 편집 가능성 점수가 평균 17.6점 상승했습니다. 이 워크플로우는 인식된 콘텐츠를 실제로 클릭하고 움직일 수 있는 별개의 객체로 변환하는 데 도움을 주었습니다.
  • 텍스트가 가장 어려운 부분이다: 최고의 시스템조차 텍스트 문제로 고전했습니다. 이미지와 도형은 편집하기 쉽게 만들 수 있었지만, 텍스트를 실제 편집 가능한 텍스트 박스로 변환하는 것은 여전히 많은 모델의 약점이었습니다.
  • 비용 대비 품질: 연구진은 비용 문제도 살펴보았습니다. 돈을 더 많이 쓴다고 해서 항상 더 나은 결과가 나오는 것은 아니라는 점을 발견했습니다. 일부 비싼 설정은 잘못된 도구를 사용하거나 AI에게 불필요한 작업을 시킴으로써 오히려 더 저렴한 설정보다 결과가 좋지 않았습니다.

결론

이 논문은 이미지를 편집 가능하게 만드는 것이 단순히 더 똑똑한 AI 모델을 갖는 것만이 아니라고 결론짓습니다. 그것은 좋은 모델, 실행을 위한 적절한 도구, 그리고 스마트한 단계별 계획을 포함하는 완전한 시스템을 갖추는 일입니다. 단순히 AI에게 "이것을 편집 가능하게 만들어줘"라고 요청한다고 해서 마법이 일어나지는 않습니다. 계획을 세울 탐정과 코드로 구현할 건축가가 필요하며, 그 과정에서 끊임없이 검토해야 합니다.

비록 시스템이 아직 완벽하지는 않지만(특히 복잡한 표나 밀도가 높은 포스터의 경우), 이는 명확한 발전 방향을 보여줍니다. 문제를 세분화하고 코드를 사용하여 이미지를 재구축함으로써, 우리는 마침내 그 평면적이고 변경 불가능한 AI 이미지들을 인간이 실제로 사용하고 개선할 수 있는 유연한 초안으로 바꿀 수 있습니다. AI 예술의 미래는 단순히 예쁜 그림을 만드는 것이 아니라, 사람이 가지고 놀 수 있는 그림을 만드는 데 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →