← 최신 논문
💻 computer science

ReART: Reference-Guided Retrieval and Refinement for Emotion-Aware Art Generation

reART는 캡션을 구조화된 시각적 영역으로 분해하여 표적 참조 검색을 수행하고, 정렬 실패를 진단 및 수리하기 위해 AAS 기반 루프를 채택함으로써 감정 인지형 예술 생성을 강화하는 참조 가이드형 검색 및 정제 프레임워크로서, AffectiveArt 2026 그랜드 챌린지에서 최상위 성능을 달성했습니다.

원저자: Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

예술은 언제나 사물의 그림 그 이상이었습니다. 그것은 감정을 느끼는 하나의 방식입니다. 수 세기 동안 화가들은 미소 짓는 얼굴이나 눈물 한 방울을 직접 그려 넣지 않고도, 붓터치와 색채의 선택, 그리고 장면에 떨어지는 빛의 방식을 사용하여 엄숙함, 기쁨, 혹은 우울함과 같은 감정을 전달해 왔습니다. 오늘날 컴퓨터는 문장으로 된 설명을 통해 이러한 이미지들을 생성하는 법을 배우고 있으며, 이 과정은 놀라울 정도로 사실적인 장면을 만들어내는 데 탁월한 능력을 보여주고 있습니다. 그러나 새로운 과제가 등장했습니다. 바로 '엄숙한' 분위기를 조성하기 위해서는 단순히 슬픈 사물을 추가하는 것이 아니라, 차분한 색조나 평면적인 공간감과 같이 구체적이고 미묘한 시각적 결정을 내려야 한다는 점을 기계에게 가르치는 일입니다. 문제는 인간의 언어가 이러한 미세한 세부 사항을 설명하기에는 너무 모호할 때가 많다는 점에 있습니다. 어떤 사람이 "엄숙한 르네상스 회화"를 요청하는 프롬프트를 작성할 때, 컴퓨터는 그 감정에 맞추기 위해 정확히 어떤 회색조를 사용해야 하는지, 혹은 붓터치가 얼마나 두꺼워야 하는지를 알지 못합니다. 이는 마치 누군가에게 구체적인 팔레트나 명확한 질감에 대한 비전 없이 분위기를 그려달라고 요청하는 것과 같습니다.

이를 해결하기 위해 북경대학교와 무한대학교의 연구진은 모호한 감정적 단어와 구체적인 시각적 증거 사이의 가교 역할을 하는 ReART라는 시스템을 개발했습니다. 이 시스템은 텍스트만으로 적절한 외형을 추측하는 대신, 설명을 주요 피사체, 장면의 배치, 물감의 질감, 그리고 전반적인 분위기와 같은 구 구체적인 시각적 요소들로 분해합니다. 그런 다음 시스템은 기존 예술 작품들의 방대한 라이브러리를 검색하여 이러한 각 구체적인 부분들과 일치하는 실제 사례들을 찾아냅니다. 만약 프로ンプ트가 특정 유형의 붓터치를 요구한다면, 시스템은 그 정확한 질감을 가진 그림을 찾아 이를 가이드로 사용합니다. 이를 통해 컴퓨터는 단어에 기반해 추측하는 대신, 거장 예술가의 손길을 거친 '엄숙함'이나 '극적임'이 실제로 어떻게 보이는지를 학습하게 됩니다.

이 과정은 크게 두 단계로 진행됩니다. 첫째, 시스템은 텍스트 설명과 라이브러리에서 수집한 시각적 단서들을 사용하여 초기 이미지를 생성합니다. 그 후 시스템은 스스로 비평가가 되어 결과물을 원래의 요청 사항과 대조하며 검토합니다. 만약 이미지가 주제는 잘 구현했으나 색감이 너무 밝거나, 구도는 맞지만 질감이 너무 매끄럽고 디지털 느낌이 난다면, 시스템은 정확히 어느 부분이 잘못되었는지 식별해 냅니다. 시스템은 단순히 이미지를 버리고 다시 시도하는 것이 아닙니다. 대신, 이미 잘 구현된 부분은 보호하면서 문제가 발생한 부분만을 수정하기 위한 구체적인 계획을 세웁니다. 시스템은 오류에 부합하는 새로운 시각적 사례를 선택하고, 이미지를 정교하게 편집하여 결함을 바로잡음으로써 나머지 그림은 건드리지 않은 채 수정 작업을 수행합니다. 이러한 점검과 수정의 순환은 이미지가 프롬프트의 정서적, 시각적 목표와 완벽하게 일치할 때까지 계속됩니다.

이 방식의 결과는 감성 예술 생성에 관한 주요 경연 대회에서 테스트되었으며, 시스템은 콘텐츠, 예술적 스타일, 그리고 미세한 감정적 속성을 얼마나 잘 포착했는지를 기준으로 심사를 받았습니다. 연구진은 자신들의 방식이 이전의 시도들보다 실제 인간이 만든 예술에 훨씬 더 가깝게 구현되었다는 것을 발견했습니다. 대회에서 이 시스템은 감정 정렬 테스트에서 만점을 기록했는데, 이는 주어진 모든 경우에 대해 의도된 감정을 성공적으로 일치시켰음을 의미합니다. 또한 전체 챌린지에서 종합 2위를 차지하며, 복잡한 예술적 요청을 작고 관리 가능한 시각적 조각들로 나누고 실제 사례를 사용하여 창작을 유도하는 것이 기계에게 예술의 미묘한 언어를 가르치는 강력한 방법임을 입증했습니다. 이 연구는 컴퓨터에게 적절한 시각적 참조와 스스로의 작업을 점검할 수 있는 방법이 주어진다면, 단순히 규칙을 따르는 것이 아니라 감정의 시각적 질감을 이해함으로써 인간의 감정과 공명하는 예술을 창조할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →