← 최신 논문
💻 computer science

JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation

JoLT는 저해상도와 고해상도 잠재 궤적을 서로 연결된 두 개의 스트림에서 동시에 디노이징함으로써, 전역적인 레이아웃 제어와 미세한 디테일 합성을 효과적으로 결러 풍부한 디테일과 시각적으로 즐거운 이미지를 생성하는 고해상도 이미지 생성을 위한 새로운 프레임워크를 도입한다.

원저자: Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수십 년 동안 컴퓨터로 예술 작품을 만들고자 하는 꿈은 단순한 절충안에 의해 제한되어 왔습니다. 즉, 명확하고 일관된 그림을 얻거나, 아니면 복잡한 세부 묘사가 가득한 그림을 얻을 수는 있었지만, 두 가지를 동시에 갖추기는 매우 어려웠습니다. 텍스트 설명을 이미지로 변환하도록 훈련된 현대 인공지능은 전체적인 구도를 포착하는 데 매우 능숙해졌습니다. 인공지능는 언덕 위의 성이나 매트 위의 고양이를 완벽한 논리로 배치할 수 있습니다. 그러나 예술가들이 커다란 벽면용이나 파인 아트 인쇄용으로 제작될 거대하고 고해상도인 이미지를 요청할 때, 이러한 시스템들은 종종 어려움을 겪습니다. 이들은 멀리서 보면 선명해 보이지만, 가까이서 보면 무너지는 경향이 있으며, 장면을 실감 나게 만드는 밀도 높고 풍부한 질감이 부족합니다. 이를 해결하기 위한 표준적인 방식은 2단계 과정을 거치는 것이었습니다. 먼저 레이아웃을 잡기 위해 작고 저해상도인 이미지를 생성한 다음, 그 위에 세부 묘사를 추가하려고 시도하는 것입니다. 하지만 이 접근 방식에는 근본적인 결함이 있습니다. 작은 이미지가 만들어진 후에는 컴퓨터가 새로운 세부 사항들을 수용하기 위해 큰 그림을 수정할 수 없기 때문에, 최종 결과물에서 미세한 질감들이 장면에 녹아들기보다는 단순히 위에 덧붙여진 것처럼 느껴지게 됩니다.

한 연구팀은 이 문제를 해결하기 위한 다른 방법을 제안하며, '조로트(JoLT, Joint Latent Trajectories)'라고 불리는 방식을 소개했습니다. 조로트는 이미지를 밑바닥부터 구축하며 작게 시작해서 크게 키워나가는 대신, 내부에서 외부로 이미지를 구축하여 넓은 구도와 미세한 세부 묘사를 정확히 동시에 만들어냅니다. 이는 마치 예술가가 대략적인 윤곽을 그린 뒤 나중에 채워 넣는 대신, 산맥의 굵은 획을 끊임없이 조정하면서 동시에 나무의 개별 잎사귀를 정교하게 다듬으며 캔버스 전체를 하나의 연속적인 동작으로 그려 나가는 것과 같습니다. 이것이 이 새로운 접근 방식의 핵심입니다. 시스템은 서로 끊임없이 소통하는 두 개의 병렬 프로세스를 실행합니다. 한 프로세스는 전반적인 레이아웃과 구도에 집중하여 장면이 전역적으로 타당하게 만듭니다. 다른 프로세스는 고해상도 세부 사항에 집중하여 특정 영역에 질감과 복잡성을 더합니다. 결정적으로, 이 두 프로세스는 별개의 것이 아닙니다. 이들은 생성되는 모든 단계에서 정보를 공유합니다. 레이아웃 프로세스는 세부 프로세에 요소들을 어디에 배치할지 알려주고, 세부 프로세는 진화하는 풍부함을 레이아웃 프로세로 다시 전달하여 전체 장면이 새로운 복잡성을 수용하고 적응할 수 있도록 합니다.

연구진은 강력한 이미지 생성기를 사용하여 이 방법을 테스트하고 기존의 최고 기술들과 비교했습니다. 그들은 배, 시계, 나무로 가득 찬 침수된 호텔 아트리움과 같이 다양한 물체와 환경을 포함하는 복잡한 묘사를 바탕으로 컴퓨터에 이미지를 생성하도록 요청했습니다. 결과는 놀라웠습니다. 조로트로 생성된 이미지는 단순히 크기만 큰 것이 아니라, 다른 방법들로 만든 이미지보다 훨씬 더 복잡하고 상세했습니다. 연구진이 이미지의 정보 밀도를 측정했을 때, 조로트의 창작물은 엄청난 세부 묘사의 증가를 보여주었으며, 일부 지표에서는 차순위 방법보다 50% 향상된 수치를 나타냈습니다. 더욱 중요한 점은, 이 이미지들이 일관성을 유지했다는 것입니다. 추가된 세부 사항들이 장면을 깨뜨리거나 혼란스럽게 만드는 대신, 마치 묘사된 세계의 자연스러운 일부처럼 느껴졌습니다. 또한 이 시스템은 사용자에게 새로운 종류의 통제권을 부여했습니다. 사용자는 간단한 설정을 조정함으로써, 전체 설명을 다시 쓸 필요 없이 최종 이미지를 얼마나 정교하게 만들지 결정하여 세부 묘사의 양을 높이거나 낮출 수 있었습니다.

이러한 개선 사항이 실제 사람들에게 의미가 있는지 확인하기 위해, 연구진은 참가자들이 조로트로 만든 이미지와 다른 선도적인 시스템들이 만든 이미지를 비교하는 연구를 수행했습니다. 참가자들은 일관되게 조로트 이미지를 선호했으며, 조로트 이미지가 더 상세하고, 시각적으로 더 복잡하며, 예술적으로 더 매력적이라고 느꼈습니다. 또한 그들은 추가된 세부 묘사가 정확도를 희생하지 않았음을 입증하듯, 조로트 이미지가 원래의 텍스트 묘사와 동일하게 잘 부합한다고 느꼈습니다. 이 연구는 고해상도 이미지 생성을 바라보는 기존의 방식, 즉 작게 시작하여 확장하려는 사고방식이 유일한 길은 아니라는 점을 시사합니다. 장면의 창조를 거대한 구도와 미세한 세부 사항이 함께 진화하는 단일하고 통합된 과정으로 취급함으로써, 규모가 거대하면서도 질감이 풍부한 이미지를 생성하는 것이 가능해집니다. 이는 예술가와 창작자들이 근거리 검사에서도 견딜 수 있는 이미지를 필요로 할 때, 컴퓨터를 단순한 그림을 만드는 도구에서 밀도 높은 고충실도의 세계를 생성할 수 있는 파트너로 변화시키는 새로운 가능성을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →