← 최신 논문
💻 computer science

Pixel-Space Diffusion via Observation Operators

이 논문은 고정된 전체 이미지 감독을 가우시안-랜초스 연산자를 사용한 시간 인덱스 기반의 조대-세밀 관측 궤적으로 대체함으로써 픽셀 공간 모델의 스케일-시간 불일치를 해결하는 프레임워크인 Observation Operator Diffusion을 소개하며, 이를 통해 수렴을 가속화하고 최첨단 생성 품질을 달성한다.

원저자: Shaojie Guo, Lichen Ma, Haoyang Tong, Yu He, Zipeng Guo, Xiaoan Liu, Feng Yan, Yu Guo, Fei Wang, Junshi Huang, Yan Wang

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shaojie Guo, Lichen Ma, Haoyang Tong, Yu He, Zipeng Guo, Xiaoan Liu, Feng Yan, Yu Guo, Fei Wang, Junshi Huang, Yan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 컴퓨터는 단지 단어 목록만으로 그림을 그리는 법을 배우고 있습니다. 수년 동안 이 디지털 영역에서 가장 성공적인 예술가들은 마치 조각가가 세부 사항을 다듬기 전 거친 돌덩이를 먼저 깎아내는 것과 유사하게, 압축된 추상적 공간에서 작업해 왔습니다. 그들은 이미지의 단순화된 버전을 만든 다음, 별도의 도구를 사용하여 그 스케치를 고해상도 사진으로 변환합니다. 이 방식은 효과적이긴 하지만, 변환 과정에서 원래의 질감과 선명함을 필연적으로 일부 상실하게 됩니다. 더 새로운 방식인 직접적인 접근법은 처음부터 픽셀 단위로 최종 이미지를 생성하려고 시도하며, 이는 기존 방식이 따라올 수 없는 수준의 명료함을 약속합니다. 그러나 이 직접적인 경로는 숙달하기가 매우 까다로워, 종종 흐릿하거나 불안정한 결과물을 만들어내며 완성하는 데 엄청난 시간이 걸리곤 합니다.

핵심적인 문제는 이러한 모델들이 보는 법을 배우는 방식에 있습니다. 짙은 안개 속에 서 있는 상태에서 누군가에게 멀리 보이는 산맥을 설명하려고 노력한다고 상상해 보십시오. 처음에는 산봉우리의 넓고 휩쓸리는 듯한 형태만을 간신히 알아볼 수 있습니다. 안개가 걷히면서 나무와 바위의 세부 사항들이 보이기 시작합니다. 만약 안개가 여전히 짙은 상태에서 모든 잎사귀와 돌 하나하나를 설명하려 한다면, 당신은 무모하게 추측할 것이고 당신의 설명은 오류로 가득 찰 것입니다. 이것이 바로 현재 세대의 픽셀 기반 이미지 생성기 내부에서 일어나는 현상입니다. 이들은 노이즈라는 '안개'가 여전히 짙은 상태에서도 이미지의 미세한 디테일을 예측해야 하는 상황에 처해 있으며, 전체 그림을 한꺼번에 예측하려고 합니다. 이 시점에서 컴퓨터가 실제로 볼 수 있는 것과 예측하도록 요구받는 것 사이의 불일치는 혼란스러운 신호를 만들어내어 학습을 늦추고 최종 품질을 저하시킵니다.

동화대학교(East China Normal University)와 JD.com의 연구진은 이 특정한 혼란이 모델 학습 방식의 근본적인 결함임을 확인했습니다. 그들은 이미지 구조가 흐릿한 상태에서 선명한 상태로 자연스럽게 나타나며, 이 과정에는 시간이 걸린다는 점을 발견했습니다. 그러나 기존 모델들은 이러한 자연스러운 순서를 무시합니다. 그들은 입력값이 여전히 대부분 무작위 노이즈인 상태에서도 컴퓨터에게 완전하고 선명한 이미지를 예측하도록 요구합니다. 이는 모델이 아직 복구할 수 없는 디테일에 매달리게 만들어 혼란스러운 학습 경험을 초래합니다. 이를 해결하기 위해 연구팀은 이미지 복구의 자연스러운 타임라인을 존중하는 새로운 학습 방법을 개발했습니다. 모델에게 모든 것을 한 번에 보라고 요구하는 대신, 시간에 따라 변화하는 일련의 렌즈를 통해 이미지를 보도록 가르치는 것입니다.

연구진은 컴퓨터가 예측하고자 하는 목표물이 노이즈와 함께 진화하는 시스템을 도입했습니다. 이미지가 매우 노이즈가 많은 초기 단계에서는 모델에게 장면의 넓고 거친 형태만을 예측하도록 요청합니다. 노이즈가 점차 제거됨에 따라 목표물은 변화하며, 모델에게 약간 더 많은 디테일을 추가하도록 요구하고, 그다음에는 더 많은 것을, 마침내 마지막 단계에 이르러서야 완전한 고해상도 이미지를 예측하도록 요청합니다. 이는 조정 가능한 렌즈 역할을 하는 일련의 수학적 필터를 사용하여 달성됩니다. 이 필터들은 이미지를 매끄럽게 처리하여 처음에는 큰 구조만을 보여주고, 점진적으로 미세한 질감을 드러냅니다. 예측의 난이도를 실제로 눈에 보이는 수준에 맞춤으로써, 컴퓨터는 훨씬 더 명확한 신호를 받게 되어 훨씬 빠르고 효과적으로 학습할 수 있습니다.

이 원칙이 시간뿐만 아니라 컴퓨터의 내부 구조 내에서도 작동하도록 하기 위해, 연구팀은 모델의 내부적인 생각을 최종 사진으로 바꾸는 역할을 하는 구성 요소인 새로운 디코더를 구축했습니다. 이 새로운 디코더는 데이터가 네트워크를 통과함에 따라 큰 그림에서 세부 사항으로 정교화되는 계층 구조로 정보를 처리하도록 설계되었습니다. 이는 각 단계에 특정 구조적 정보를 주입하여, 모델이 적절한 깊이에서 적절한 수준의 디테일에 집중할 수 있도록 보장합니다. 이를 통해 전역적인 레이아웃이 먼저 확립된 후 질감과 가장자리가 점진적으로 추가되는 응집력 있는 흐름을 만들어내며, 이는 노이즈 제거 과정 중에 이미지가 드러나는 방식과 일치합니다.

이 접근 방식의 결과는 놀랍습니다. 수천 개의 서로 다른 객체를 포함하는 표준 이미지 세트로 테스트했을 때, 새로운 방법은 이전의 직접 픽셀 생성 시도들보다 훨씬 더 선명하고 사실적인 이미지를 생성했습니다. 한 핵심 테스트에서 이 모델은 단 80회의 학습 사이클 만에 최첨단(state-of-the-art) 품질 점수에 도달했는데, 이는 이전 모델들보다 상당히 빠른 속도입니다. 추가 학습을 통해 이 모델은 다른 모든 직접 픽셀 기반 방식들을 능가하는 1.52의 품질 점수를 달성했습니다. 생성된 이미지들은 동물의 털 질감이나 꽃의 섬세한 구조와 같은 복잡한 디테일과 전체적인 구성을 모두 포착하는 탁월한 능력을 보여주며, 이 유형의 인공지능을 흔히 괴롭히는 흐릿함 없이 구현해 냈습니다.

이 연구는 더 나은 이미지 생성을 위한 길이 단순히 더 크거나 복잡한 컴퓨터를 만드는 것이 아니라, 정보가 명확해지는 자연스러운 순서를 이해하는 데 있음을 시사합니다. 디테일이 노이즈로부터 나타나는 타임라인을 존중함으로써, 연구진은 더 효율적으로 학습하고 더 높은 품질의 결과를 만들어내는 시스템을 구축했습니다. 이 방법은 수학적 노이즈의 추상적인 세계와 고해상도 사진의 구체적인 현실 사이의 간극을 성공적으로 메웠으며, 때때로는 전체 그림을 보는 가장 좋은 방법이 큰 형태부터 살펴보는 것임을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →