← 최신 논문
🤖 machine learning

Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

이 논문은 베이지안 최적화를 사용하여 디퓨전 모델의 샘플링 타임스텝을 직접 튜닝함으로써, 다양한 작업과 샘플러에 걸쳐 높은 생성 품질을 유지하면서도 추론 비용을 크게 절감하는 학습 불필요(training-free) 방식인 OYS(Optimizing Your Sampling)를 소개한다.

원저자: Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger

게시일 2026-08-19
📖 5 분 읽기🧠 심층 분석

원저자: Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 최근 한 특정 유형의 컴퓨터 프로그램이 오직 설명(텍스트)만으로 이미지를 만들어내는 법을 배웠습니다. 디퓨전 모델(diffusion models)이라고 알려진 이 프로그램들은 오래된 텔레비전의 눈보라 같은 무작위 정적(static)으로 가득 찬 화면에서 시작하여, 선명한 그림이 나타날 때까지 점진적으로 이를 깨끗하게 만드는 방식으로 작동합니다. 그 노이즈를 인식 가능한 고양이, 풍경, 또는 사람으로 바꾸기 위해, 컴퓨터는 많은 작은 단계들을 거치며 각 단계마다 자신의 작업을 확인하고 이미지를 조정해야 합니다. 이 과정은 매우 강력하여 기계가 멋진 예술 작품과 유용한 디자인을 만들어낼 수 있게 해주지만, 동시에 매우 느립니다. 단 하나의 이미지를 만드는 데도 컴퓨터가 수천 번의 계산을 수행해야 하는 경우가 많아, 비용이 많이 들고 시간이 오래 걸립니다. 수년 동안 연구자들은 최종 이미지의 품질을 잃지 않으면서 더 적은 움직임으로 선명한 그림에 도달하기 위해, 어떻게 하면 이 단계를 더 효율적으로 줄일 수 있을지 고민하며 더 나은 방법들을 찾아왔습니다.

코넬 대학교의 연구팀은 컴퓨터가 어떤 단계를 밟을지 결정하는 방식을 바꿈으로써 이 문제를 해결할 새로운 방법을 찾아냈습니다. 노이즈를 제거하기 위한 표준화된 사전 작성 계획을 따르는 대신, 그들은 단계의 선택을 스마트한 탐색 알고리즘이 풀어야 할 퍼즐로 취급했습니다. 그들은 '최적의 샘플링(Optimizing Your Sampling, OYS)'이라 불리는 방법을 개발했는데, 이는 최상의 결과를 만들어내는 최적의 패턴을 찾기 위해 수천 개의 서로 다른 단계 패턴을 자동으로 테스트하는 방식입니다. 연구진은 가장 효율적인 경로가 이전에 누구도 예상하지 못했던 경로라는 것을 발견했습니다. 기존의 방법들이 단계를 균등하게 배분하거나 엄격한 수학적 공식을 따르려 했던 반면, 이 새로운 방법은 이미지가 여전히 노이즈 상태인 초기 단계의 지저받고 혼란스러운 부분에 더 많은 시간을 할애하도록 학습되었습니다. 이 단순한 변화 덕분에 컴퓨터는 보통 필요한 단계의 아주 일부분만을 사용하여 고품질의 이미지를 생성할 수 있었습니다.

연구진은 이 아이디어를 오늘날 가장 인기 있는 모델들을 포함한 여러 가지 이미지 생성 모델에 테스트했습니다. 그들은 컴퓨터에게 "사원 옆에 우주선이 착륙하는 그림"이나 "큰 눈을 가진 행복한 수선화"와 같은 텍스트 프롬프트를 바탕으로 그림을 생성하도록 요청했습니다. 이 테스트에서 그들은 자신들의 새로운 방법을 표준적인 이미지 생성 방식 및 복잡한 수학을 사용하여 과정을 개선하려 했던 또 다른 최근 기술과 비교했습니다. 결과는 명확했습니다. 새로운 방법이 일관되게 더 나은 이미지를 만들어냈습니다. 컴퓨터가 보통 50단계를 사용하는 대신 단 5단계만 사용하도록 강제했을 때, 새로운 방법은 긴 과정의 품질을 거의 그대로 유지한 반면, 표준 방식은 흐릿하거나 왜곡된 결과를 만들어냈습니다. 실제로 이 새로운 방법은 매우 적은 단계로 작업할 때조차 인간이 표준 방식보다 더 선호하는 이미지를 만드는 데 80% 이상의 높은 확률로 성공했습니다.

이 발견이 특히 흥미로운 점은 컴퓨터가 이 문제를 어떻게 학습했는가 하는 방식에 있습니다. 연구진은 컴퓨터에게 새로운 규칙을 가르치거나 새로운 방정식을 써준 것이 아니었습니다. 대신, 컴퓨터가 다양한 단계 스케줄을 시도하고, 각 스케줄에 대해 이미지를 생성한 뒤, 그 이미지가 설명과 얼마나 잘 일치하는지와 얼마나 보기 좋은지를 기준으로 점수를 매기도록 했습니다. 컴퓨터는 이 점수를 활용해 탐색을 유도하며 최적의 스케줄로 점차 좁혀나갔습니다. 연구진이 승리한 스케줄을 살펴보았을 때, 그들은 놀라운 패턴을 발견했습니다. 컴퓨터는 이미지가 매우 노이즈가 심한 상태일 때 더 많은 단계를 밟기로 결정했고, 이미지가 이미 대부분 깨끗해졌을 때는 단계를 덜 밟기로 결정했습니다. 이는 많은 전문가들의 예상과는 정반대되는 결과였습니다. 기존의 방법들은 단계를 균등하게 배치하거나 마지막의 깨끗한 단계에 더 집중하는 경절을 보였기 때문입니다. 이 새로운 방법은 혼란스러운 시작 단계에 더 많은 노력을 쏟는 것이 결과적으로 훨씬 더 나은 결과를 낳는다는 것을 입증했습니다.

연구팀은 이 방법을 이미지의 손상된 부분을 복구하거나 단순한 스케치를 사실적인 사진으로 바꾸는 것과 같은 다른 작업에도 적용했습니다. 모든 경우에서 새로운 방법은 출력물의 품질을 향상시켰습니다. 이 방법은 더 빠르게 실행되도록 이미 단순화된 모델에서도 똑같이 잘 작동했는데, 이는 이 이점이 모델 자체를 변경하는 것이 아니라 단계가 선택되는 방식에서 온다는 것을 보여줍니다. 연구진은 최적의 스케줄을 찾는 과정에서 수천 장의 이미지를 생성해야 했지만, 이 비용은 단 한 번만 지불하면 된다고 언급했습니다. 일단 최적의 스케줄이 발견되면, 이를 사용하여 향후 이미지를 훨씬 더 빠르고 저렴하게 만들 수 있기 때문입니다. 이 연구는 지난 수년간 컴퓨터 과학계가 노이즈를 제거하는 데 있어 일률적인 접근 방식을 사용해 왔으며, 작업의 구체적인 요구에 맞춰 조정된 접근 방식이 훨씬 더 뛰어난 성능을 끌어낼 수 있음을 시사합니다.

가장 눈에 띄는 발견 중 하나는 이 새로운 방법의 효율성이었습니다. 연구진은 최근의 다른 시도들보다 훨씬 적은 컴퓨터 자원을 사용하여 최적의 스케줄을 찾을 수 있다는 것을 발견했습니다. 일부 이전 방법들은 좋은 스케줄을 찾기 위해 수백만 번의 이미지 생성을 필요로 했던 반면, 이 새로운 접근 방식은 종종 단 몇 천 번의 생성만으로도 해결책을 찾아냈습니다. 이러한 효율성은 이 방법이 막대한 컴퓨팅 파워를 요구하지 않고도 다양한 유형의 이미지 생성기에 적용될 수 있음을 의미합니다. 연구진은 이것이 모든 문제에 동일하게 작동하는 보편적인 해결책은 아니며, 오히려 전문가들이 자신의 구체적인 필요에 맞는 최적의 설정을 훨씬 더 쉽게 찾을 수 있게 해주는 도구라고 강조했습니다. 이론에 근거해 추측하는 대신, 단계를 최적화하는 문제로 직접 다룸으로써 그들은 더 빠르고 고품질의 이미지 생성을 가능하게 하는 길을 열었습니다.

이 연구의 함의는 단순히 그림을 더 빠르게 만드는 것을 넘어섭니다. 이는 컴퓨터의 노력과 결과의 품질 사이의 관계를 우리가 어떻게 생각하는지를 변화시킵니다. 이 연구는 수년간 사용되어 온 표준적인 방식이 잠재적인 품질을 많이 놓치고 있다는 것을 보여줍니다. 단순히 컴퓨터가 언제 주의를 기울일지를 재배열하는 것만으로도, 근본적인 기술을 바꾸지 않고 훨씬 더 나은 결과를 얻을 수 있습니다. 이는 인공지능의 많은 분야에서, 프로세스 자체만큼이나 그 프로세스를 어떻게 가이드하느냐가 중요하다는 것을 시사합니다. 연구진은 자신들의 방법이 다른 이들에게도 다른 복잡한 과업에서 유사한 최적화를 찾아보도록 독려하기를 바라며, 때로는 앞으로 나아가는 가장 좋은 방법이 우리가 도달하기 위해 밟는 단계들을 재고하는 것임을 증명하고자 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →