On-Policy Self-Distillation in Diffusion Models
이 논문은 이미지 수준의 보상을 확산 모델을 위한 명시적인 중간 감독 타겟으로 변환하는 온-폴리시 자기 증류 프레임워크인 DiffusionOPSD를 소개하며, 이는 기존 방법들과 비교하여 우수한 정렬 성능과 상당한 훈련 효율성 이득을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에는 "모자를 쓴 고양이"와 같은 단순한 문장을 생생한 이미지로 바꾸어, 아무것도 없는 허공에서 그림을 그려낼 수 있는 능력을 갖춘 일련의 시스템들이 늘어나고 있습니다. 디퓨전 모델(diffusion models)이라고 알려진 이 시스템들은 혼돈스러운 정적 노이즈 구름에서 시작하여, 단계적으로 이를 정화하여 선명한 그림이 나타날 때까지 점진적으로 깨끗하게 만드는 방식으로 작동합니다. 수년 동안 연구자들은 이러한 이미지들을 더 날카롭거나 사실적으로 만드는 데 집중해 왔습니다. 최근에는 목표가 변화하여, AI가 단순히 물체가 어떻게 보이는지를 넘어 인간이 무엇을 아름답거나 유용하다고 느끼는지까지 이해하도록 하여 인간의 선호도에 부합하게 만드는 데 초점을 맞추고 있습니다. 이러한 선호도를 모델에게 가르치기 위해 과학자들은 종종 강화 학습(reinforcement learning)이라는 방법을 사용합니다. 이 설정에서 AI는 이미지를 생성하고, 컴퓨터 프로그램은 그것이 원하는 결과와 얼마나 잘 일치하는지에 따라 점수를 매기며, AI는 그 점수를 바탕으로 다음 시도를 개선하려고 노력합니다. 그러나 이 과정에는 근본적인 문제가 존재합니다: 점수는 이미지가 완성된 아주 마지막 단계에서만 주어집니다. AI는 최종적인 좋은 점수에 도달하기 위해 자신의 중간 단계들—즉, 생성 과정 중의 지저지고 흐릿한 단계들—을 어떻게 조정해야 할지 추측할 수밖에 없는 처지에 놓입니다. 이는 마치 경기 도중의 구체적인 움직임에 대한 피드백 없이, 경기가 끝난 후에야 승패만을 통보받으며 복잡한 기술을 배우려는 것과 같습니다.
연구팀은 이 특정 문제를 해결하기 위해 DiffusionOPSD라고 불리는 새로운 방법을 도입했습니다. 이미지가 완성될 때까지 기다려 피드백을 주는 대신, 이들의 접근 방식은 과정을 관리 가능한 순간들로 나눕니다. 그들은 AI의 생성 과정을 일련의 스냅샷으로 취급합니다. 이미지를 생성하는 특정 초기 단계에서, 그들은 과정을 잠시 멈추고 만약 거기서 멈춘다면 이미지가 어떤 모습일지를 컴퓨터 프로그램이 평가하도록 요청합니다. 이 평가를 사용하여, 그들은 개선을 위한 정밀한 방향을 계산하여 AI가 목표로 삼을 수 있는 명확한 타겟을 만들어냅니다. 이 타겟은 단순히 모호한 제안이 아닙니다. 그것은 최종 결과물을 더 좋게 만들기 위해 현재의 예측을 어떻게 이동시켜야 하는지 정확히 알려주는 구체적이고 경계가 있는 지침입니다. 연구진은 그 후 AI가 이 타겟을 향해 움직이도록 훈련합니다. 결정적으로, 그들은 이를 루프(loop) 형태로 수행합니다: AI가 한 번 움직이면, 시스템은 AI 자신의 현재 행동을 바탕으로 새로운 타겟을 계산하고, AI는 다음 라운드를 위해 시스템이 자신의 이해도를 업데이트하기 전에 그 구체적인 지침으로부터 학습합니다. 이 순환 구조를 통해 AI는 먼 미래의 최종 결과가 아닌, 즉각적이고 실행 가능한 피드백으로부터 학습할 수 있습니다.
연구진은 이 방법을 두 가지 서로 다른 강력한 이미지 생성 시스템에 대해 테스트했습니다. 그들이 시도한 거의 모든 시나리오(열 가지의 이미지 품질 판단 방식 포함)에서, 이 새로운 방법은 기존의 가장 강력한 기술들보다 더 나은 결과를 만들어냈습니다. 20번의 비교 중 19번의 사례에서, 이 새로운 방식으로 훈련된 AI는 자동화된 점수 산정 시스템과 인간 평가자 모두로부터 더 높은 점수를 받은 이미지를 생성했습니다. 개선 정도는 상당했습니다. 어떤 경우에는 이전의 최고 방법과 비교했을 때 이미지의 품질이 거의 44%까지 향상되었습니다. 단순히 더 나은 그림을 만드는 것을 넘어, 이 새로운 접근 방식은 훨씬 더 효율적입니다. 이 방법은 한 시스템에서는 컴퓨팅 시간을 40% 적게 소요했고, 다른 시스템에서는 63% 적게 소 소요하며 이러한 결과를 달성했습니다. 이러한 효율성은 중요합니다. 왜냐하면 이러한 모델을 훈련하는 데는 보통 막대한 양의 에너지와 값비싼 하드웨어가 필요하기 때문입니다. 시간을 단축함으로써, 이 방법은 압도적인 비용 없이 특정 작업을 위해 이러한 도구들을 정교하게 다듬는 것을 더 실현 가능하게 만듭니다.
이 연구의 핵심적인 발견은 단순히 무엇을 개선해야 할지에 대한 더 나은 아이디어를 갖는 것만으로는 AI가 즉시 더 나아진다는 보장이 없다는 것이었습니다. 연구진은 두 가지 뚜렷한 것을 측정할 수 있다는 것을 발견했습니다: AI에게 주어지는 지침의 품질, 그리고 단 한 번의 훈련 단계 내에서 AI가 실제로 그 지침을 얼마나 잘 따랐는지의 여부입니다. 때로는 매우 강력한 지침이 아주 작은 개선만을 이끌어낸 반면, 더 약한 지침이 더 큰 개선을 이끌어내기도 했습니다. 이러한 분리를 통해 그들은 자신들의 방법의 성공이 명확한 지침을 만드는 것과, AI가 단 한 번의 과정 내에서 효과적으로 학습할 수 있도록 보장하는 것 모두에서 온다는 것을 확인할 수 있었습니다. 또한 그들은 AI가 이전에 생성했던 것과 똑같은 지저분한 이미지를 볼 필요가 있는지, 아니면 약간 다른 버전의 이미지를 보고 학습할 수 있는지도 테스트했습니다. 그들은 이미지의 출처가 결과에 거의 영향을 미치지 않는다는 것을 발견했습니다. 진정으로 개선을 이끄는 것은 피드백의 방향 자체였습니다. 이는 이 방법이 이미지의 구체적인 세부 사항에 의존하기보다는 가이드의 품질에 의존하는 견고한 방식임을 시사합니다.
연구진이 실제 생성된 이미지들을 살펴보았을 때, 차이는 명확했습니다. 이 새로운 방법으로 훈련된 AI는 특정 텍텍스트를 포함하거나, 물체의 정체성을 유지하거나, 움직임과 조명 효과를 포착하는 것과 같은 복잡한 지시를 따르는 데 더 뛰어났습니다. 일대일 비교에서, 인간 심사위원들은 이전의 최고 기술들보다 이 새로운 방법의 이미지를 다수의 경우에서 더 선호했습니다. 이미지들은 프롬프트와 더 일관적이었으며, 다른 방법들이 자주 놓치거나 왜곡하곤 하는 세부 사항들을 보존했습니다. 연구진은 또한 이 방법이 여러 목표를 동시에 처리할 수 있음을 입증했습니다. 그들은 하나의 AI가 세 가지 서로 다른 기준을 동시에 만족시키도록 훈련시켰으며, 그 결과 어느 하나도 성능을 희생하지 않고 세 가지 모두를 개선하는 데 성공했습니다. 이는 이 접근 방식이 하나의 이미지가 여러 방면에서 동시에 좋아져야 하는 복잡하고 현실적인 요구사항들을 처리할 수 있을 만큼 유연하다는 것을 보여줍니다.
이 작업은 이러한 강력한 시스템을 가르치는 방식의 전환을 의미합니다. 최종 점수를 명확한 중간 지침으로 변환함으로써, 연구진은 AI의 사고 과정을 단계별로 안내할 수 있는 방법을 제공했습니다. 이 접근 방식은 전통적인 방식의 추측을 피하고, 더 나은 결과로 가는 더 직접적이고 효율적인 경로를 허용합니다. 연구 결과는 이러한 모델을 훈련하는 미래가 복잡한 목표를 AI가 즉각적으로 이해하고 실행할 수 있는 작고 명시적인 단계들로 나누는 데 달려 있을 수 있음을 시사합니다. 이 방법은 마법이나 복잡한 기술에 의존하지 않습니다. 그것은 타겟을 설정하고, 거리를 측정하며, 한 걸음을 내딛는 명확하고 반복 가능한 과정에 의존합니다. 그 결과, 더 빠르게 학습하고, 에너지를 덜 사용하며, 인간의 의도에 더 충실한 이미지를 생성하는 시스템이 탄생했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.