Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging
Any-OPD는 고정된 모델 불가지론적 시각 표현과 연속적인 노이즈 레벨 매칭을 통해 임의의 잠재 플로우 매칭 모델 간의 이종 온-폴리스트 증류를 위한 새로운 프레임워크를 도입하며, 이를 통해 전통적인 잠재 회귀가 실패하는 지점에서 2.5B 규모의 학생 모델이 12B 규모의 교사 모델 성능에 필적할 수 있도록 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
예술가들이 단순히 붓으로 그림을 그리는 것이 아니라 수학으로 그림을 그리는 세상을 상상해 보십시오. 이것은 바로 AI 이미지 생성의 영역으로, 컴퓨터가 수백만 개의 사례를 학습함으로써 무에서 유를 창조하는 그림을 만드는 분야입니다. 이를 위해 현대의 AI 모델들은 **플로우 매칭(flow matching)**이라는 영리한 기법을 사용합니다. 이것은 마치 혼란스럽고 노이로 가득한 폭포(순수한 정적 상태)에서부터 잔잔하고 맑은 호수(완벽한 이미지)로 흘러가는 강물과 같습니다. AI는 그 강물의 정확한 경로를 학습하여, 어떤 노이즈의 방울이라도 아름다운 그림으로 안내할 수 있도록 합니다.
하지만 여기에는 문제가 있습니다. 가장 강력한 AI 예술가들은 거대하고 느릿느릿하게 움직이는 코끼리와 같습니다. 그들은 규모가 매우 크고, 실행하기 위해 슈퍼컴퓨터를 필요로 하며, 단 하나의 이미지를 생성하는 데에도 엄청난 시간이 걸립니다. 우리는 영리한 다람쥐와 같은 속도와 효율성을 원하면서도, 동시에 코끼리의 예술적 천재성을 갖고 싶어 합니다. 그 해결책은 **증류(distillation)**입니다. 즉, 작고 빠른 학생 모델에게 크고 느린 스승을 모방하도록 가르치는 것입니다. 하지만 문제는 보통 스승과 학생이 반드시 같은 언어를 사용해야 하고, 같은 내부 지도를 공유해야 하며, 같은 시계를 따라야 한다는 점입니다. 만약 그들이 서로 다른 "가족" 출신이라면, 그들은 서로 다른 방언을 사용하거나 서로 다른 시간대에 살고 있는 것과 마찬가지일 것입니다. 지금까지는 서로 다른 설계도를 가진 모델들 사이에서 다람쥐에게 코끼리가 되는 법을 가르치는 것은 불가능했습니다.
이 논문은 보편적인 번역가이자 시간을 조절하는 코치 역할을 하는 새로운 방법인 Any-OPD를 소개합니다. 연구진은 스승과 학생이 반드시 동일한 내부 지도나 시계를 공유할 필요가 없다는 사실을 발견했습니다. Any-OPD는 그들이 서로의 비밀스러운 내부 기록을 직접 비교하도록 강요하는 대신(그렇게 하면 상대방에게는 횡설수설처럼 들릴 것이기에), 이미지의 '의미'를 이해하는 제3의 "미술 비평가"(DINOv2라는 고정된 비전 모델)를 통해 최종적으로 만들어진 이미지를 비교하게 합니다.
연구팀은 이 방법을 테스트하기 위해 아주 작은 25억 파라미터 규모의 학생 모델(SD3.5-Medium)에게 거대한 120억 파라미터 규모의 스승(FLUX.1-dev)을 흉내 내도록 가르쳤습니다. 이 두 모델은 완전히 다릅니다. 서로 다른 내부 구조를 가지고 있으며, 노이즈를 처리하는 방식과 스케줄도 다릅니다. 기존 방식들은 이들의 내부 데이터를 직접 비교하려고 시도했으나, 이는 학습이 흐릿한 덩어리로 붕괴되는 결과를 초క 초래했습니다. 반면, Any-OPD는 공유된 "의미 공간"에서 최종 이미지만을 비교함으로써 이 문제를 우회했습니다.
결과는 놀라웠습니다. Any-OPD로 훈련된 작은 학생은 단순히 조금 더 나아진 수준이 아니라, 숙련된 예술가가 되었습니다. 학생 모델은 인간이 선호하는 이미지를 생성하는 능력(PickScore로 측정)을 0.846에서 0.884로 향상시켰으며, 인간 선호도 점수(HPSv3)는 9.12에서 10.97로 급증했습니다. 실제로 이 작은 학생은 거대한 120억 파라미터의 스승과 대등하거나, 경우에 따라서는 스승의 성능을 능가하기 시작했으며, 이 모든 것을 훨씬 적은 크기와 비용으로 해냈습니다.
이 논문은 모델의 종류가 다를 때 단순히 가공되지 않은 내부 데이터(latents)나 픽셀 단위의 세부 사항을 비교해서는 안 된다는 점을 명시적으로 밝히고 있습니다. 연구진은 서로 다른 모델 패밀리 간에 직접적인 "픽셀 회귀(pixel regression)"를 시도하는 것이 학습을 완전히 실패하게 만든다는 것을 보여주었습니다. 대신, 학생 모델을 먼저 고정(anchoring)한 다음 노이즈 레벨 매칭 시스템을 사용하여 시간상의 단계를 정렬함으로써, 모델이 얼마나 다르든 상관없이 지식을 성공적으로 전수할 수 있음을 증명했습니다. 이는 미래에 우리가 단 하나의 거대한 AI에 갇혀 있지 않을 것임을 시사합니다. 즉, 누가 만들었든 상관없이 최고의 스승을 데려와서, 우리가 배포하고자 하는 어떤 작은 모델이라도 그만큼 훌륭하게 만들 수 있게 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.