← 최신 논문
💻 computer science

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

Poly-OPD는 픽셀 수준의 재인코딩과 DINOv2 감독을 통해 잠재 공간을 연결함으로써 서로 호환되지 않는 텍스트-이미지 모델들의 상보적인 강점들을 하나의 컴팩트한 플로우 매칭 학생 모델로 통합하고, 그래디언트 호환 어댑터와 간극 인식 커리큘럼을 채택하여 구성적 지시 이행 및 미적 정렬 모두에서 탁월한 성능을 달성하는 이종 다중 교사 온-폴리시 증류 프레임워크이다.

원저자: Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기계가 추측하고 수정하는 과정을 통해 학습하며 예술을 창조하는, 즉 텍스트 투 이미지 생성(text-to-image generation)이라 불리는 분야가 존재하는 세상을 상상해 보십시오. 이 디지털 아트 스튜디오에서 '선생님'은 단어를 그림으로 바꾸는 거대하고 복잡한 모델들입니다. 하지만 여기에는 함정이 있습니다. 인간 전문가와 마찬가지로, 이 기계들도 각기 다른 전문 분야를 가지고 있다는 점입니다. 어떤 모델은 눈부시게 아름답고 사실적인 장면을 만들어내는 거장 화가이지만, "고양이 세 마리"나 "왼쪽에 있는 빨간 공"과 같은 세밀한 디와일은 놓칠 수 있습니다. 반면, 어떤 모델은 지시 사항을 완벽하게 따르는 엄격한 회계사 같지만, 결과물이 다소 평면적이거나 이상해 보일 수 있습니다. 큰 문제는 이 전문가들이 내부적으로 서로 다른 '언어'를 사용한다는 것입니다. 그들은 그림을 그리기 위해 서로 다른 설계도와 수학적 방식을 사용하므로, 단순히 노트를 교환하거나 뇌를 쉽게 결합할 수 없습니다. 만약 당신이 아름다우면서도 완벽하게 정확한 이미지를 원한다면, 보통 두 대의 거대하고 비싼 컴퓨터를 동시에 실행해야 하는데, 이는 느리고 낭비적입니다. 과학자들은 이 서로 다른 전문가들을 하나의 더 작고 똑똑한 모델로 병합하여, 혼란 없이 두 가지 일을 모두 수행할 수 있는 방법을 찾아내기 위해 노력해 왔습니다.

이 논문은 두 개의 매우 다른 AI 선생님을 하나의 작고 응축된 학생 모델로 성공적으로 병합하는, 숙련된 번역가이자 코치 역할을 하는 Poly-OPD라는 영리한 새로운 방법을 소개합니다. 연구진은 '아름다운' 선생님(FLUX.1-dev)과 '정밀한' 선생님(Z-Image)을 가져와서, 더 작은 학생 모델(SD3.5의 25억 파라미터 버전)에게 두 가지 역할을 모두 수행하는 법을 가르쳤습니다. 이 마법 같은 기술의 핵심은, 학생에게 선생님들의 내부적인 생각(서로 호환되지 않는 언어)을 그대로 복제하도록 강요하는 대신, 학생이 그림을 그리게 하고 그 그림을 모두가 이해할 수 있는 공통된 '픽셀' 언어로 변환한 뒤 선생님에게 수정을 요청하는 방식에 있습니다. 선생님은 단순히 "잘했어"라고 말하는 데 그치지 않고, 실제로 그림을 다시 그려 실수를 바로잡으며, 학생은 그 교정 과정을 통해 학습합니다. 학생이 두 가지 스타일을 동시에 배우려다 혼란에 빠지지 않도록, 시스템은 뇌 안에 특수한 '전환 가능한(switchable)' 부분들을 사용합니다. 이 시스템은 전체적인 장면을 보는 것과 같은 일반적인 주의 집중(attention)을 담당하는 부분은 공유하되, 개수 세기나 색상 지정과 같은 특정 과업을 위한 부분은 별도로 유지합니다. 또한, 이 시스템은 무엇을 연습할지에 대해서도 영리합니다. 학생이 여전히 부족한 기술이 무엇인지 파악하여, 이미 알고 있는 것에 시간을 낭비하는 대신 부족한 부분에 더 많은 시간을 할애하여 훈련합니다.

결과는 매우 인상적입니다. 이 방법을 사용함으로써, 작은 학생 모델은 단순히 평균적인 수준에 머무는 것이 아니라, 특정 작업에서 두 거대한 선생님보다 더 뛰어난 성능을 보여주었습니다. "테니스 라켓 오른쪽에 있는 고양이"와 같이 복잡한 지시를 얼마나 잘 따르는지 확인하는 GenEval 테스트에서, 학생의 점수는 67.3에서 73.3으로 뛰어올라 120억 파라미터의 선생님과 60억 파라미터의 선생님을 모두 제쳤습니다. 시각적 아름다움과 인간 선호도를 측정하는 HPSv3 테스트에서도 점수가 9.34에서 11.35로 상승했습니다. 논문은 이러한 성공이 학생이 선생님의 완벽한 그림을 단순히 암기하는 것이 아니라, 자신의 실수를 선생님이 교정해 주는 과정을 통해 배우는 '온-폴리시(on-policy)' 접근 방식 덕분이라고 설명합니다. 연구진은 만약 학생에게 선생님의 내부 데이터를 직접 학습하도록 강요한다면, '언어'가 일치하지 않기 때문에 실패할 것이라는 점을 발견했습니다. 또한, 특수한 전환 가능한 부분을 사용하지 않을 경우 기술들이 서로 충돌하여 모델의 성능이 오히려 저하된다는 것도 발견했습니다. 궁극적으로, Poly-OPD는 하나의 작고 전환 가능한 모델이 아름다운 예술가와 정밀한 설계가 사이를 오가며, 두 대의 거대한 컴퓨터를 돌릴 필요 없이 두 세계의 장점만을 결합할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →