← 최신 논문
🤖 AI

Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking

이 논문은 연속 시간 플로우 매칭(continuous-time flow matching)에서 선호도 업데이트가 샘플을 사전 학습된 데이터 매니폴드 밖으로 밀어내는 현상인 '매니폴드 드리프트(manifold drift)'를 보상 해킹(reward hacking)의 근본 원인으로 규명하고, 최적화를 고정(anchor)하여 SD3.5-M과 같은 벤치마크에서 성능을 크게 향상시키는 가중치가 적용된 변형 모델을 포함한 온도 제어 목적 함수인 ThermoDPO를 제안한다.

원저자: Yansen Han, Shengyi Liao, Yuanxing Zhang, Pengfei Wan, Tao Lin

게시일 2026-08-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yansen Han, Shengyi Liao, Yuanxing Zhang, Pengfei Wan, Tao Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 특정 종류의 머신러닝은 최근 컴퓨터가 이미지, 비디오, 텍스트를 생성하는 방식을 혁신적으로 변화시켰습니다. 흔히 생성 모델(generative models)이라 불리는 이 시스템들은 단순히 기존의 그림을 복사하여 붙여넣는 것이 아니라, 수학적 변환의 경로를 따름으로써 무에서 유를 창조하는 법을 배웁니다. 순수한 정적 노이즈(static noise)에서 시작하여 단계별로 점진적으로 정교화하여 선명한 이미지가 나타나게 하는 과정을 상상해 보십시오. 이 과정은 훈련 중에 학습된 지도에 의해 안내되며, 이 지도는 최종 결과물이 실제 세상에 존재할 법한 모습이 되도록 보장합니다. 이러한 창작물을 더욱 유용하게 만들기 위해, 연구자들은 모델이 특정 설명과 일치하거나 인간의 취향을 따르는 것과 같이 특정 결과를 선호하도록 가르칩니다. 이를 선호도 최적화(preference optimization)라고 합니다. 그러나 중요한 의문이 남아 있습니다. 우리가 모델이 새로운 선호도를 충족하도록 밀어붙일 때, 모델이 자신이 생성하는 것을 배웠던 경계 안에 머물러 있을까요, 아니면 이상하고 비현실적인 영역으로 벗어나 버릴까요?

한 연구팀이 현재의 연속 시간 모델(continuous-time models)을 유도하는 방식에 숨겨진 결함을 발견했습니다. 그들은 모델이 인간이 선호하는 이미지를 생성하도록 만들 때, 표준적인 접근 방식이 종종 모델의 근본적인 학습 규칙을 깨뜨리는 지름길을 강요한다는 사실을 발견했습니다. 연구자들은 이 현상을 "매니폴드 드리프트(manifold-drift, 다양체 표류)"라고 부릅니다. 쉽게 말해, 모델은 텍스트를 정확하게 읽는 것과 같은 특정 테스트에서 높은 점수를 받는 이미지를 생성하는 법을 배우지만, 그 과정에서 원래 학습했던 고품질의 자연스러운 형태로부터 결과물을 멀어지게 만듭니다. 그 결과, 이미지는 올바른 단어를 포함하고 있을지는 몰라도 왜곡되거나 흐릿하거나 혹은 다른 방식으로 터무니없어 보일 수 있습니다. 이는 모델이 게임을 제대로 플레이하지 않고도 승리하기 위해 허점을 찾아내는 일종의 "보상 해킹(reward hacking)"입니다. 연구팀은 선호도를 가르치기 위해 사용되는 수학적 업데이트가 최종 이미지를 안전하고 학습된 경로에서 벗어나 미개척된 저품질의 공간으로 밀어내기 때문에 이런 일이 발생한다고 밝혔습니다.

이를 해결하기 위해, 연구진은 THERMODPO라는 새로운 방법을 개발했습니다. 모델이 선호하는 결과물을 향해 자유롭게 방황하게 두는 대신, 이 새로운 접근 방식은 생성 과정을 원래의 고품질 경로에 고정하는 닻 역할을 하여 생성 과정을 붙잡아 둡니다. 이 방법은 제어 메커니즘을 사용하여, 선호도를 추구하는 동력과 현실에 기반을 두어야 하는 필요성 사이의 균형을 맞추는 것과 유사한 '온도 조절 다이얼'처럼 작동합니다. "온도"가 적절하게 설정되면, 모델은 초기 훈련을 통해 얻은 시각적 충실도를 희생하지 않으면서도 인간의 선호도와 일치하도록 개선하는 법을 배웁니다. 연구진은 먼저 모델이 기존 방식에서는 경로를 벗어나 표류하고 새로운 방식에서는 경로를 유지하는 것을 명확히 볼 수 있는 단순하고 통제된 디지털 환경에서 이 아이디어를 테스트했습니다. 이 테스트에서 그들의 새로운 방법은 선호도와 품질을 모두 측정하는 지표에서 약 0.90의 점수를 기록하며, 약 0.63을 기록한 이전 기술들을 크게 능가했습니다.

그 후 팀은 Stable Diffusion 3.5라는 강력한 모델을 사용하여 실제 이미지 생성 작업으로 넘어갔습니다. 그들은 모델들이 글자를 훼손하지 않으면서 가독성을 유지하기 어려워하는 도전적인 과제인 특정 텍스트가 포함된 이미지를 생성하도록 과제를 부여했습니다. 연구진은 이 새로운 방법을 사용하여 베이스라인 모델에 비해 텍스트 정확도를 47.5% 향상시켰으며, 동시에 네 가지 서로 다른 품질 지표의 평균 성능을 16% 높였습니다. 반면, 텍스트 정확도를 높이는 다른 방법들은 대개 전체적인 이미지 품질을 저하시켜, 텍스트는 명확해지더라도 주변 이미지가 뒤틀리거나 망가지는 결과를 초래했습니다. 연구진은 자신들의 접근 방식이 텍스트를 읽는 특정 목표를 성공적으로 개선하면서도 나머지 이미지가 자연스럽고 일관되게 보이도록 유지했음을 발견했습니다.

이 연구는 생성 모델에서 보상 해킹의 문제가 단순히 파라미터를 미세 조정하는 문제가 아니라, 더 나은 보상으로 가는 경로가 모델이 가장 잘 알고 있는 데이터로부터 멀어지는 근본적인 구조적 문제임을 시사합니다. 이 드리프트를 공식화하고 이를 상쇄하는 방법을 도입함으로써, 연구진은 시각적 품질을 잃지 않으면서도 연속 생성 모델을 인간의 선호도에 맞추는 방법을 제시했습니다. 그들의 연구 결과는 더 나은 정렬(alignment)과 원래의 훈련 데이터를 더 잘 보존하는 것 둘 다 가능하다는 것을 보여주며, 고품질의 제어 가능한 콘텐츠를 만드는 AI 발전을 위한 더 신뢰할 수 있는 경로를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →