← 최신 논문
🤖 AI

Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

본 논문은 태스크 적응과 보상 기반 최적화를 분리함으로써 추천을 위한 파운데이션 모델을 비즈니스 지표에 효과적으로 정렬하는 3단계 점진적 사후 학습 프레임워크(선형 프로빙, 전체 미세 조정, 강화 학습 미세 조정)를 제안하며, 이는 오프라인 실험과 대규모 온라인 A/B 테스트 모두에서 우수한 성능을 입증하였다.

원저자: Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

게시일 2026-08-10
📖 5 분 읽기🧠 심층 분석

원저자: Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 마법 같은 도서관에 들어선다고 상상해 보세요. 그곳의 책들은 말을 할 수 있습니다. 이 도서관은 단순한 도서관이 아니라, 바로 "파운데이션 모델(Foundation Model)" 도서관입니다. 이 모델은 수십억 개의 이야기를 읽어본, 매우 똑똑하고 경험이 풍착한 사서와 같습니다. 이 사서는 이야기의 일반적인 규칙과 사람들이 책을 둘러볼 때 어떻게 행동하는지를 정확히 알고 있습니다. 이 사서는 이미 이야기의 일반적인 법칙과 인간의 호기심에 대해 학습한 상태입니다. 하지만 까다로운 점은, 사서가 책을 찾는 법을 안다고 해서 도서관 '주인'이 실제로 무엇을 원하는지까지 안다는 뜻은 아니라는 것입니다. 주인은 사람들이 도서관에 얼마나 오래 머무는지, 혹은 얼마나 많은 멤버십에 가입하는지에 관심이 있을 수도 있습니다. 단순히 선반에서 책을 몇 권 집어 드는 것만이 목적이 아닐 수도 있다는 것이죠.

컴퓨터 과학, 특히 **추천 시스템(Recommender Systems)**의 세계에서 이것은 매일 벌어지는 투쟁입니다. 우리는 거대한 사전 학습된 AI 모델(사서들)을 가지고 있으며, 이들은 당신이 다음에 무엇을 클릭할지 예측하는 데 탁월합니다. 하지만 비즈니스는 단순한 클릭 그 이상을 원합니다. 예를 들어, 만화 시리즈 전체를 끝까지 읽거나 프리미엄 콘텐츠에 결제하는 것과 같은 깊은 참여(engagement)를 원합니다. 문제는 '클릭'을 나타내는 신호는 어디에나 있고 찾기 쉬운 반면, '깊은 만족도'를 나타내는 신호는 희귀하고 찾기 어렵다는 것입니다. 만약 사서에게 이 희귀한 신호만을 쫓도록 가르치려 한다면, 사서는 혼란에 빠져 이미 알고 있던 것을 잊어버리고 이상한 것들을 추천하기 시작할 것입니다. 이 논문은 이 디지털 사서들이 단순히 클릭할 것을 추측하는 것을 넘어, 당신이 오랫동안 사랑할 수 있는 이야기를 찾도록 돕는 영리하고 단계적인 방법을 탐구합니다.


3단계 댄스: 추천 사서를 훈련시키는 법

NAVER WEBTOON의 연구진은 이 모든 것을 한꺼번에 가르치려 하는 것이 재앙의 레시피라는 것을 깨달았습니다. 그들은 "점진적 정렬(Progressive Alignment)" 프레임워크를 제안했는데, 이는 일반적인 목적의 AI를 비즈니스 감각을 갖춘 추천 전문가로 변모시키되, AI의 지능을 망가뜨리지 않도록 설계된 일종의 3단계 훈련 캠프입니다.

1단계: 워밍업 (선형 프로빙, Linear Probing)
당신에게 무엇이든 요리할 줄 아는 마스터 셰프(사전 학습된 파운데이션 모델)가 있다고 상상해 보세요. 당신은 그가 특정 새로운 요리를 만들기를 원하지만, 그가 기존의 요리법을 잊어버리게 하고 싶지는 않습니다. 만약 당신이 그에게 완전히 새로운 칼과 팬(다운스트림 모듈)을 쥐여주며 즉시 요리를 시작하라고 명령한다면, 그는 당황하여 기존의 기술을 망칠 수도 있습니다.

그래서 첫 번째 단계는 **선형 프로빙(LP)**입니다. 이 단계에서는 마스터 셰프의 두뇌를 얼려둡니다(frozen). 즉, 근본적인 요리 스타일은 바꿀 수 없습니다. 당신은 오직 새로운 칼과 팬을 사용하는 연습만 허용합니다. 이는 새로운 도구가 셰프의 손에 익숙해지도록 돕되, 핵심 레시피를 망치지 않게 합니다. 이는 마치 신입 사원이 불을 만지기 전에 일주일 동안 상사를 옆에서 지켜보며 배우는 것과 같습니다. 이는 AI의 방대한 지식과 특정 만화 추천 작업 사이의 연결을 안정화합니다.

2단계: 본격적인 연습 (전체 미세 조정, Full Fine-Tuning)
새로운 도구가 안정되면, 이제 셰프가 자유롭게 요리할 수 있도록 할 차례입니다. 이것이 **전체 미세 조정(FFT)**입니다. 이제 모델 전체의 잠금이 해제됩니다. 셰프는 이 특정 레스토랑의 메뉴에 특화되기 위해 자신의 전체 요리 스타일을 미세하게 조정할 수 있습니다. 1단계에서 이미 새로운 도구들이 워밍업되었기 때문에, 셰프는 압도당하지 않습니다. 셰프는 일반적인 지식이라는 탄탄한 기초를 유지하면서 고객의 구체적인 취향(다운스트림 태스크)을 배울 수 있습니다. 연구진은 이 과정을 한 번에 크게 도약하는 대신 두 단계(LP 후 FFT)로 나누어 진행하는 것이 훨씬 낫다는 것을 발견했습니다. 한 번에 하려고 하면 AI가 너무 구체적인 것에 집중하다가 똑똑함을 잃어버리는 "파괴적 망각(catastrophic forgetting)" 현상이 발생하기 때문입니다.

3단계: 보상 게임 (강화 학습 미세 조정, Reinforcement Fine-Tuning)
여기서 마법이 일어납니다. 셰프는 이제 메뉴에 맞춰 요리할 줄 알지만, 과연 '주인'이 원하는 요리를 하고 있을까요? 주인은 단순한 간식(단일 클릭)이 아니라 깊은 만족(예: 만화 시즌 전체 결제)을 원합니다. 하지만 깊은 만족은 드뭅니다. 대부분의 사람은 그냥 둘러보기만 할 뿐입니다.

만약 당신이 셰프에게 오직 희귀한 "깊은 만족"의 승리에만 집중하도록 가르치려 한다면, 셰프는 무작정 추측하기 시작할 것입니다. 대신, 연구진은 **보상 모델(Reward Model)**을 사용했습니다. 이것을 특별한 채점표를 가진 '맛 테스터'라고 생각하세요. 맛 테스터는 희귀하고 깊은 상호작용을 살펴보고 그들에게 "보상 점수"를 부여합니다.

세 번째 단계인 **강화 학습 미세 조정(RFT)**에서, 셰프는 단순히 대중을 즐겁게 하기 위해서가 아니라, 맛 테스터의 점수를 만족시키기 위해 요리합니다. AI는 일련의 추천 목록을 생성하고, 맛 테스터(보상 모델)는 그것이 깊은 참여로 이어질 가능성에 따라 점수를 매기며, AI는 더 높은 점수를 받기 위해 자신의 전략을 조정하는 법을 배웁니다. 결정적으로, AI는 2단계에서 배운 "조밀한(dense)" 신호(예: 클릭)를 여전히 사용하여 무엇을 추천할지 알지만, "보상" 신호는 장기적인 행복을 극대화하기 위해 그것들을 어떻게 순위 매길지 안내합니다.

그들이 발견한 것 (그리고 "아니오"라고 말한 것)

연구진은 이 3단계 방법을 Webtoon 플랫폼의 실제 사용자 상호작용 데이터셋을 통해 테스트했습니다. 그들은 이 새로운 방법을 기존의 방식들과 비교했습니다.

"이렇게 하지 마세요" 리스트:
논문은 두 가지 흔한 지름길에 대해 명시적으로 반대합니다:

  1. 희귀한 비즈니스 목표를 직접 학습시키지 마세요. 처음부터 "유료 콘텐츠 완독"을 최적화하도록 AI를 가르치려 하면 일반화에 실패합니다. 이는 학생에게 곱셈을 가르치기도 전에 고급 미적분을 풀라고 가르치는 것과 같습니다. 신호가 너무 희박하여 모델이 길을 잃게 됩니다.
  2. 보상 모델을 최종 추천기로 사용하지 마세요. 연구진은 "맛 테스터"(보상 모델)를 직접 추천을 내놓는 사람으로 사용하는 실험을 했습니다. 이 모델은 깊은 참여를 포착하는 데는 뛰어났지만, 수백만 개의 만화 중에서 클릭을 유도할 아이템을 골라내는 "변별력"은 부족했습니다. 논문은 보상 모델이 '플레이어'가 아닌 '코치'로서 가장 적합하다고 제안합니다.

승리하는 전략:
"점진적 정렬"(LP → FFT → RFT)이 가장 효과적이었습니다.

  • 오프라인 테스트: 과거 데이터를 통한 시뮬레이션 결과, 3단계 모델이 단일 단계 모델들을 압도했습니다. 특히, 학습된 보상 모델과 함께 GRPO(특정 유형의 강화 학습 알고리즘)를 사용한 버전이 가장 높은 점수를 기록했습니다. 이 모델은 높은 클릭률(Rank NDCG)을 유지하면서도 사용자를 콘텐츠의 더 깊은 단계로 유도하는 능력(Funnel NDCG)을 높였습니다.
  • 실제 환경에서의 증명: 그들은 시뮬레이션에서 멈추지 않았습니다. 실제 플랫폼에서 대규모 A/B 테스트를 실시했습니다. 그들은 새로운 AI를 기존의 일반적인 파운데이션 모델과 비교했습니다. 결과는 새로운 프레임워크가 사용자 참여를 지속적으로 개선한다는 것을 보여주었습니다. 특히 "보상 모델을 결합한 GRPO" 버전은 사용자가 더 오래 읽고 유료 에피소드에 도달하게 만드는 데 탁-월했으며, "DPO"(또 다른 알고리즘) 버전은 초기 클릭을 유도하는 데 약간 더 나은 모습을 보였습니다.

핵심 요약

이 논문은 강력한 AI 추천기를 만드는 비결이 단순히 더 많은 데이터를 쏟아붓거나 가장 어려운 목표를 즉시 최적화하는 데 있지 않다는 것을 시사합니다. 핵심은 단계입니다. 첫째, 새로운 도구를 안정화하십시오. 둘째, 모델을 전문화하십시오. 셋째, 학습된 "보상" 신호를 사용하여 모델이 좋은 즉각적인 선택을 하는 능력을 잃지 않으면서도 비즈니스의 장기적인 목표를 향하도록 부드럽게 유도하십시오.

"태스크를 배우는 것"과 "비즈니스 목표에 맞게 정렬하는 것"을 분리함으로써, 연구진은 AI가 똑똑하면서도 수익성을 갖추게 만드는 방법을 찾아냈습니다. 이는 때때로 최선의 결과를 얻기 위해서는 결승선을 향해 전력 질주하는 것이 아니라, 천천히 단계별로 나아가야 한다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →