← 최신 논문
💻 computer science

Multi-Stage Alignment of Large Language Models for Popularity Bias Mitigation in Generative Movie Recommendation

본 논문은 선호도 추출, 지도 미세 조정(supervised fine-tuning), 그리고 직접 선호 최적화(Direct Preference Optimization)를 결합한 다단계 정렬 파이프라인을 제안하여, 경쟁력 있는 정확도를 유지하면서도 LLM 기반 영화 추천 시스템의 인기 편향을 효과적으로 완화하고 신선도와 카탈로그 커버리지를 개선하는 것을 달성한다.

원저자: Subham Raj, Krishnakant Chourey, Sriparna Saha, Brijraj Singh, Niranjan Pedanekar

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Subham Raj, Krishnakant Chourey, Sriparna Saha, Brijraj Singh, Niranjan Pedanekar

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신에 대해 모든 것을 알고 있는 거대하고 마법 같은 도서관으로 걸어 들어간다고 상상해 보세요. 당신이 "나는 타임머신 소재의 SF 영화를 좋아해"라고 말하면, 도서관은 즉시 당신이 좋아할 만한 영화 10개의 목록을 속삭여 줍니다. 이것이 바로 거대한 컴퓨터 두뇌인 대규모 언어 모델(LLM)에 의해 구동되는 현대적 추천 시스템의 약속입니다. 이 모델들은 인터넷상의 거의 모든 책, 리뷰, 영화 줄거리를 집어삼킨 슈퍼 독서가와 같습니다. 그들은 언어와 맥락을 이해하는 데 매우 똑똑합니다. 하지만 이 슈퍼 독서가들에게는 은밀한 문제가 하나 있습니다. 바로 '유명세'에 집착한다는 것입니다. 그들은 너무나 많은 것을 읽었기 때문에, 어벤져스타이타닉이 어디에서나 언급된다는 사실을 알고 있으며, 그래서 모두에게 똑같은 인기 히트작들을 계속해서 추천합니다. 이는 당신이 실제로는 1974년의 기묘하고 무명인 인디 영화를 선호하더라도 말이죠. 이것은 마치 상위 5개의 관광 명소만 알고 있으며, 당신이 숨겨진 보석을 보여달라고 아무리 요청해도 거절하는 가이드와 같습니다. 이를 "인기 편향(popularity bias)"이라고 부르며, 이는 도서관을 지루하고 반복적으로 느껴지게 만들어, 당신에게 정말 완벽할 수도 있는 독특한 보물들을 숨겨버립니다.

이 논문의 연구자들은 이러한 유명세에 대한 집착을 고치기로 했습니다. 그들은 단순히 컴퓨터 두뇌에게 "더 노력하라"고 말하는 대신, 모델이 생각하는 방식을 재배선하기 위한 특별한 3단계 훈련 캠프를 구축했습니다. 첫째, 그들은 모델에게 사람들이 실제로 무엇을 좋아했는지 보여줌으로써(지도 미세 조정(Supervised Fine-Tuning) 단계) 훌륭한 사서가 되는 법을 가르쳤습니다. 그다음, 모델이 유명한 영화와 그만큼 흥미롭지만 덜 유명한 영화 사이에서 선택해야 하는 "이것 또는 저것" 게임을 진행하여, 숨겨진 보석을 선택했을 때 보상을 주었습니다(직접 선호도 최적화(Direct Preference Optimization) 단계). "도움이 되는 법을 배우는" 부분과 "다양성을 배우는" 부분을 분리함으로써, 그들은 단순히 남들이 다 본 영화가 아니라 당신이 실제로 즐길 수 있는 영화를 제안하는 시스템을 만들었습니다. 그들의 실험에 따르면, 이 새로운 방법은 어떤 경우에는 추천되는 인기 영화의 수를 절반으로 줄이면서도, 추천의 정확성과 재미를 그대로 유지했습니다.

3단계 해결책의 이야기

대규모 언어 모델(LLM)을 매우 유능하지만 약간은 속물적인 영화 평론가라고 생각해 보세요. 이 평론가는 수백만 개의 리뷰를 읽고 수천 편의 영화를 보았지만, 너무 많은 것을 보았기 때문에 나쁜 습관이 하나 있습니다. 바로 블록버스터 영화만을 추천한다는 것입니다. 만약 당신이 영화 추천을 요청한다면, 그들은 당신이 액션 영화를 싫어하고 조용한 다큐멘멘터리를 좋아할 수도 있다는 사실을 무시한 채, 역대 가장 인기 있는 영화 10편을 거의 항상 제안할 것입니다. 이것이 이 논문이 다루는 "인기 편향"입니다.

저자들은 단순히 모델에게 "더 다양해져라"라고 요구하는 것이 잘 작동하지 않는다는 것을 깨달았습니다. 대신, 그들은 모델이 더 나은, 더 공정한 가이드가 되도록 훈련하는 3막극과 같은 **다단계 정렬 파이프라인(Multi-Stage Alignment Pipeline)**을 설계했습니다.

제1막: 선호도 프로필 (설정)
훈련이 시작되기 전, 팀은 사용자의 기록—사용자가 높게 평가한 영화와 싫어한 영화—을 가져와 간단한 이야기로 바꿉니다. 컴퓨터에 복잡한 숫자 목록을 입력하는 대신, 그들은 *"이 사용자는 <대부>와 <인셉션>을 좋아하지만, <기기>와 <캣츠>는 싫어한다."*와 같은 프롬프트를 작성합니다. 이는 모델에게 사용자가 실제로 무엇을 좋아하는지에 대한 명확하고 인간적인 그림을 제공합니다.

제2막: 지도 미세 조정 (SFT) – 규칙 배우기
이 단계에서 모델은 신뢰할 수 있는 추천인이 되는 법을 배웁니다. 연구자들은 사용자의 이야기가 실제로 잘 맞으면서도 가장 인기 있는 것은 아닌 영화 목록과 짝을 이루는 수천 개의 사례를 모델에게 보여줍니다. 이것은 마치 선생님이 학생에게 "이 학생은 공포물을 좋아해. 여기 공포 영화가 있는데, <엑소시스트>는 아니야. 이 패턴을 외우렴."이라고 보여주는 것과 같습니다. 모델은 구조화되고 일관된 리스트를 생성하는 법을 배우지만, 이 시점에서는 아직 편향과 싸우는 것이 아니라 단지 지시를 따르는 법을 배우는 단계입니다.

제3막: 직접 선호도 최적화 (DPO) – 편향 파괴하기
이것이 마법 같은 단계입니다. 이제 모델이 리스트를 만드는 법을 알게 되었으므로, 그들은 모델이 '언더독(비주류)'을 선호하도록 가르칩니다. 그들은 모델이 동일한 사용자에 대해 두 가지 리스트를 보게 되는 게임을 만듭니다:

  • 리스트 A (거부된 리스트): 다섯 편의 매우 유명하고 주류적인 영화들.
  • 리스트 B (선호된 리스트): 덜 유명하지만 여전히 사용자의 장르에 완벽하게 부합하는 다섯 편의 영화들.

모델은 리스트 B가 "더 나은" 답이라는 것을 깨닫도록 훈련받습니다. 이것은 속물적인 평론가에게 "유명한 영화를 고르는 것은 틀렸어; 숨겨진 보석이 옳은 선택이야"라고 말하는 것과 같습니다. 이렇게 함으로써, 모델은 가장 유명한 아이템을 추천하려는 욕구를 능동적으로 억제하고 대신 틈새적이고 관련성 높은 콘텐츠의 가시성을 높이는 법을 배웁니다.

연구 결과

연구자들은 이 3단계 방법을 세 가지 다른 영화 데이터셋인 MovieLens 1M(클래식 데이터셋), Netflix Prize(극단적인 인기 편향이 있는 거대하고 무질서한 데이터셋), 그리고 Flickscore(인도 영화와 지역적 다양성에 초점을 맞춘 데이터셋)에서 테스트했습니다. 그들은 이 새로운 방법을 모델에게 그냥 추천을 요청하는 방식(Zero-Shot) 및 리스트를 만든 후 단순히 섞는 방식(Re-Ranking)과 비교했습니다.

결과는 매우 명확했습니다:

  • "속물적인" 모델: 그대로 두었을 때(Zero-Shot), 모델은 주로 유명한 영화를 추천했습니다. 예를 들어, Netflix 데이터셋에서 추천된 영화의 평균 인기 순위는 약 1,600이었습니다(매우 유명하다는 의미).
  • 새로운 방법: 3단계 훈련을 거친 후, 모델은 훨씬 더 다양한 영화를 제안하기 시작했습니다. Netflix 데이터셋에서 평균 인기 순위는 약 590으로 떨어졌습니다. 이는 모델이 훨씬 덜 유명하면서도 사용자에게는 여전히 관련성이 높은 영화들을 추천하기 시작했음을 의미합니다.
  • 정확도는 높게 유지됨: 가장 좋은 점은 모델이 정확성을 잃지 않았다는 것입니다. 모델은 단지 다양해지기 위해 무작위적인 쓰레기를 추천하기 시작한 것이 아닙니다. "정밀도(Precision, 추천이 실제로 얼마나 좋았는지)"는 거의 비슷하게 유지된 반면, "참신함(Novelty, 제안이 얼마나 새롭고 독특한지)"은 엄청난 폭으로 상승했습니다—Netflix 데이터셋에서 때때로 170% 이상 증가하기도 했습니다.

그들은 또한 이 새로운 방법이 "재순위화(Re-Ranking)" 기술보다 더 효과적이라는 것을 발견했습니다. 재순위화는 모델에게 리스트를 만들게 한 다음, 사람이나 단순한 컴퓨터 스크립트가 마지막에 유명한 영화를 무명 영화로 교체하는 방식입니다. 논문은 모델 자체를 (내재적 정렬을 통해) 처음부터 무명 영화를 원하도록 훈련시키는 것이, 단순히 마지막에 리스트를 수정하는 것보다 더 나은 결과를 낳는다는 것을 보여주었습니다.

이것이 왜 중요한가

이 논문은 우리가 정확한 추천 시스템과 공정한 추천 시스템 사이에서 하나를 선택할 필요가 없다는 것을 시사합니다. 훈련 과정을 단계별로 나누어—먼저 모델에게 사용자를 이해하는 법을 가르치고, 그다음 다양성을 가치 있게 여기도록 가르침으로써—우리는 당신에게 최신 슈퍼히어로 블록버스터를 다시 보라고 말하는 대신, 당신이 들어본 적 없는 다음 위대한 영화를 발견하도록 돕는 AI를 구축할 수 있습니다.

저자들은 이 방법이 잘 작동하지만, 모델을 훈련하는 데 많은 컴퓨터 자원이 필요하다고 언급했습니다. 또한 그들은 사용자의 기록이 전혀 없는 사용자("콜드 스타트" 문제)에 대해서는 테스트하지 않았으며, 이는 미래의 과제임을 지적했습니다. 하지만 이미 취향을 공유한 사용자들에게, 이 다단계 접근 방식은 영화 추천이 단순히 가장 인기 있는 아이템을 위한 판매 전략처럼 느껴지는 것이 아니라, 특별한 무언가를 발견하는 진정한 경험이 되도록 만드는 원칙적이고 확장 가능한 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →