← 최신 논문
💬 NLP

Self-supervised User Profile Generation for Personalization

이 논문은 비싼 다운스트림 태스크 레이블의 필요성을 없애면서도 지도 학습 방식과 대등하거나 더 나은 성능을 달anim하면서, GRPO를 이용한 양방향 인배치 랭킹 목적 함수를 통해 대규모 언어 모델이 개인화를 위한 사용자 프로필을 생성하도록 학습시키는 자기지도 프레임워크인 BUMP를 소개한다.

원저자: Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao, Neil Shah

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao, Neil Shah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게는 매우 똑똑하지만 약간 건망증이 있는 비서(AI)가 있다고 상상해 보세요. 당신은 이 비서가 당신을 너무나 잘 알아서, 당신이 원하는 방식 그대로 이메일을 쓰고, 영화를 추천하고, 질문에 답할 수 있기를 바랍니다.

문제는 당신이 수년간 이 비서와 나눈 수천 번의 상호작용이 있다는 것입니다. 질문을 할 때마다 비서에게 당신의 전체 기록을 다 떠먹여 주려고 한다면, 비서는 과부하가 걸리고, 느려지며, 혼란에 빠질 것입니다. 이는 특정 책 한 권을 찾기 위해 도서관 전체를 읽으려는 것과 같습니다.

해결책: "사용자 ID 카드"
비서에게 도서관 전체를 쏟아붓는 대신, 각 사용자를 위한 짧고 자연스러운 언어로 된 "ID 카드" 또는 프로필을 만드는 것입니다. 이 프로필은 당신이 누구인지, 무엇을 좋아하는지를 요약합니다. 비서는 질문에 답하기 전에 이 짧은 카드를 읽음으로써, 마치 당신을 개인적으로 잘 아는 것처럼 느끼게 됩니다.

과거의 방식 vs 새로운 방식 (BUMP)

  • 과거의 방식: AI가 이러한 ID 카드를 쓰는 법을 가르치기 위해, 연구자들은 보통 모든 카드를 채점할 선생님이 필요했습니다. "이 카드는 영화 추천에 좋네,"라고 말하거나, "이건 이메일 작성에는 별로야"라고 말하는 식이죠. 이는 비용이 많이 들고 느리며, 새로운 작업이 생길 때마다 사람이 데이터를 라벨링해야 하는 번거로움이 있습니다.
  • 새로운 방식 (BUMP): 저자들은 BUMP(Bidirectional User Modeling via Profiles)라는 시스템을 만들었습니다. 이 시스템은 인간 선생님이나 라벨 없이도 AI가 프로필을 작성하도록 가르칩니다. 이는 "자기 점검(self-check)" 방식을 사용합니다.

BUMP의 작동 원리: "양면 거울" 테스트
사람들이 모여 있는 방(사용자 배치)을 상상해 보세요. AI는 A라는 사람의 프로필을 작성하려고 시도합니다. 이 프로필이 좋은지 확인하기 위해, AI는 고정된 작은 "판사(Judge)" AI를 사용하여 두 가지 테스트를 실행합니다.

  1. "누구인지 맞히기" 테스트 (순방향):
    AI는 판사에게 A의 새로운 프로필과 A 및 다른 사람들의 최근 활동 기록을 보여줍니다.

    • 질문: "이 프로필을 바탕으로, 다음 중 A의 활동은 무엇인가?"
    • 목표: 프로필이 훌륭하다면, 판사는 다른 사람들보다 A의 활동을 쉽게 골라낼 수 있어야 합니다.
  2. "나는 누구인가?" 테스트 (역방향):
    AI는 판사에게 A의 최근 활동 중 하나와 A 및 다른 사람들의 프로필 뭉치를 보여줍니다.

    • 질문: "이 활동을 바탕으로, 누구의 프로필이 가장 잘 맞는가?"
    • 목표: 프로필이 훌륭하다면, 판사는 즉시 A의 프로필을 다른 사람들의 프로필보다 우선하여 선택할 수 있어야 합니다.

AI가 이 두 가지 테스트를 모두 통과할 수 있다면, AI는 자신이 진정으로 그 특정 인물의 정체성을 포착하는 프로필을 작성했다는 것을 알게 됩니다. AI는 인간이 "잘했어"라고 말해주지 않아도, 판사로부터 점수를 받으며 이 테스트들을 통과하기 위해 반복해서 학습하며 성장합니다.

"하드 모드" 업그레이드 (BUMP+)
때때로 "판사"가 사람들을 구별하는 것을 너무 쉽게 느낄 때가 있습니다(예: 셰프의 프로필과 록 스타의 프로필을 비교하는 것은 너무 명확합니다). AI를 더 똑똑하게 만들기 위해, **BUMP+**는 "하드 모드"를 추가합니다. 이 시스템은 사용자들과 매우 유사한 사람들(예: 두 명의 셰프)을 특별히 찾아내어, AI가 그들을 구별할 수 있는 프로필을 쓰도록 강제합니다. 이는 프로필을 훨씬 더 정밀하게 만듭니다.

결과
연구진은 이 시스템을 표준 세트(LaMP)에서 테스트했습니다. 결과는 다음과 같습니다:

  • 이 자기 학습 시스템(BUMP+)은 값비싼 인간 라벨링이 필요한 시스템만큼, 혹은 그보다 더 뛰어난 성능을 보였습니다.
  • 상대적으로 작은 오픈 소스 모델로 구동되는 이 시스템은, 거대하고 비싼 폐쇄형 AI인 Gemini-3-Pro를 개인화 작업에서 능가했습니다.
  • 이 시스템은 긴 사용 기록을 짧고 유용한 요약본으로 압축함으로써, AI가 오랜 친구처럼 느껴지게 만듭니다.

요약하자면
BUMP는 인간이 직접 채점하는 것이 아니라, AI가 다른 사용자들 사이에서 "프로필과 인물을 매칭하는 게임"을 수행함으로써 완벽한 "사용자 전기"를 작성하도록 가르치는 방법입니다. 이는 AI가 더욱 개인적인 느낌을 주도록 만드는 더 스마트하고, 저렴하며, 확장 가능한 방식입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →