← 최신 논문
🤖 AI

Navigating User Behavior toward Personalized Multimodal Generation

본 논문은 행동 인코딩과 지시문 작성의 문제를 극복하기 위해 이중 식별자와 2단계 SFT+RL 파이프라인을 채택하여, 사용자 상호작용 이력을 개인화된 멀티모달 생성을 위한 실행 가능한 지시문으로 변환하는 프레임워크인 NaviGen을 제안한다.

원저자: Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 매우 재능 있고 최첨단 기술을 갖춘 예술가(AI)가 있다고 상상해 보세요. 이 예술가는 당신의 지시에 따라 아름다운 그림을 그리거나 놀라운 영상을 만들 수 있습니다. 문제는 이 예술가가 지나치게 문자 그대로만 이해한다는 점입니다. 만약 당신이 "판타지 장면을 그려줘"라고 말한다면, 그들은 당신의 구체적인 취향과 일치하지 않는 평범한 것을 그릴 수도 있습니다. 대부분의 사람들은 전문 예술가가 아니기에, 자신이 원하는 것을 정확히 얻기 위해 필요한 완벽하고 상세한 지침을 작성할 수 없습니다.

거대한 문제:
우리는 사용자가 실제로 좋아하는 것(클릭, 시청, 구매 등을 기반으로 함)과 AI에게 무엇을 만들라고 말하는 데 필요한 구체적인 지침 사이에 거대한 간극이 존재합니다. 사용자들은 "황혼 무렵의 입체적인 안개가 깔린 로마 콜로세움의 시네마틱 와이드 샷을 그려줘"라고 말하는 대신, 그저 멋진 영상 몇 개를 클릭하거나 게임을 몇 개 구매할 뿐입니다. AI는 이러한 클릭들을 어떻게 완벽한 지침으로 번역할지 알아내야 합니다.

해결책: NaviGen
연구진은 당신의 과거 행동과 AI 예술가 사이의 "번역가" 역할을 하는 NaviGen(Navigation + Generation)이라는 시스템을 만들었습니다. 이것이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 이중 ID 시스템 (The "Name Tag" and the "Resume")

당신을 이해하기 위해, NaviGen은 당신이 상호작용하는 모든 항목(게임이나 영상 등)을 살펴보고 두 가지 특별한 "ID 카드"를 부여합니다.

  • 협업 식별자 (Collaborative Identifier, CID): 이것은 행동 지문이라고 생각하면 됩니다. 이는 "이것을 좋아한 사람들은 저것도 좋아했다"라고 말해주는 코드입니다. 텍스트를 읽지 않고도 당신의 취향이라는 패턴을 포착합니다. 이는 AI에게 "이 아이템은 '모험' 가문에 속한다"라고 알려주는 비밀 코드와 같습니다.
  • 텍스트 식별자 (Textual Identifier, TID): 이것은 요약된 이력서라고 생각하면 됩니다. 이는 해당 아이템이 실제로 무엇에 관한 것인지를 설명하는 짧고 조직화된 키워드 목록(예: "판타지", "로맨스", "액션")입니다.

이 두 가지를 결합함으로써, NaviGen은 AI에게 압축된 "행동적 기질(behavioral substrate, 코드)"과 "의미적 가교(semantic bridge, 키워드)"를 한 번에 제공합니다. 이를 통해 AI는 당신이 단순히 무엇을 좋아했는지뿐만 아니라, 그것을 좋아했는지까지 이해할 수 있게 됩니다.

2. 학습 과정 (글쓰기 배우기)

AI는 두 가지를 배워야 합니다. 어떻게 당신의 취향을 이해할 것인지, 그리고 어떻게 좋은 지침을 작성할 것인지입니다. NaviGen은 이를 두 단계로 가르칩니다.

  • 1단계: 지도 미세 조정 (Supervised Fine-Tuning, "공부방"):
    시스템은 **진화적 탐색(Evolutionary Search)**이라는 영리한 기술을 사용합니다. 여러 명의 작가가 사용자를 위한 완벽한 지침을 추측하려고 노력한다고 상상해 보세요. 그들은 세 가지 다른 스타일(보수적, 균형 잡힌, 탐구적)에서 시작합니다. 그들은 아이디어를 서로 섞고 조합하며(마치 식물을 교배하듯이), "편집자"(또 다른 AI)는 다음 세대의 지침을 만들기 위해 가장 좋은 것들을 선택합니다.
    모델은 이러한 "진화된" 지침으로부터 학습합니다. 또한 모델은 사용자의 취향이 "웃긴 엘프 영상"을 클릭하는 것에서부터 "로맨틱한 애니메이션 장면"을 원하는 것으로 어떻게 진화했는지, 그 과정을 "생각하며 말하기(Chain-of-Thought)"를 통해 설명하는 법을 배웁니다.

  • 2단계: 강화 학습 (Reinforcement Learning, "게임 쇼"):
    지침을 작성할 수 있게 된 후, 모델은 더 나아지기 위해 게임을 합니다. 모델은 다음과 같은 항목에 대해 점수(보상)를 받습니다:

    • 정확도: 사용자가 다음에 좋아할 만한 아이템에 대한 올바른 "행동 코드(CID)"를 예측했는가?
    • 품질: 지침이 구체적이고, 창의적이며, 이미지/영상 생성기가 실제로 만들 수 있는 것인가?
    • 일관성: 예측된 아이템이 지침과 일치하는가, 그리고 예측된 아이템이 사용자의 기록과 일치하는가?

3. 결과

연구진은 이를 쇼핑(제품), 게임, 숏폼 영상이라는 세 가지 서로 다른 환경에서 테스트했습니다.

  • 더 나은 예술: NaviGen이 지침을 작성했을 때, 결과물인 이미지와 영상은 다른 방식들보다 사용자의 특정 취향에 더 부합했고, 미적으로 더 아름다웠으며, 더 창의적이었습니다.
  • 더 나은 예측: 또한 사용자가 다음에 클릭할 아이템을 예측하는 데에도 더 뛰어났으며, 이는 모델이 사용자의 "행동 지문"을 진정으로 이해했음을 증명합니다.
  • "아하!" 모먼트: 사례 연구에서, 한 사용자의 기록은 "웃긴 엘프 영상"에서 "로맨틱한 애니메이션"으로 이어졌습니다. 다른 시스템들은 단순히 "애니메이션"으로만 파악했지만, NaviGen은 그 전환을 포착하여 "학생 커플이 등장하는 로맨틱한 애니메이션 장면"이라는 지침을 작성했습니다. 이는 사용자가 실제로 원했던 것에 훨씬 더 가까운 결과였습니다.

요요

NaviGen은 당신이 무엇을 즐기는지 관찰하고, 당신의 숨겨진 취향 패턴을 파악한 뒤, AI 예술가가 당신이 진심으로 사랑할 만한 콘텐츠를 만들 수 있도록 완벽하고 상세한 프롬프트를 작성해 주는 개인 비서와 같습니다. 이는 당신의 조용한 클릭과 AI가 마법을 부리기 위해 필요한 시끄럽고 상세한 지침 사이의 간극을 메워줍니다.

참고: 본 논문은 오직 사용자의 행동을 바탕으로 이미지 및 영상을 생성하는 데에만 초점을 맞추고 있습니다. 의료 진단, 임상 치료 또는 기타 비창의적인 용도로 사용될 수 있음을 주장하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →