← 최신 논문
💬 NLP

HORIZON: A Benchmark for In-the-wild User Behaviour Modeling

이 논문은 기존 벤치마크의 한계를 극복하고 실제 환경의 복잡성을 반영하기 위해 대규모 크로스 도메인 데이터를 기반으로 사용자 행동의 다양성, 장기적 시간 범위, 그리고 일반화 능력을 평가하는 새로운 벤치마크 'HORIZON'을 제안합니다.

원저자: Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma

게시일 2026-04-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"HORIZON"**이라는 새로운 기준 (벤치마크) 을 소개합니다. 이 기준은 인공지능 (AI) 이 사용자의 행동을 얼마나 잘 이해하고 예측하는지 테스트하는 새로운 '시험지' 역할을 합니다.

기존의 시험지가 너무 단순하고 좁은 범위만 다뤘다면, HORIZON 은 실제 세상처럼 복잡하고 긴 시간 동안 펼쳐지는 사용자의 삶을 그대로 재현합니다.

이 내용을 일상적인 언어와 비유로 설명해 드릴겠습니다.


1. 왜 새로운 시험지가 필요할까요? (기존의 문제점)

지금까지 AI 추천 시스템 (예: "이거 보시면 좋아하실 거예요") 을 평가할 때는 마치 초등학교 1 학년 수학 시험을 치르는 것과 비슷했습니다.

  • 기존 방식 (좁은 시야): "어제 영화를 3 개 봤으니, 내일 4 번째로 어떤 영화를 볼까?"라고 묻는 식이었습니다.
    • 문제점 1 (단일 분야): 영화만 보고 영화만 추천했습니다. 실제로는 영화를 보다가 책도 사고, 요리 도구를 사기도 하죠.
    • 문제점 2 (짧은 기억): 어제까지의 행동만 보고 내일을 예측했습니다. 하지만 사람은 10 년 전 취향과 지금의 취향이 다를 수 있습니다.
    • 문제점 3 (익숙한 친구들만): 시험을 볼 때 AI 가 이미 알고 있는 '친구들' (사용자) 에 대해서만 테스트했습니다. 새로운 친구가 나타나면 어떻게 할지 모릅니다.

결국, 이 시험에서 점수 좋은 AI 는 **익숙한 상황에서만 잘하는 '암기왕'**일 뿐, 실제 세상에서 막상 새로운 상황에 부딪히면 엉뚱한 소리를 할 수 있었습니다.

2. HORIZON 은 무엇인가요? (새로운 기준)

이 논문이 만든 HORIZON은 **"실제 인생을 그대로 담은 거대한 시뮬레이션"**입니다.

  • 데이터 규모: 아마존 리뷰 데이터 5,400 만 명의 사용자, 3,400 만 개의 상품을 모두 합쳐서 만들었습니다.
  • 핵심 특징:
    1. 다양한 분야: 영화, 전자제품, 옷, 음식 등 모든 분야가 섞여 있습니다. (실제처럼요)
    2. 긴 시간: 수년 간의 사용자 기록을 포함합니다. (어릴 적 취향부터 노년기 취향까지)
    3. 낯선 사용자: AI 가 한 번도 본 적 없는 새로운 사용자를 만나도 예측할 수 있는지 테스트합니다.

3. HORIZON 이 테스트하는 3 가지 '실전 상황'

이 새로운 시험지는 AI 에게 다음과 같은 3 가지 어려운 미션을 줍니다.

미션 1: "시간을 건너뛰는 예측" (Temporal Generalization)

  • 상황: "2020 년까지의 기록을 보고, 2023 년에 이 사용자가 무엇을 살지 맞춰봐."
  • 비유: 과거의 일기장을 보고 미래의 일기를 써보는 것입니다. AI 는 단순히 "어제 샀던 것과 같은 것"을 고르는 게 아니라, 시간이 흐르면서 변하는 사용자의 취향을 이해해야 합니다.

미션 2: "처음 보는 stranger 의 취향 읽기" (Unseen Users)

  • 상황: "이 사용자는 훈련 데이터에 없던 새로운 사람입니다. 이 사람이 무엇을 원할지 맞춰봐."
  • 비유: 길거리에서 처음 보는 사람을 보고 "이 사람은 커피를 좋아할까, 차를 좋아할까?"를 맞춰보는 것입니다. AI 는 이 사람의 과거 기록을 보고 패턴을 찾아내야 합니다.

미션 3: "LLM(거대 언어 모델) 의 능력 테스트"

  • 상황: "단순히 번호 (아이디) 를 외우는 게 아니라, 사용자의 행동을 '문장'으로 이해해서 추천해봐."
  • 비유:
    • 기존 AI: "사용자 A 는 '아이템 123'을 봤으니 '아이템 456'을 추천해." (기호만 기억)
    • 새로운 AI (LLM): "사용자 A 는 최근 캠핑 장비를 많이 봤네. 아마 주말에 캠핑을 갈 거야. 그래서 '캠핑용 랜턴'이나 '자전거'를 추천해." (이해와 추론)
    • 이 논문은 최신 AI 모델들이 실제로 이런 추론을 잘하는지, 아니면 여전히 숫자 암기에 그치는지 확인했습니다.

4. 실험 결과: AI 는 얼마나 잘할까요?

놀랍게도, 기존에 점수 좋게 나왔던 AI 들은 이 새로운 시험에서 많이 떨어졌습니다.

  • 기존 AI 들: 익숙한 친구 (기존 데이터) 에겐 잘했지만, 새로운 친구 (새로운 사용자) 가 나오거나 시간이 지나면 엉망이 되었습니다.
  • LLM(거대 언어 모델) 들: "이해"를 잘하는 것처럼 보였지만, 실제로는 정확한 추천을 하는 데는 아직 부족했습니다. "캠핑 장비를 봤으니 캠핑 용품을 추천해"라는 논리는 이해했지만, 정확히 어떤 캠핑 용품을 살지는 맞추지 못했습니다.

5. 결론: 우리가 배운 교훈

이 논문은 우리에게 중요한 메시지를 줍니다.

"단순히 과거 데이터를 많이 외운다고 해서 미래를 잘 예측하는 건 아닙니다. 사용자의 변화, 새로운 상황, 그리고 다양한 분야를 아우르는 '통찰력'이 필요합니다."

HORIZON 은 앞으로 AI 연구자들이 실제 세상처럼 복잡하고 긴 시간 동안, 낯선 사용자에게도 잘 작동하는 진정한 추천 시스템을 만들 수 있도록 돕는 나침반이 될 것입니다.

한 줄 요약:
기존 AI 는 "익숙한 친구의 취향"만 기억하는 암기왕이었다면, HORIZON 은 "낯선 사람의 미래까지 예측"하는 통찰력 있는 예언자를 키우기 위한 새로운 훈련장입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →