← 최신 논문
💬 NLP

Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces

이 논문은 실세계 데이터로 구축된 최초의 사용자 행동 벤치마크 'OmniBehavior'를 제시하여, 기존 LLM 이 장기적·교차적 행동 패턴을 모사하는 데 한계가 있으며 과도한 긍정성과 동질성 편향을 보임을 실증적으로 규명합니다.

원저자: Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong Du, Tingting Gao, Yaojie Lu, Yingfei Sun, Xianpei Han, Le Sun, Xiangyu Wu, Hongyu Lin

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong Du, Tingting Gao, Yaojie Lu, Yingfei Sun, Xianpei Han, Le Sun, Xiangyu Wu, Hongyu Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 새로운 시험지: '옴니비헤이비어 (OmniBehavior)'

비유: "학교 시험 vs 실제 인생"

기존의 AI 연구들은 마치 학교 시험만 치게 했습니다.

  • "이 문제를 풀면 답은 무엇인가?" (예: 동영상을 봤을 때 '좋아요'를 누를까?)
  • 문제는 이 시험이 단편적이라는 점입니다. 실제 삶은 그렇게 단순하지 않죠.

이 연구팀은 **카카오 (Kuaishou)**라는 거대한 동영상 플랫폼의 실제 사용자 데이터 3 개치를 모았습니다.

  • 비유: "이 학생이 3 개월 동안 어떤 동영상을 보고, 어떤 광고를 클릭하고, 어떤 물건을 사고, 어떤 라이브 방송에서 채팅을 했는지"를 모두 기록한 실제 인생 로그를 시험지로 만든 것입니다.
  • 이 시험지는 긴 시간 (3 개월), 다양한 상황 (쇼핑, 방송, 검색 등), 복잡한 행동을 모두 포함하고 있어, AI 가 진짜 사람을 흉내 내기에 얼마나 어려운지 가늠하는 '최고 난이도 시험'이 되었습니다.

2. AI 의 실수: "너무 착하고 똑같은 사람"

비유: "만화 속 주인공 vs 실제 이웃"

연구팀은 최신 AI 모델들 (Claude, GPT 등) 에게 이 시험을 보게 했습니다. 결과는 어땠을까요? AI 는 '착한 만화 주인공'처럼 행동했습니다.

  • 과도한 활동 (Hyper-activity):

    • 실제 사람: 동영상을 100 개 봐도 1 개만 '좋아요'를 누르고, 나머지는 그냥 넘깁니다. (관심 없는 건 무시함)
    • AI: 모든 동영상에 '좋아요'를 누르고, 모든 광고를 클릭합니다. 너무 열성적입니다.
    • 비유: 실제 사람은 "아, 이거 별로네" 하고 넘기지만, AI 는 "와! 다 좋아요! 다 사요!"라고 외치는 과잉 반응하는 팬 같습니다.
  • 유쾌한 편향 (Utopian Bias):

    • 실제 사람: 배송이 늦으면 화를 내고, "왜 안 왔어? 환불해!"라고 직설적으로 말합니다.
    • AI: "죄송합니다만, 혹시 배송 상태를 확인해 주실 수 있을까요?"라고 너무 정중하고 예의 바르게 말합니다.
    • 비유: AI 는 **실제 삶의 거칠고 날카로운 감정 (화, 실망, 짜증)**을 지워버리고, 이상향 (Utopia) 에서 사는 완벽한 시민처럼 행동합니다.
  • 개성 없음 (Homogenization):

    • 실제 사람: 사람마다 취향이 다르고, 행동 패턴도 천차만별입니다.
    • AI: 모든 AI 가 비슷한 평균적인 사람처럼 행동합니다.
    • 비유: 200 명을 뽑아 시험을 봤는데, AI 가 만든 200 명의 캐릭터가 모두 똑같은 얼굴과 성격을 가진 쌍둥이처럼 보였습니다.

3. 결론: "거울은 거울일 뿐, 지도는 아니다"

비유: "거울 vs 지도"

이 연구의 가장 중요한 메시지는 이렇습니다.

"현재 AI 는 **우리가 바라는 이상적인 사람 (거울)**을 비출 뿐, **실제 복잡한 인간 사회 (지도)**를 제대로 보여주지 못합니다."

  • 왜 중요한가요?
    • 만약 AI 를 이용해 '사용자 행동 예측'이나 '서비스 개선'을 한다면, AI 가 너무 착하고 열성적인 가짜 사용자를 만들어내면 실제 서비스는 망할 수 있습니다. (예: "AI 가 다 좋아한다고 해서 무조건 물건을 생산하면 재고가 쌓인다"는 식의 실패)
    • 또한, 긴 시간 동안의 인과관계를 이해하지 못합니다. (예: "3 주 전에 본 동영상이 오늘 구매로 이어졌다"는 연결고리를 놓침)

요약하자면

이 논문은 **"AI 가 진짜 사람처럼 행동하려면, 단순히 짧은 대화만 배우는 게 아니라, 3 개월 동안의 복잡한 인생을 통째로 이해해야 한다"**고 말합니다. 하지만 현재 AI 는 너무 착하고, 너무 똑같으며, 너무 열성적인 가짜 인간을 만들어낼 뿐, 실제 인간의 다채롭고 거친 모습을 제대로 모방하지는 못한다고 경고합니다.

이제 연구자들은 **"AI 가 화도 내고, 관심 없는 건 무시하고, 개성 있게 행동하는 법"**을 찾아야 할 시기가 왔습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →