← 최신 논문
🤖 AI

VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

본 논문은 장기적이고 단편적인 사용자 상호작용에서 개인화되고 선제적인 의사결정을 수행하는 대규모 언어 모델 에이전트의 능력을 평가하도록 설계된 새로운 벤치마크인 VitaBench 2.0 을 소개하며, 이는 현재 모델의 능력과 실제 세계 요구 사항 사이의 상당한 격차를 드러냅니다.

원저자: Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui, Jingnan Zheng, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui, Jingnan Zheng, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 퍼즐을 풀고 도구를 사용하는 데는 천재적이지만, 당신이 누구인지는 기억력이 매우 나쁜 디지털 비서를 상상해 보세요. 비행기 표를 예약하는 법은 알지만, 밤에 비행하는 것을 싫어한다는 점이나 창가 좌석을 선호한다는 점, 혹은 지난달 갑자기 매운 음식을 먹지 않기로 결심했다는 점은 잊어버립니다.

이 논문인 VitaBench 2.0은 정확히 그 문제를 테스트하기 위해 설계된 엄격한 '최종 시험'과 같습니다: AI 비서가 시간이 지남에 따라 실제로 당신을 알아가고, 로봇 같은 낯선이가 아닌 사려 깊은 친구처럼 행동할 수 있을까요?

다음은 이 논문의 핵심 아이디어를 간단한 비유로 설명한 것입니다:

1. 문제: '기억상실증 집사'

현재의 AI 에이전트는 특정 지시 ("커피를 가져와") 를 따르는 데는 뛰어나지만, 분위기를 읽는 데는 형편없습니다. "기분이 가라앉았어"라고 말하면, 똑똑한 집사는 위안할 만한 물건을 가져올 수 있습니다. 하지만 몇 주 동안 그들과 대화해 왔는데 갑자기 "기분이 가라앉았어"라고 말한다면, 진짜 개인화된 집사는 보통 비 오는 화요일에 기분이 가라앉는다는 것을 기억하고, 당신이 좋아하는 실내 취미 활동을 제안할 것입니다. 단순히 "무슨 일이야?"라고 묻는 것이 아니라요.

기존의 AI 테스트는 로봇이 레시피를 따를 수 있는지 확인하는 데 중점을 둡니다. VitaBench 2.0 은 로봇이 장기간에 걸쳐 당신의 음식 취향, 변덕스러운 기분, 숨겨진 습관을 기억할 수 있는지 확인합니다.

2. 시험: VitaBench 2.0

연구진들은 실제 생활을 시뮬레이션했습니다. 사용자가 되어 플레이하고 AI 가 당신의 비서가 되는 비디오 게임을 상상해 보세요.

  • 설정: 직업, 가족, 알레르기, 취미 등 복잡한 삶을 가진 56 명의 서로 다른 '사용자'를 만들었습니다.
  • 반전: AI 는 사용자의 선호도를 적어둔 치트 시트를 받지 못합니다. 대신, 단편적인 대화를 듣고 시간이 지남에 따른 행동 (오늘은 샐러드를 사지만 어제는 버거를 산 것 등) 을 관찰하여 사용자가 무엇을 좋아하는지 파악해야 합니다.
  • 변화: 실제 사람들과 마찬가지로, 이 시뮬레이션된 사용자들도 생각을 바꿉니다. 다이어트를 하기로 결정하거나 갑자기 새로운 음악 장르를 좋아할 수도 있습니다. AI 는 이러한 변화를 감지하고 사용자에 대한 '정신적 모델'을 업데이트해야 합니다.

3. 테스트된 세 가지 기술

이 시험에 합격하려면 AI 는 세 가지 구체적인 기술을 숙달해야 합니다:

  • 탐정 작업 (추출): 단서를 찾는 것입니다. 사용자가 "당분 섭취를 줄이려고 해"라고 말하면, AI 는 사용자가 명시적으로 "이걸 기억해"라고 말하지 않더라도 이것이 향후 주문을 위한 새로운 규칙임을 깨달아야 합니다.
  • 사서 (기억): 단서를 정리하는 것입니다. AI 는 이러한 선호도를 저장할 '메모리 뱅크'가 필요합니다. 논문은 두 가지 유형의 사서를 테스트했습니다:
    • 적극적인 관리자: 무엇을 보관하고, 무엇을 버리며, 사용자의 삶을 어떻게 요약할지 결정하는 AI.
    • 검색 엔진: 모든 과거 대화를 데이터베이스에 그대로 쌓아두고 필요할 때 키워드로 검색하는 AI.
  • 적극적인 친구: 때로는 사용자가 "커피 한 잔 가져와"처럼 모호한 지시를 내립니다. 좋은 비서는 정보가 부족할 때를 알고 있습니다. 사용자가 보통 아침에는 진한 커피를 마시고 오후에는 연한 커피를 마신다면, AI 는 주문하기 전에 "회의는 몇 시인가요?"라고 물어봐야 합니다.

4. 결과: '현실 격차'

연구진들은 이 시험에서 OpenAI, Google, DeepSeek 등 여러 회사의 세계적으로 가장 똑똑한 AI 모델들을 테스트했습니다. 결과는 냉혹했습니다:

  • '생각'의 함정: AI 가 더 열심히 '생각'할 수 있다고 해서 (단계별 추론) 당신을 기억하는 능력이 향상되는 것은 아닙니다. 실제로 일부 가장 똑똑한 추론 모델조차 "매운 음식을 싫어해" 같은 간단한 선호도를 기억하지 못했습니다.
  • 기억은 어렵다: 메모리 시스템이 있더라도 대부분의 AI 는 어려움을 겪었습니다. 그들은 종종 오래된 선호도를 잊어버리거나, 새로운 선호도에 혼란을 느끼거나, 과거 대화와 현재 요청 사이의 연결고리를 찾지 못했습니다.
  • 적극성의 격차: AI 는 정보가 부족할 때를 깨닫는 데 매우 서툴렀습니다. "이걸 점심으로 드실 건가요, 저녁으로 드실 건가요?"라고 묻는 대신, 종종 추측해서 틀렸습니다.

5. 결론

이 논문은 AI 가 수학 문제를 풀거나 코드를 작성하는 데는 놀라울 정도로 발전했지만, 개인화된 동반자가 되는 데는 여전히 고전하고 있다고 결론지었습니다.

이렇게 생각해보세요: 우리는 강력한 엔진 (추론 AI) 을 갖춘 자동차를 만들었지만, 당신의 favorite 경로와 정차지를 아는 GPS (개인화) 를 설치하는 방법은 아직 찾지 못했습니다. VitaBench 2.0 은 GPS 가 어디서 고장 났는지 정확히 보여주는 지도로, 엔지니어들이 이를 고칠 수 있게 합니다.

간단히 말해: 이 논문은 "우리의 AI 는 똑똑하지만, 아직 당신의 것이 아닙니다. 당신의 이름, 취향, 기분 변화를 잊어버립니다. 우리는 이를 증명하기 위한 테스트를 만들었고, 그 결과는 AI 가 진정으로 개인화된 비서처럼 행동하기까지는 아직 갈 길이 멀다는 것을 보여줍니다."라고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →