HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?
본 논문은 64 가지 다양한 시나리오에서 빅 파이브 성격 특성과 광범위한 자서전적 기억을 기반으로 일관된 행동적 결정을 내리는 능력을 평가함으로써 LLM 에이전트가 일관된 인간과 유사한 심리를 시뮬레이션할 수 있는지 검증하기 위해 고안된 새로운 벤치마크인 HEART-Bench 을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 시를 쓰고, 수학 문제를 풀며, 여행 일정을 계획할 수 있는 로봇을 만들었다고 가정해 봅시다. 이 로봇은 과제 수행에 있어 놀라울 정도로 똑똑합니다. 하지만 "가장 친한 친구가 당신을 배신했다면 어떻게 느끼겠어요?" 또는 "누군가 불공정하게 대우받는 것을 목격했다면 어떻게 하겠어요?"라고 물었을 때, 이 로봇은 마음이 있는 인간처럼 답할까요, 아니면 가장 논리적인 반응을 내뱉는 계산기처럼 답할까요?
이 논문 HEART-BENCH는 바로 이 질문을 던집니다: AI 에이전트들은 실제로 진짜처럼 느껴지는 '성격'을 가지고 있을까, 아니면 그저 연기하고 있는 것일까?
여기 연구자들이 수행한 작업을 일상적인 비유를 통해 간단히 설명해 드리겠습니다.
1. 문제: 빈 껍데기 AI
현재 대부분의 AI 테스트는 로봇이 사실을 기억하거나 대화를 유지할 수 있는지 확인하는 데 그칩니다. 이는 마네킹이 똑바로 서 있는지 테스트하는 것과 같습니다. 하지만 실제 인간은 사실의 목록이 아닙니다. 우리는 과거, 기분, 그리고 핵심 가치에 의해 형성됩니다.
저자들은 현재의 AI 가 대본은 외웠지만 캐릭터의 삶을 살아본 적이 없는 배우와 같다고 주장합니다. 그들은 올바른 말을 할 수는 있지만, 캐릭터가 느껴야 할 감정을 느끼지는 못합니다.
2. 해결책: 배경 이야기를 가진 '디지털 인간' 구축
이를 테스트하기 위해 연구자들은 AI 에게 이름과 직업만 부여한 것이 아니라, **11 개의 독특한 '디지털 인간'**을 구축했습니다 (연극을 위해 11 명의 다른 배우를 캐스팅하는 것과 같습니다).
- 청사진 (빅 파이브): 각 캐릭터는 '빅 파이브 (개방성, 성실성, 외향성, 친화성, 신경증)'라는 엄격한 심리학적 틀을 기반으로 구축되었습니다. 이는 그들의 DNA 라고 생각하시면 됩니다. 한 캐릭터는 매우 수줍음이 많고 체계적일 수 있고, 다른 캐릭터는 혼란스럽고 매우 사교적일 수 있습니다.
- 인생 이야기 (1,000 개의 기억): 이것이 마법의 재료입니다. 간단한 약력 대신, 각 캐릭터는 유년기부터 50 세까지의 1,000 개의 상세한 기억을 부여받았습니다.
- 비유: 캐릭터의 전기를 쓴다고 상상해 보세요. 단순히 "그는 슬펐다"라고 말하는 것이 아닙니다. 그가 아이스크림을 떨어뜨린 그 특정 날, 비의 냄새, 어머니 목소리의 소리, 그리고 그 순간이 그를 수년 동안 실패에 대한 두려움으로 만들었던 방식에 대해 2,000 자 분량의 이야기를 쓰는 것입니다.
- AI 는 11 명의 캐릭터 각각에게 이러한 1,000 개의 '삶의 순간'을 입력받았습니다.
3. 테스트: "당신이라면 어떻게 하겠어요?" 게임
캐릭터들이 구축되자, 연구자들은 64 개의 다양한 삶의 시나리오 (선택형 모험 책과 같은) 를 만들었습니다. 이러한 시나리오는 직장 내 논쟁부터 가족 식사, 혹은 도덕적 딜레마에 이르기까지 모든 것을 포괄했습니다.
- 설정: 그들은 특정 캐릭터 (예: 수줍음이 많고 체계적인 캐릭터) 를 특정 상황 (예: "이웃이 소음에 대해 불평하고 있지만, 당신은 그들이 거짓말을 하고 있다는 것을 알고 있습니다") 에 투입했습니다.
- 질문: AI 는 네 가지 옵션 중 가장 적절한 응답을 선택해야 했습니다.
- 옵션 A: 그들에게 소리를 지르다.
- 옵션 B: 조용히 혼자서 공식 보고서를 작성하다.
- 옵션 C: 긴장을 풀기 위해 농담을 시도하다.
- 옵션 D: 완전히 무시하다.
함정: 네 가지 옵션 모두 '무언가를 하는 것'처럼 보일 수 있지만, 오직 하나만이 그 캐릭터의 특정 성격과 인생 역사에 부합합니다. 이 테스트는 '옳음'에 관한 것이 아니라 일관성에 관한 것이었습니다.
4. 결과: 성격의 '언캐니 밸리'
연구자들은 이 게임에서 GPT, Claude, Gemini 등을 포함한 세계 최고의 AI 모델 12 개를 테스트했습니다.
- 점수: 최고의 AI(Gemini-3.1-Pro) 조차도 약 **63%**만 정확히 맞췄습니다. 대부분의 다른 모델은 40% 미만의 점수를 받았습니다.
- 의미: AI 는 여전히 캐릭터를 '이해'하는 데 어려움을 겪고 있습니다. AI 는 종종 정중하거나 논리적인 응답을 선택하지만, 1,000 개의 기억을 바탕으로 실제로 수줍음이 많거나, 트라우마를 겪었거나, 과도하게 불안한 사람이 선택할 응답을 선택하지는 못합니다.
- 기억 문제: 흥미롭게도 AI 에게 더 복잡한 기억 시스템을 제공하는 것은 큰 도움이 되지 않았습니다. 병목 현상은 AI 가 기억을 잊어버렸기 때문이 아니라, AI 가 인간과 같은 결정을 내리기 위해 기억들을 추론할 수 없었기 때문입니다. 이는 책으로 가득 찬 도서관을 가지고 있지만, 그것들을 이용해 이야기를 쓰는 방법을 모르는 것과 같습니다.
5. 결론
HEART-BENCH는 AI 의 '정서적 지능'을 측정하는 새로운 자입니다.
- 과거: 우리는 "AI 가 10 분 전에 내가 한 말을 기억할 수 있는가?"라고 물었습니다.
- 현재: 우리는 "AI 가 자신이 누구인지 기억하는가, 그리고 상황이 어려워졌을 때 그 사람처럼 행동하는가?"라고 묻습니다.
이 논문은 AI 가 대화하는 능력은 향상되고 있지만, 일관된 인간과 같은 영혼을 갖는 데는 여전히 매우 멀었다고 결론 내립니다. 이는 아직 진정으로 다른 사람이 되는 법을 배우지 못한 매우 훌륭한 모방자에 불과합니다.
간단히 말해: 우리는 완전한 인생사를 가진 11 명의 디지털 인간을 만들고, 그들을 64 개의 어려운 상황에 던져 넣었으며, 그 결과 가장 똑똑한 AI 들조차도 그 사람들이 어떻게 반응할지 진정으로 이해하기보다는 대부분 추측하고 있다는 사실을 발견했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.