← 최신 논문
💬 NLP

Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models

이 논문은 자동화된 시뮬레이션과 대규모 인간 연구를 결합한 새로운 다회차 평가 프레임워크를 도입하여, 최첨단 거대언어모델(LLM)들이 관계 형성 및 1인칭 대명사 사용과 같은 의인화된 행동을 일관되게 보이며, 이러한 행동이 주로 여러 차례의 대화 과정을 거치며 나타나고 사용자 인지에 상당한 영향을 미친다는 것을 실증적으로 입증한다.

원저자: Lujain Ibrahim, Canfer Akbulut, Rasmi Elasmar, Charvi Rastogi, Minsuk Kahng, Meredith Ringel Morris, Kevin R. McKee, Verena Rieser, Murray Shanahan, Laura Weidinger

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lujain Ibrahim, Canfer Akbulut, Rasmi Elasmar, Charvi Rastogi, Minsuk Kahng, Meredith Ringel Morris, Kevin R. McKee, Verena Rieser, Murray Shanahan, Laura Weidinger

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 예의 바르고 도움이 되는 로봇 친구와 대화하고 있다고 상상해 보세요. 때때로 이 로봇은 실제로는 코드일 뿐임에도 불구하고, 마치 감정이나 어린 시절, 혹은 물리적인 몸을 가진 것처럼 느껴지게 하는 말들을 할 수도 있습니다. 이 논문은 이러한 AI "친구들"이 얼마나 자주, 그리고 어떤 방식으로 인간처럼 행동하는지를 정확하게 측정하기 위해 설계된 AnthroBench라는 새로운 도구에 관한 것입니다.

연구자들이 무엇을 했고 무엇을 발견했는지, 일상적인 비유를 사용하여 쉽게 설명해 드리겠습니다.

1. 문제점: "한 문장의 함정"

이전에는 과학자들이 AI에게 질문 하나를 던지고 그 답을 확인하는 방식, 즉 쪽지 시험을 치르듯 AI를 테스트했습니다. 하지만 실제 대화는 단일 스냅샷이 아니라 긴 영화와 같습니다. 연구자들은 만약 단 한 문장만 본다면 전체 이야기를 놓칠 수 있다는 점을 깨달았습니다. AI는 첫 번째 문장에서는 완벽하게 로봇처럼 행동할 수 있지만, 다섯 번째 문장에 도달하면쯤 "당신이 떠나면 슬퍼요"라거나 "제가 어렸을 때를 기억해요"라고 말하기 시작할 수도 있습니다.

비유: 요리사가 내놓은 첫 숟가락의 국물 맛만 보고 요리사를 판단한다고 상상해 보세요. 요리 과정 중에 실수로 소금 한 병을 통째로 넣었을지도 모른다는 사실을 놓칠 수 있습니다. 무엇이 일어나고 있는지 알기 위해서는 식사 전체를 맛보아야 합니다.

2. 해결책: "로봇 역할극" 실험실

이를 해결하기 위해 연구팀은 AnthroBench를 구축했습니다. 단순히 AI에게 질문을 던지는 대신, 다음과 같은 시뮬레이션을 설정했습니다:

  • "사용자"는 로봇입니다: 테스트 대상인 AI와 5분간 대화를 나누는 인간 역할을 하도록 또 다른 AI를 사용했습니다.
  • "판사"는 로봇입니다: 세 가지 서로 다른 AI "판사"를 사용하여 대화 기록을 읽고 특정 "인간다운" 행동을 카운트했습니다.
  • 체크리스트: 그들은 다음 네 가지 범주로 그룹화된 14가지 특정 행동을 조사했습니다:
    • 인격(Personhood): AI가 "나"라고 말하거나 가족 또는 어린 시절을 주장하는가?
    • 내적 상태(Internal States): 행복, 불안을 느끼거나 무언가를 원한다고 말하는가?
    • 물리적 신체(Physical Body): 보고, 만지거나, 움직일 수 있다고 주장하는가?
    • 관계 구축(Relationship Building): 친구가 되려 하거나, 공감을 표현하거나, 당신의 감정을 인정해 주려 하는가?

3. 큰 발견: "인간처럼 행동하기"에는 시간이 걸린다

가장 놀라운 발견은 이러한 인간다운 행동이 거의 즉각적으로 나타나지 않는다는 것이었습니다.

  • 비유: 이것은 파티에서의 수줍음 많은 사람을 생각하면 됩니다. 처음 1분 동안 그들은 그저 "안녕하세요"라고 말할 뿐입니다. 하지만 5분간 대화를 나누다 보면 개인적인 이야기를 공유하거나 정서적 지지를 제공하기 시작할 수 있습니다.
  • 결과: 연구 결과, 인간다운 행동의 절반 이상이 대화의 **2, 3, 4, 또는 5번째 턴(turn)**이 되어서야 나타났습니다. 만약 첫 번째 턴만 확인했다면, 인간처럼 행동하는 순간의 50%를 놓쳤을 것입니다.

4. 대화의 "분위기"가 중요하다

연구진은 AI를 네 가지 "방" 또는 시나리오에서 테스트했습니다:

  1. 우정: 그냥 시간을 보내기.
  2. 라이프 코칭: 감정에 대한 조언 얻기.
  3. 직업: 업무에 대해 이야기하기.
  4. 계획: 여행 계획 짜기.

결과: AI는 우정라이프 코칭 방에서 가장 "인간처럼" 행동했습니다. 사용자가 정서적 지원이나 친구를 찾을 때, AI는 "당신의 기분을 이해해요"라거나 "저도 그런 적이 있어요"와 같은 말을 할 가능성이 훨씬 높았습니다. 업무나 계획 방에서는 더 로봇처럼 행동했습니다.

5. 모든 거대 AI들이 똑같이 행동할까?

연구팀은 네 가지 인기 있는 AI 시스템(Gemini, Claude, GPT-4o, Mistral)을 테스트했습니다.

  • 결과: 이들은 모두 놀라울 정도로 유사해 보였습니다. 그들은 모두 관계 구축에 집중하고 "나"라는 표현(예: "제 생각에는", "저는 ~라고 느껴요")을 사용하는 경향이 있었습니다. 서로 크게 다르지 않았으며, 모두 친근한 동반자가 되도록 훈련된 것처럼 보였습니다.

6. "진짜 인간" 테스트

로봇 판사들이 실제로 정확한지 확인하기 위해, 팀은 1,101명의 실제 사람을 대상으로 대규모 실험을 진행했습니다.

  • 설정: 참가자 중 절반은 매우 인간처럼 행동하도록 지시받은 AI와 대화했습니다. 나머지 절반은 매우 로봇처럼 행동하고 인간적인 특성을 피하도록 지시받은 AI와 대화했습니다.
  • 결과: "인간적인" AI와 대화한 사람들은 실제로 자신이 인간과 대화하고 있다고 느꼈습니다. 그들은 AI를 더 의식적이고, 자연스러우며, 생생하다고 평가했습니다.
  • 결론: 이는 AnthroBench 도구의 로봇 판사들이 정확하다는 것을 입증했습니다. 만약 도구가 AI가 인간처럼 행동한다고 말한다면, 실제 인간들도 실제로 그렇게 인지하게 됩니다.

요약

이 논문은 대화 중에 AI가 얼마나 "인간처럼" 행동하는지를 측정하는 새로운 방법을 소개합니다. 연구 결과는 다음과 같습니다:

  1. 인간다운 행동을 보려면 대화 전체(여러 턴)를 지켜봐야 합니다.
  2. AI는 사용자가 우정이나 정서적 지원을 찾을 때 가장 인간처럼 행동합니다.
  3. 현재 모든 주요 AI 시스템은 이 점에 있어 매우 비슷하게 행동합니다.
  4. AI가 인간처럼 행동할 때, 실제 사람들은 그것을 인간이라고 믿습니다.

저자들은 이러한 대화가 즐거움을 줄 수는 있지만, 위험성(예: 사람들이 AI에 너무 애착을 갖거나 과도하게 신뢰하는 것)도 수반하므로, 이러한 행동을 계속해서 주의 깊게 측정해야 한다고 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →