Inferring personality from a live interaction with an LLM: Predictions are internally consistent and show convergent validity
이 사전 등록된 연구는 대규모 언어 모델이 실시간 대화로부터 빅 파이브(Big Five) 성격 특성을 높은 내부 일관성과 수렴 타당도를 가지고 신뢰성 있게 추론할 수 있음을 보여주며, 특히 신경증과 우호성에서 두드만큼한 성능을 보이지만, 그 성능은 특성의 관찰 가능성과 프롬프트 전략에 따라 달라진다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
수십 년 동안 심리학자들은 우리가 누구인지 이해하기 위해 설문지라는 단순한 도구에 의존해 왔습니다. 사람들은 앉아서 자신이 외향적인지, 조직적인지, 혹은 불안해하는지에 대한 일련의 진술들에 대해 스스로를 평가하며 동의하는지 여부를 답합니다. 이 방법은 효율적이며 우리에게 '빅 파이브(Big Five)'라고 불리는 인간 성격의 표준 지도를 제공했습니다. 이 다섯 가지 특성인 개방성, 성실성, 외향성, 우호성, 신경증은 사람들이 어떻게 생각하고, 느끼고, 행동하는지를 설명하는 틀 역할을 합니다. 하지만 이 접근 방식에는 결함이 있습니다. 이는 사람들이 내면을 들여다보고 스스로를 판단하도록 요구하는데, 이 과정은 타인에게 어떻게 보이고 싶은지에 의해 흐려지거나 단순한 자기 성찰의 실수로 인해 왜곡될 수 있습니다. 또한, 우리가 실제로 말하고 상호작용하는 방식의 풍부하고 복잡한 세부 사항들을 놓치기도 합니다.
최 최근, 우리가 이러한 특성들을 측정하는 방식을 바꿀 수도 있는 새로운 종류의 기술이 등장했습니다. 거대 언어 모델은 방대한 양의 텍스트를 학습한 컴퓨터 프로그램으로, 놀라울 정도로 인간처럼 느껴지는 대화를 나눌 수 있습니다. 이 모델들은 수많은 인간의 글을 읽었기 때문에, 사람들이 사용하는 단어의 패턴을 통해 그들의 기저에 깔린 성격을 포착해 낼 수 있습니다. 연구자들은 컴퓨터가 실시간 대화를 듣고, 사람이 설문지를 작성하지 않더라도 오직 대화 내용을 듣는 것만으로 그 사람의 성격을 정확하게 추측할 수 있을지라는 질문을 던지기 시작했습니다.
본 대학의 연구팀은 이 아이디어를 테스트하기 위해 나섰습니다. 그들은 117명의 참가자를 인공지능 챗봇과 10분간 대화하도록 초대했습니다. 챗봇에게는 구체적인 지침이 주어졌는데, 참가자의 지난 한 주에 대해 개방형 질문을 던지되, 자신의 답변은 짧게 유지하면서도 그 사람의 성격을 이해할 수 있는 충분한 정보를 수집하도록 하는 것이었습니다. 목표는 컴퓨터가 이 짧은 대화로부터 성격 프로필을 추출할 수 있는지 확인하는 것이었습니다. 대화가 끝난 후, 연구진은 챗봇에게 참가자의 성격을 다섯 가지 주요 특성에 따라 평가하도록 요청했습니다. 결과의 신뢰성을 확보하기 위해, 연구진은 참가자들에게 자신에 대한 표준 성격 설문지를 작성하게 하여 컴퓨터의 추측과 비교할 기준점을 마련했습니다.
연구진은 컴퓨터에게 판단을 내리게 하는 두 가지 다른 방식을 테스트했습니다. 첫 번째 접근 방식은 단순히 모델에게 대화를 바탕으로 다섯 가지 특성에 대해 사람을 평가하도록 요청하는 것이었습니다. 두 된 더 복잡한 접근 방식은 컴퓨터에 표준 성격 테스트의 질문 목록을 그대로 입력하고, 그 사람이 각 질문에 어떻게 답했을지 추측하도록 요청하는 것이었습니다. 결과는 컴퓨터가 이 작업에 놀라울 정도로 능숙하다는 것을 보여주었습니다. 연구진이 컴퓨터의 평가 일관성을 확인했을 때, 모델은 인간 심리학자만큼이나 성격의 구조를 잘 이해하고 있다는 것을 발견했습니다. 컴퓨터가 생성한 점수들은 내부적으로 일관되었는데, 이는 동일한 사람에 대해 모순된 답변을 내놓지 않았음을 의미합니다.
더 중요한 점은, 컴퓨터의 평가가 참가자들의 자기 보고 내용과 일치했다는 것입니다. 가장 강력한 일치도는 정서적 안정 및 불안과 관련된 신경증, 그리고 친절 및 협력과 관련된 우호성에서 발견되었습니다. 컴퓨터는 사람들이 말하는 방식에서 우울함과 공감의 징후를 포착하는 데 특히 뛰어났습니다. 그러나 기술은 다른 특성들에서는 어려움을 겪었습니다. 컴퓨터는 사람이 얼마나 외향적인지 또는 개방적인지를 예측하는 데 더 힘들어했습니다. 이러한 어려움은 아마도 대화 자체의 성격에서 기인한 것으로 보입니다. 외향성과 같은 특성은 집단 속에서 어떻게 행동하는지 또는 대면했을 때 얼마나 에너지가 넘치는지와 같이 나타나는데, 이는 텍씨트 채팅을 통한 기계와의 대화로는 포착하기 어려운 부분입니다. 마찬가지로 창의성과 개방성은 짧은 대화에서는 명확한 흔적을 남기지 않는 경우가 많은 내부적인 과정입니다.
이 연구는 또한 컴퓨터가 편향되어 있는지도 살펴보았습니다. 모델이 훈련 데이터에 담긴 생각들, 예를 들어 여성이 남성보다 더 감정적이라고 가정하는 것과 같은 고정관념에 의존할 수 있다는 우려가 있었습니다. 그러나 연구진이 참가자의 성별을 챗봇으로부터 숨겼기 때문에, 컴퓨터는 이러한 고정관념을 증폭시키지 않았습니다. 컴퓨터가 발견한 남녀 간의 차이는 참가자들이 스스로에 대해 말한 내용과 일치했으며, 이는 모델이 선입견에 기반한 것이 아니라 실제 사람에게 반응했음을 시사합니다. 다만, 연구진은 컴퓨터가 판단에 있어 지나치게 친절한 경향이 있다는 것을 발견했습니다. 컴퓨터는 우호성과 성실성 같은 특성에는 더 높은 점수를 주고 신경증에는 낮은 점수를 주었는데, 이는 모델이 예의 바르도록 프로그래로 되어 있거나 사람의 '좋은 모습'을 기본값으로 설정했기 때문일 수 있습니다.
컴퓨터의 예측이 완벽하지는 않았지만, 이 연구는 우리가 체크리스트가 아닌 자연스러운 대화를 통해 성격을 이해하는 미래로 나아가고 있음을 시사합니다. 연구진은 컴퓨터에게 테스트 질문을 직접 입력하는 복잡한 방식보다 일반적인 등급을 요청하는 단순한 방식이 더 효과적이라는 것을 발견했는데, 복잡한 방식은 시스템을 더 자주 실패하게 만들었습니다. 이는 모델이 작동하기 위해 반드시 엄격한 틀을 필요로 하지 않는, 성격에 대한 직관적인 이해를 갖추고 있음을 나타냅니다. 이러한 결과는 이 도구들이 아직 인간 심리학자를 대체하거나 삶을 바꾸는 결정을 내릴 준비는 되어 있지 않지만, 우리가 선택한 단어들로부터 우리가 누구인지에 대한 의미 있는 신호를 성공적으로 끌어낼 수 있음을 보여줍니다. 기술이 발전하고 대화가 더 길고 상세해짐에 따라, 언어로부터 성격을 읽어내는 능력은 인간의 마음을 이해하는 강력한 새로운 방법이 될 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.