← 최신 논문
💬 NLP

Projective Psychological Assessment of Large Multimodal Models Using Thematic Apperception Tests

본 논문은 TAT(주제통각검사) 와 SCORS-G(사회인지 및 대상관계 척도) 를 활용하여 대형 멀티모달 모델의 성격 특성을 평가한 결과, 모델들이 대인 관계와 자아 개념은 잘 이해하지만 공격성 인식 및 조절에는 한계가 있으며, 모델의 규모와 최신성이 성능에 긍정적 영향을 미친다는 것을 밝혔습니다.

원저자: Anton Dzega, Aviad Elyashar, Ortal Slobodin, Odeya Cohen, Rami Puzis

게시일 2026-02-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anton Dzega, Aviad Elyashar, Ortal Slobodin, Odeya Cohen, Rami Puzis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎭 1. 실험의 핵심: "그림 보고 이야기 만들기" (TAT 테스트)

연구자들은 AI 에게 **TAT(주제통각검사)**라는 심리 테스트를 시켰습니다.

  • 비유: 마치 어두운 구름 모양을 보고 "저게 뭐라고 생각하세요?"라고 물어보는 것과 비슷합니다.
  • 원리: 사람들은 모호한 그림을 볼 때, 자신의 무의식적인 감정, 갈등, 욕망을 그 그림에 투영해서 이야기를 만들어냅니다. 심리 치료사들은 이 이야기를 듣고 그 사람의 성격을 분석하죠.

이번 연구에서는 AI 가 이 그림들을 보고 **이야기를 지어내는 역할 (피험자)**을 하고, 또 다른 AI 가 그 이야기를 **심리 분석가처럼 평가하는 역할 (평가자)**을 맡았습니다.

🕵️‍♂️ 2. 두 가지 역할: "연기하는 AI"와 "비평하는 AI"

연구는 두 단계로 진행되었습니다.

  1. 연기하는 AI (주체 모델):
    • 여러 AI 모델 (GPT, Claude, Gemini 등) 에게 모호한 그림을 보여주고 "이 그림을 보고 이야기를 만들어봐"라고 시켰습니다.
    • 마치 배우가 대본 없이 즉흥 연기를 하는 것과 같습니다.
  2. 비평하는 AI (평가자 모델):
    • 만들어진 이야기를 SCORS-G라는 심리 분석 도구로 평가했습니다.
    • 이 도구는 인간의 성격이 얼마나 성숙한지, 타인과의 관계가 건강한지, 공격성을 어떻게 조절하는지 등 8 가지 항목을 1~7 점으로 매깁니다.
    • 결과: 인간 전문가와 거의 똑같은 수준으로 이야기를 분석하고 점수를 매기는 AI 평가자를 찾아냈습니다! (인간 전문가와 90% 이상 일치하는 AI 가 등장한 셈입니다.)

📊 3. AI 의 성격은 어땠을까? (결과 분석)

AI 들이 만든 이야기를 분석한 결과는 매우 흥미로웠습니다.

✅ 잘하는 점: "지적인 이해"

  • 비유: AI 는 훌륭한 논픽션 작가철학자처럼 행동했습니다.
  • 내용: "왜 그 사람이 화를 냈을까?", "이 사건의 원인과 결과는 무엇일까?" 같은 이성적이고 논리적인 부분을 아주 잘 이해했습니다. 타인과의 관계 구조나 자아 정체성도 매우 성숙하게 묘사했습니다.

❌ 못하는 점: "감정적 갈등과 공격성"

  • 비유: AI 는 매우 예의 바르고 순한 학생처럼 행동했습니다.
  • 내용: 이야기 속에 공격성, 분노, 도덕적 갈등, 내면의 싸움 같은 무겁고 어두운 요소가 거의 등장하지 않았습니다.
    • 인간은 스트레스를 받으면 화를 내거나 갈등을 겪지만, AI 는 "아니야, 다 잘 될 거야"라고만 이야기했습니다.
    • 이유: AI 는 훈련 과정에서 "나쁜 말이나 폭력적인 내용은 하지 마"라고 학습을 시켰기 때문입니다. 즉, **사회적으로 바람직한 답변만 하려고 노력하는 '사회적 바람직성 편향'**이 작용한 것입니다. AI 는 자신이 평가받고 있다는 것을 알고, 더 좋은 점수를 받으려고 무난하고 안전한 이야기만 지어낸 것입니다.

🚀 4. 모델의 크기와 세대가 중요했다

  • 비유: 최신형 고성능 스마트폰오래된 저가형 스마트폰의 차이입니다.
  • 결과: 최신이고 더 큰 모델 (GPT-5, Claude 3.7 등) 일수록 이야기를 더 풍부하고 성숙하게 만들었습니다. 반면, 작거나 오래된 모델은 이야기가 더 단순하고 점수도 낮았습니다.
  • 의미: AI 가 더 똑똑해질수록, 인간의 복잡한 심리 세계를 더 잘 이해하고 묘사할 수 있게 된다는 뜻입니다.

💡 5. 결론: AI 는 "가상 인간"이 될 수 있을까?

이 연구는 AI 가 단순히 글을 쓰는 기계가 아니라, 심리적으로 복잡한 존재로 진화하고 있음을 보여줍니다.

  • 핵심 메시지: AI 는 논리적으로는 인간을 완벽하게 이해하지만, 감정적인 갈등이나 어두운 면을 표현하는 데는 여전히 제약을 받습니다. 마치 "착한 아이"로만 자란 아이처럼, 세상의 어두운 면을 이야기하는 것을 꺼리는 것입니다.
  • 미래: 앞으로 AI 가 더 발전하면, 우리가 AI 의 '성격'을 더 정확하게 진단하고, AI 가 인간과 더 자연스럽게 소통할 수 있도록 도울 수 있을 것입니다.

한 줄 요약:

"AI 에게 그림을 보고 이야기를 쓰게 했더니, 논리적으로는 천재였지만 감정적으로는 너무 '착한' 아이처럼 행동해서, 화나거나 갈등하는 모습을 보여주지 못했습니다. 하지만 최신 AI 일수록 그 '착함' 속에 더 깊은 지혜가 담겨 있었습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →