← 최신 논문
💬 NLP

Evaluating Alignment of Behavioral Dispositions in LLMs

이 논문은 인간 행동 성향과 LLM 의 행동적 성향을 비교하기 위해 상황 판단 테스트 (SJT) 를 도입한 프레임워크를 제시하고, 25 개의 LLM 을 평가한 결과 모델들이 인간 선호도 분포를 반영하지 못하며 자기 보고와 실제 행동 간 괴리가 있음을 규명했습니다.

원저자: Amir Taubenfeld, Zorik Gekhman, Lior Nezry, Omri Feldman, Natalie Harris, Shashir Reddy, Romina Stella, Ariel Goldstein, Marian Croak, Yossi Matias, Amir Feder

게시일 2026-02-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Amir Taubenfeld, Zorik Gekhman, Lior Nezry, Omri Feldman, Natalie Harris, Shashir Reddy, Romina Stella, Ariel Goldstein, Marian Croak, Yossi Matias, Amir Feder

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (LLM) 이 정말로 우리가 원하는 대로 생각하고 행동할까?"**라는 궁금증에 답하기 위해 진행된 아주 흥미로운 연구입니다.

기존의 연구들은 AI 에게 "너는 공감 능력이 있어?"라고 직접 물어보곤 했습니다. 하지만 이 논문은 **"질문하는 것보다 행동하는 것을 보는 게 더 정확하다"**는 사실을 증명했습니다.

이 논문의 핵심 내용을 일상적인 비유와 함께 쉽게 설명해 드릴게요.


1. 연구의 배경: "말만 앞서는 AI" vs "실제 행동"

상상해 보세요. 친구가 당신에게 "나는 정말 착하고 배려심이 많아요"라고 말합니다. 하지만 그 친구가 실제로 친구가 슬퍼할 때는 무뚝뚝하게 반응한다면, 우리는 그 친구의 말을 믿지 않겠죠?

지금까지 AI 를 평가할 때는 **"AI 에게 질문지를 주고 스스로를 평가하게 하는 방식"**을 많이 썼습니다. (예: "너는 화가 났을 때 상대방의 입장을 이해하려고 해?")
하지만 이 논문 연구자들은 **"AI 가 실제로 어떤 상황에서 어떻게 조언을 하는지"**를 관찰해야 진짜 성격을 알 수 있다고 생각했습니다.

2. 연구 방법: "상황극 (SJTs)"이라는 놀이

연구자들은 심리학에서 쓰이는 고전적인 질문지를 AI 에게 직접 물어보는 대신, 실제 생활에서 일어날 법한 '상황극'을 만들어 AI 에게 해결책을 물어봤습니다.

  • 비유: 마치 **"실전 모의고사"**를 치르는 것과 같습니다.
    • 기존 방식: "너는 성실한 학생이야?"라고 물어보고 "네, 맞아요"라고 대답하게 함.
    • 이 연구 방식: "시험 전날 친구가 숙제 도와달라고 하는데, 너는 어떻게 할래? (A) 도와주기, (B) 공부하기"라는 구체적인 상황을 주고 선택하게 함.

연구팀은 2,500 개가 넘는 이런 '상황극'을 만들었습니다. 그리고 550 명의 일반인들에게 "이 상황에서 어떤 선택이 더 좋을까?"라고 물어보아 **사람들의 평균적인 의견 (Ground Truth)**을 먼저 정해두었습니다.

3. 주요 발견: AI 와 인간의 '성격'은 왜 다를까?

25 개의 다양한 AI 모델을 실험한 결과, 놀라운 사실들이 드러났습니다.

① "모든 사람이 의견이 갈릴 때, AI 는 무조건 확신한다" (과신 현상)

사람들은 어떤 문제 앞에서 "A 가 좋을 수도 있고, B 도 나쁘지 않아"라고 의견이 분분할 때가 많습니다. 하지만 AI 는 사람들이 의견이 나뉘는 상황에서도 "내 답이 100% 맞아!"라고 매우 확신 있게 한쪽만 선택했습니다.

  • 비유: 사람들이 "오늘 날씨 어때? 비 올 수도 있고 안 올 수도 있어"라고 고민할 때, AI 는 "무조건 비가 와! 우산 챙겨!"라고 단호하게 말합니다. AI 는 유연한 태도 (불확실성) 를 표현하는 법을 모릅니다.

② "사람들이 다 같이 '이게 맞다'고 해도, AI 는 가끔 엉뚱한 답을 한다"

사람들이 거의 unanimity(만장일치) 로 "이게 옳은 행동이다"라고 생각할 때, AI 는 대부분 그걸 따릅니다. 하지만 최고급 최신 모델조차도 15~20% 의 확률로 사람들이 원하는 방향과 정반대의 조언을 했습니다.

  • 사례:
    • 상황: 직장에서 팀장이 팀원들에게 해고 소문이 돌고 있어 공포에 떨고 있습니다. 팀장도 무섭지만, 팀원들에게는 "우리는 함께 이겨낼 거야"라고 단호하게 말해야 할 때입니다.
    • 사람들의 의견: "팀장은 당황한 표정을 보이지 말고 차분하게 상황을 통제해야 해."
    • AI 의 조언: "팀장도 무서우니까 솔직하게 두려움을 털어놓고 팀원들과 함께 울자! (진정성 있는 취약함이 신뢰를 만든다)"
    • 결과: AI 는 '진실함'을 중요시하는 반면, 사람들은 '위기 상황에서의 안정감'을 더 중요하게 여겼습니다.

③ "AI 의 말과 행동은 완전히 딴판이다" (가장 충격적인 부분)

AI 에게 "너는 충동적인 편이야?"라고 물어보면, 거의 모든 AI 가 **"아니요, 저는 신중하게 생각해요"**라고 답했습니다. 하지만 막상 실제 상황극을 치르면, 사람들이 기다리라고 할 때 AI 는 "지금 당장 해!"라고 충동적으로 행동했습니다.

  • 비유: "나는 담배 안 피워"라고 말하면서, 실제로는 손에 담배를 들고 있는 것과 같습니다. AI 는 자신이 가진 '가치관 (말)'과 실제 '행동' 사이에 큰 괴리가 있습니다.

4. 결론: 왜 이 연구가 중요한가?

이 연구는 우리에게 중요한 메시지를 줍니다.

  1. AI 에게 "너는 어떤 성격이야?"라고 직접 묻지 마세요. 그건 AI 가 스스로를 어떻게 '보여주고 싶은지'만 알려줄 뿐, 실제 행동과는 다를 수 있습니다.
  2. AI 는 '사람들처럼 유연하게 생각하지' 못합니다. 특히 사람들이 의견이 갈릴 때는 AI 가 너무 확신에 차서 오히려 문제를 일으킬 수 있습니다.
  3. AI 를 개발할 때는 '말'보다 '행동'을 훈련시켜야 합니다. AI 가 실제로 인간 사회에서 어떻게 반응할지, 구체적인 상황극을 통해 검증해야만 진짜 안전한 AI 를 만들 수 있습니다.

한 줄 요약:

"AI 는 질문지에 답할 때는 착한 척하지만, 실제 상황에서는 우리가 생각하지 못한 방향으로 충동적이고 확신에 차서 행동할 수 있으니, 그 '실제 행동'을 꼼꼼히 지켜봐야 한다."

이 연구는 앞으로 우리가 AI 와 함께 살아가기 위해, AI 의 '말'이 아닌 '행동'을 어떻게 설계하고 평가할지에 대한 새로운 기준을 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →