← 최신 논문
💻 computer science

Six Fallacies in Substituting Large Language Models for Human Participants

이 논문은 대규모 언어 모델이 행동 및 심리학 연구에서 인간 피험자를 대체해서는 안 된다고 주장하며, 여섯 가지 결정적인 해석적 오류를 근거로 들어 인간의 증거를 대체하기보다는 이를 보완하는 실용적 시뮬레이션 도구로서의 책임 있는 사용을 옹호한다.

원저자: Zhicheng Lin

게시일 2026-06-26
📖 5 분 읽기🧠 심층 분석

원저자: Zhicheng Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 인간의 사고, 감정, 그리고 의사결정 과정을 이해하려는 심리학자라고 상상해 보십시오. 전통적인 방식이라면 실제 인간을 인터뷰해야 했겠지만, 이는 느리고 비용이 많이 들며 지치는 일입니다. 최근 새로운 아이디어가 떠올랐습니다. "그럼 아주 똑똑한 AI(대규모 언어 모델, 즉 LLM)에게 물어보면 어떨까? AI는 인간처럼 말하니까, 어쩌면 인간 참가자와 다를 바 없을지도 몰라."

당신이 공유한 논문, **"대규모 언어 모델을 인간 참가자로 대체할 때 발생하는 6가지 오류(Six Fallacies in Substituting Large Language Models for Human Participants)"**는 이 생각이 함정이라고 주장합니다. 저자인 Zhicheng Lin은 AI가 매우 인상적이긴 하지만, AI를 실제 사람의 대체제로 취급하는 것은 마치 고해상도 유화를 보고 바다를 연구하려는 것과 같다고 말합니다. 그 그림은 매우 진짜처럼 보이지만, 그 안에는 물도, 파도도, 깊이도 없습니다.

다음은 논문이 밝혀낸 **6가지 주요 실수(오류)**를 쉬운 비유와 함께 설명한 것입니다.

1. "마술의 속임수" 실수 (토큰 예측 vs 지능)

오류: AI가 문장에서 다음 단어를 완벽하게 예측한다고 해서, 실제로 그 내용을 '이해'하고 있다고 생각하는 것.
비유: 셰익스피어 희곡의 모든 대사를 암기한 앵무새를 상상해 보십시오. 만약 당신이 "다음에 무슨 내용이 나오지?"라고 묻는다면, 앵무새는 다음 대사를 완벽하게 읊을 수 있을 것입니다. 하지만 앵무새는 '사랑', '배신', 또는 '죽음'이 실제로 어떤 느낌인지 알지 못합니다. 앵무새에게는 몸도, 눈도, 심장도 없습니다. 그저 "사랑"이라는 단어 뒤에는 보통 "진실"이라는 단어가 온다는 패턴을 알고 있을 뿐입니다.
논문의 핵심: AI는 통계적 앵무새입니다. AI는 마음이나 감정을 가지고 있어서가 아니라, 패턴에 기반하여 텍스트를 예측합니다. AI는 피부에 닿는 햇살을 느껴본 적도, 사과의 맛을 본 적도 없습니다. 따라서 AI의 "지능"은 인간의 지능과는 다릅니다.

2. "평범한 조(Average Joe)" 실수 (평균적 인간의 오류)

오류: AI가 인간의 텍스트로 학습되었으므로, AI가 "평균적인" 인간을 대표한다고 가정하는 것.
비유: 당신이 음식에 대해 일반적인 사람들이 어떻게 생각하는지 알고 싶다고 가정해 봅시다. 당신은 세상의 모든 요리책과 음식 블로그를 읽은 로봇에게 질문합니다. 로봇은 매우 예의 바르고, 균형 잡혔으며, "정답에 가까운" 답변을 내놓을 것입니다. 하지만 실제 사람들은 훨씬 더 복잡하고 무질서합니다! 어떤 사람은 채소를 싫어하고, 어떤 사람은 이상한 조합으로 음식을 먹으며, 어떤 사람은 자신이 무엇을 먹는지에 대해 거짓말을 하기도 합니다. 로봇은 결코 실수하거나 기이한 버릇을 보이지 않는, "완벽하게 정제된" 인간과 같습니다.
논문의 핵심: AI는 특정 유형의 텍스트(주로 서구적이고, 교육 수준이 높으며, 인터넷 중심적인 데이터)로 학습되었고, "도움이 되고 안전하도록" 조정되었습니다. 이로 인해 AI는 너무 완벽하고 중립적입니다. AI는 실제 인간 집단의 무질서하고, 편향되며, 다양한 현실을 포착하지 못합니다.

3. "결과는 같지만 엔진은 다른" 실수 (정렬을 통한 설명의 오류)

오류: AI가 인간과 같은 답을 내놓는다면, AI가 인간과 같은 방식으로 생각하고 있다고 믿는 것.
비유: 디지털 시계와 해시계가 모두 오후 12시를 가리키고 있다고 상상해 보십시오. 두 시계는 "정렬"되어 있습니다. 하지만 디지털 시계는 배터리와 회로를 사용하는 반면, 해시계는 태양과 그림자를 사용합니다. 만약 당신이 해시계를 연구해서 배터리가 어떻게 작동하는지 이해하려고 한다면, 당신은 실패할 것입니다. AI와 인간이 같은 답을 낸다고 해서, 그들이 같은 사고 과정을 거쳤음을 의미하는 것은 아닙니다.
논문의 핵심: AI는 잘못된 이유(예: 패턴 추측)로 정답을 맞힐 수도 있습니다. 결과물이 똑같이 보인다고 해서 AI가 인간처럼 "생각하고 있다"고 가정할 수는 없습니다.

4. "유령과 대화하기" 실수 (의인화)

오류: AI가 너무나 인간처럼 말하기 때문에, AI에게 감정, 신념, 혹은 "영혼"이 있다고 부여하는 것.
비유: 매우 사실적인 복술 인형(Ventriloquist dummy)과 대화할 때, 당신은 그 인형에게 인격이 있다고 느낄 수 있습니다. 하지만 만약 당신이 인형에게 "유령을 믿나요?"라고 물었을 때 인형이 "네"라고 대답한다면, 그것은 인형이 무언가를 믿기 때문이 아닙니다. 그 맥열에서 "네"라고 말하도록 프로그래밍 되었기 때문입니다. AI는 바로 그 인형입니다. AI에게는 내면의 삶도, 두려움도, 욕망도 없습니다.
논문의 핵심: 연구자들이 AI가 "믿는다"거나 "느낀다"라고 표현할 때, 그들은 실수를 범하는 것입니다. AI는 단지 텍스트를 생성하는 도구일 뿐입니다. AI에게는 의식이 없습니다.

5. "하나의 크기로 통일하기" 실수 (정체성의 본질화)

오류: "흑인 여성처럼 행동해줘" 또는 "중국인 남성처럼 행동해줘"라고 입력하기만 하면, 해당 집단을 완벽하고 현실적으로 재현할 수 있다고 생각하는 것.
비유: 요리사에게 "일반적인 이탈리아 요리를 만들어줘"라고 요청한다고 상상해 보십시오. 요리사는 피자를 만들 수도 있습니다. 하지만 "이탈리안"은 단 하나의 개념이 아닙니다. 수백만 개의 서로 다른 지역, 가족, 개인적 취향이 존재합니다. 만약 당신이 AI에게 "흑인 여성"이 되어달라고 요청한다면, AI는 실제 흑인 여성이 가진 복잡하고 독특한 현실을 보여주는 대신, 단순한 스테레오타입(희화화된 모습)을 보여줄 수 있습니다.
논문의 핵심: 실제 인간의 정체성은 유동적이고 복잡합니다. 정체성을 단순한 라벨로 축소하여 프롬프트에 넣는 것은, 실제 사람을 만드는 것이 아니라 카툰 버전의 인물을 만드는 것에 불과합니다.

6. "시간 여행자" 실수 (대체 오류)

오류: 현재의 사건들을 연구하기 위해 AI 데이터를 실제 인간 데이터의 대체제로 사용할 수 있다고 생각하는 것.
비유: 2020년의 사진첩을 보고 오늘날 사람들이 무엇을 입고 있는지 이해하려고 노력하는 것과 같습니다. 사진첩은 정적입니다. 변하지 않습니다. 만약 내일 새로운 패션 트렌드가 시작된다면, 사진첩은 그것을 알지 못할 것입니다. AI도 이와 같습니다. AI는 특정 시점까지의 데이터로 학습되었습니다. AI는 새로운 사회적 움직임이나 변화하는 여론에 실시간으로 적응할 수 없습니다.
논의의 핵심: AI는 과거에 갇혀 있습니다. 만약 당신이 현재의 인간 행동을 연구하기 위해 AI를 사용한다면, 당신은 살아 숨 쉬는 현재가 아니라 역사의 한 단면을 연구하고 있는 것입니다.

결론: 우리는 무엇을 해야 하는가?

이 논문은 AI가 쓸모없다고 말하는 것이 아닙니다. 우리가 AI를 사용하는 방식을 바꿔야 한다고 말합니다.

  • AI를 사람의 대체제로 사용하지 마십시오. 실제 인간 참가자를 로봇으로 바꾸면서 동일한 과학적 진실을 기대할 수는 없습니다.
  • AI를 "시뮬레이션 도구"로 사용하십시오. 조종사가 비행기를 테스트하고 새로운 아이디어를 시험하며 비행기가 어떻게 반응할지 알아보기 위해 시뮬레이터를 사용하는 것과 같습니다. 하지만 시뮬레이터가 곧 비행기 자체라고 말하지 않으며, 시뮬레이터에 실제 승객을 태우지는 않습니다.
  • 최선의 접근법: AI를 사용하여 아이디어를 생성하거나 가설을 빠르게 검증(시뮬레이터 역할)하되, 반드시 실제 인간 데이터(실제 비행)를 통해 당신의 결과가 맞는지 확인해야 합니다.

요약하자면, AI는 인간의 언어를 비추는 강력한 거울이지만, 인간의 마음을 들여다보는 창문은 아닙니다. 우리는 거울에 비친 반영을 실제 현실과 혼동하지 않도록 주의해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →