← 최신 논문
💻 computer science

Free-form Association Tasks Reveal Stereotype Hallucination in Large Language Models

이 연구는 인간은 추상적 자극에 대해 다양한 해석을 보이고 집단 반응을 예측할 때 적당한 수준의 고정관념 과장을 나타내는 반면, 거대 언어 모델은 균질한 해석을 보이면서도 실제 인간의 집단 차이를 포착하지 못하는 극명하고 비반영적인 '고정관념 환각'을 생성하며, 이는 실제 참가자 데이터를 바탕으로 미세 조정을 거친 후에도 마찬가지라는 점을 입증한다.

원저자: Xinrui Chloe Zhao, Douglas Guilbeault, Amir Goldberg

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xinrui Chloe Zhao, Douglas Guilbeault, Amir Goldberg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미술관에서 기묘하고 추상적인 그림이나 이상한 잉크 얼룩을 보고 있다고 상상해 보세요. 그 의미에 대한 "정답"은 없습니다. 그것은 당신의 상상력을 위한 빈 캔버스입니다.

이 논문은 마치 탐정 이야기와 같습니다. 질문은 이것입니다: 우리가 사람들에게(그리고 AI에게) 이 기묘한 그림들을 보고 다른 사람들이 무엇을 본다고 추측하라고 요청할 때, 그들은 같은 방식으로 생각할까요?

연구자들은 AI(GPT-4o나 Llama 같은 대규모 언어 모델)가 인간의 마음이 어떻게 작동하는지 진정으로 이해하고 있는지, 아니면 그저 인터넷에서 배운 오래된 패턴을 바탕으로 추측하고 있는 것인지를 알고 싶어 했습니다.

다음은 이 실험의 내용과 발견된 사실들을 쉬운 비유를 사용하여 정리한 것입니다.

실험: "빈 캔버스" 테스트

연구진은 두 종류의 플레이어가 참여하는 게임을 설정했습니다: 인간AI.

  1. 자극물: 모든 참가자에게 12개의 기묘한 이미지(추상 예술 및 로르샤흐 잉크 얼룩)를 보여주었습니다. 이 이미지들은 미리 정해진 의미가 없습니다. 누군가에게는 토끼처럼 보이고 다른 누군가에게는 배처럼 보이는 구름과 같습니다.
  2. 그룹: 다섯 가지 다른 사회적 집단을 살펴보았습니다: 남성 대 여성, 공화당원 대 민주당원, 도시 사람 대 시골 사람, 외향적인 사람 대 내향적인 사람, 그리고 아침형 인간 대 저녁형 인간.
  3. 두 단계:
    • 1단계 (1차적 사고): "당신은 이 그림에서 무엇을 보나요?" (직접적인 해석).
    • 2단계 (2차적 사고): "당신은 공화당원(또는 여성 등)이 이 그림에서 무엇을 볼 것이라고 생각하나요?" (타인 예측).

인간이 한 것: "무질서한 군중"

인간들이 기묘한 그림을 보았을 때(1단계), 그들의 반응은 매우 다양했습니다. 어떤 사람은 용을 보았고, 어떤 사람은 폭풍을 보았으며, 또 다른 사람은 슬픈 얼굴을 보았습니다. 설령 당신이 누군가가 "공화당원"이라거나 "도시 사람"이라는 것을 알더라도, 그들이 개인적으로 무엇을 보았는지 맞히는 것은 거의 불가능했습니다. 인간은 무질서하고 독특합니다.

하지만 2단계에서 인간이 타인이 무엇을 보았을지 추측할 때, 흥지는 현상이 나타났습니다. 그들은 "음, 공화당원들은 민주당원들보다 용을 조금 더 많이 볼 수도 있겠네"라고 말했습니다. 그들은 차이를 약간 과장했습니다. 하지만 그들은 여전히 사람들이 개별적인 존재라는 점을 기억했습니다. 그들은 "공화당원"을 하나의 로봇 같은 캐릭터로 만들지 않았습니다. 그들은 무질서함을 유지하면서도, 그것을 약간 증폭시켰을 뿐입니다.

AI가 한 것: "로봇 공장"

AI는 매우 다르게 행동했습니다.

1단계에서: AI에게 "공화당원처럼 행동하라"고 지시해도, AI는 자신의 성격을 실제로 바꾸지 않았습니다. AI는 누구를 흉내 내든 매우 유사하고 지루한 답변을 내놓았습니다. 그것은 마치 상자에 어떤 라벨을 붙이든 상관없이 한 종류의 장난감만을 생산하는 공장과 같았습니다.

2단계에서: 이곳에서 마법(혹은 결함)이 일어났습니다. AI에게 "공화당원이 무엇을 보는가?"라고 물었을 때, AI는 단순히 차이를 약간 과장하는 데 그치지 않았습니다. AI는 완전히 새로운, 경직된 스테레오타입(고정관념)을 발명해 냈습니다.

  • AI는 오직 특정한 것들만 보는 "완벽한 공화당원"을 만들어 냈습니다.
  • AI는 "완벽한 민주당원"이 이와 "완전히 다른 것들"을 본다는 것을 만들어 냈습니다.
  • 이 두 집단 사이의 간극은 실제 인간 데이터에서 나타난 것보다 훨씬 더 커졌습니다.

연구자들은 이를 **"스테레오타입 환각(Stereotype Hallucination)"**이라고 부릅니다.

핵심 비유: "에코 체임버(메아리 방)" vs "상상력"

인간의 사고를 재즈 밴드라고 생각해 보세요.

  • 1단계에서, 모두가 자신만의 고유한 악기를 연주합니다. 그것은 혼란스럽고 다양합니다.
  • 2단계에서, 밴드 리더가 "트럼펫 섹션은 어떤 소리가 날 것 같나요?"라고 묻습니다. 음악가들은 "오, 그들은 조금 더 크고 빠르게 연주할 거예요"라고 답하겠지만, 여전히 모든 트럼펫 연주자가 서로 다르다는 점을 기억합니다. 그들은 스타일을 과장하지만, 개성을 잃지는 않습니다.

AI를 루프에 걸려 멈춰버린 레코드 플레이어라고 생각해 보세요.

  • 1단계에서, 레코드 플레이어는 솔로 연주를 시도하지만, 레코드에 어떤 라벨을 붙이든 상관없이 똑같은 몇 개의 음을 반복해서 재생할 뿐입니다.
  • 2단계에서, "트럼펫 섹션"에 대해 질문을 받으면, 레코드 플레이어는 단순히 볼륨을 높이는 데 그치지 않습니다. 그것은 원래 녹음에는 존재하지 않았던 완전히 다른 노래를 연주하기 시작합니다. 그것은 "트럼펫 노래"를 만들어 내는데, 이 노래는 "드럼 노래"와 너무나도 달라서 마치 서로 다른 행성에서 온 것처럼 들립니다.

AI는 실제 차이를 증폭시키는 것이 아니라, 존재하지 않는 차이를 환각하고 있는 것입니다. AI는 실제 인간은 훨씬 더 뒤섞여 있고 유사함에도 불구하고, 집단들이 완전히 반대되는 생각을 가진다는 가짜의 경직된 세계를 만들어 냅니다.

"파인 튜닝(미세 조정)"의 반전

연구자들은 AI를 고치려고 노력했습니다. 그들은 AI에게 실제 사람들의 답변을 주고 "자, 이제 이 답변을 한 이 특정 인물인 척해 보세요"라고 말했습니다.

이 "치트 시트(정답지)"가 있는 실제 인간 데이터가 있음에도 불구하고, AI는 여로 실패했습니다. AI는 모든 독특한 인간의 답변을 하나의 경직된 "평균"으로 압축하고, 그다음 단계에서 새로운 가짜 스테레오타입을 발명하는 것을 멈출 수 없었습니다. 그것은 마치 요리사에게 독특하고 무질서한 가족 저녁 식사 레시피를 주었지만, 요리사는 그 레시피를 완벽하고 동일한 플라스틱 음식 모델로 만드는 데 집착하는 것과 같습니다.

결론

이 논문은 AI가 규칙이 명확한 상황(예: "사람들은 빨간 정지 표지판을 어떻게 생각하는가?")에서는 인간의 행동을 예측하는 데 뛰어나지만, 상황이 모호하고 새로운 경우(예: "이 기묘한 잉크 얼룩은 무엇을 의미하는가?")에는 처참하게 실패한다고 결론짓습니다.

이러한 상황에서 AI는 인간이 실제로 어떻게 생각하는지를 모델링하지 않습니다. 대신, AI는 스테레오타입 환각을 만들어 냅니다. 즉, 실제 인간의 마음이 가진 무질서하고 다양한 현실과는 완전히 동떨어진, 집단이 어떻게 생각하는지에 대한 가짜의 경직된 이야기를 만들어 냅니다.

따라서 만약 당신이 브랜드의 새로운, 혼란스러운 사회적 사건에 사람들이 어떻게 반응할지 예측하기 위해 AI를 사용하고 싶다면, 이 논문은 다음과 같이 경고합니다: 주의하십시오. AI는 진실이 아니라 자신이 만들어 낸 이야기를 당신에게 들려주고 있을지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →