Not-quite-human tastes: the stylized omnivorousness of LLM survey surrogates
이 연구는 거대 언어 모델이 방대한 수의 설문 응답자를 생성할 수는 있지만, 그 결과물인 이른바 "실리콘 대리인(silicon surrogates)"들은 인간의 문화적 취향을 매우 정형화되고 왜곡된 방식으로 재현하며, 선호도를 체계적으로 과대평가하고, 복잡한 관계 구조를 포착하는 데 실패하며, 연령, 계층, 성별, 인종과 같은 주요 사회적 차원과 어긋난다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 사람들이 실제로 어떤 음악을 좋아하는지 이해하려고 한다고 상상해 보세요. 1만 명의 실제 인간에게 물어볼 수도 있고, 혹은 아주 똑똑한 컴퓨터 프로그램에게 1만 명의 인간인 척 연기하라고 시킬 수도 있습니다. 이 논문은 다음과 같은 질문을 던집니다. 만약 당신이 컴퓨터에게 묻는다면, 그 컴퓨터는 진실을 말할 것인가?
연구진은 실제 음악 취향에 관한 설문 조사(SPPA)를 바탕으로, 세 가지 서로 다른 AI 모델(OpenAI, Anthropic, DeepSeek)에게 해당 설문 속 모든 사람의 "가짜" 답변을 생성하도록 요청했습니다. 그런 다음 AI의 답변과 실제 인간의 답변을 비교하여 그 모사가 얼마나 근접했는지 확인했습니다.
연구 결과는 다음과 같이 쉽게 설명할 수 있습니다.
1. AI는 "과잉 열광자"이다 (긍정적 편향)
특정 장르의 음악을 좋아하느냐는 질문에 거의 모든 것에 대해 "네!"라고 답하는 사람을 상상해 보세요. 그것이 바로 AI입니다.
- 연구 결과: AI 응답자들은 실제 사람들보다 훨씬 더 자주 음악 장르를 좋아한다고 답했습니다. 실제 사람들이 평균적으로 24%의 장르를 좋아했다면, AI는 약 46%를 좋아한다고 답했습니다.
- 비유: 실제 인간은 까다로운 미식가입니다. 피자는 좋아하지만 브로콜리는 싫어할 수 있죠. 하지만 AI는 모든 메뉴를 다 좋아한다고 주장하는 "슈퍼 이터(super-eater)"입니다. 대부분의 사람들이 실제로 싫어하는 기괴하고 생소한 음식까지도 말이죠. 연구진은 이를 **"과잉 잡식성(hyper-omnivorousness)"**이라고 부릅니다.
- 반전: AI가 주로 부유하고 교육 수준이 높은 백인들의 데이터로 학습되었기 때문에 "소수 집단"을 이해하는 데 서툴 것이라고 생각할 수도 있습니다. 하지만 연구 결과는 정반대였습니다. AI는 다른 집단을 흉내 내는 것보다 부유하고 교육받은 백인을 흉내 내는 데 오히려 더 서툴렀습니다. AI는 자신이 누구를 연기하든 상관없이 그냥 모든 것을 좋아했습니다.
2. AI는 "분위기(Vibe)"를 놓친다 (관계성의 문제)
인간의 취향은 단순히 "예"와 "아니오"의 목록이 아닙니다. 그것은 연결된 그물망입니다. 예를 들어, 재즈를 좋아한다면 블루스도 좋아할 가능성이 높습니다. 컨트리를 좋아한다면 블루그래스도 좋아할 수 있습니다. 이러한 연결이 하나의 "분위기"나 구조를 만듭니다.
- 연구 결과: AI는 이러한 연결을 이해하지 못했습니다. AI는 특정 장르들이 서로 "잘 어울린다"는 사실을 알지 못했습니다.
- 비유: 인간의 음악 취향이 논리적으로 분류되어 그룹화된 잘 정리된 책장이라면, AI의 취향은 바닥에 아무렇게나 던져진 책더미와 같습니다. 책의 개수는 인간과 비슷할지 몰라도, 그 배치 방식은 전혀 말이 되지 않습니다.
- 결과: AI는 함께 어울리는 장르들 사이의 연결(예: 블루스와 클래식 록)을 끊어버리고, 결코 함께 다니지 않는 장르들(예: 힙합과 블루그래스) 사이에 가짜 연결을 만들어냈습니다. 겉으로는 음악 애호가처럼 보였지만, 내부적인 논리는 완전히 뒤섞여 있었습니다.
3. AI는 "사회적 지도"를 잘못 그린다
현실 세계에서 당신이 어떤 음악을 좋아하는지는 당신이 누구인지(연령, 소득, 성별, 인종 등)에 따라 결정되는 경우가 많습니다.
- 연령: AI는 거의 모든 음악이 젊은 세대를 위한 것이라고 생각합니다. AI는 클래식 록(주로 중장년층이 좋아하는 장르) 같은 장르를 마치 십 대들을 위한 것처럼 만들었습니다.
- 계층 (경제력): AI는 더 이상 존재하지 않는 엄격한 "부자와 가난한 자"의 구분을 만들어냈습니다. AI는 "고급(High Brow)" 음악(클래식이나 오페라 등)은 철저히 부유층을 위한 것이고, "저급(Low Brow)" 음악은 빈곤층을 위한 것이라고 결정했습니다. 오늘날 사람들이 이 두 취향을 훨씬 더 자유롭게 혼합한다는 사실을 무시한 것입니다.
- 성별: AI는 미묘한 차이를 거대한 스테레오타입으로 바꾸어 놓았습니다. 실제 여성들이 브로드웨이 뮤지컬을 약간 더 선호한다면, AI는 이를 거대하고 결정적인 특징인 것처럼 만들었습니다. 또한 여성들이 컨트리 음악을 꽤 많이 좋아한다는 실제 트렌드 등을 지워버렸습니다.
- 인종: 이것이 가장 큰 실패였습니다. AI는 가짜 인종적 연관성을 만들어냈습니다. 어떤 장르는 "백인을 위한 것"이고 다른 장르는 "흑인을 위한 것"이라는 식의 결정을 내렸는데, 이는 실제보다 과장되었거나 아예 조작된 것이었습니다. 예를 들어, AI는 힙합을 실제보다 더 인종 색채가 짙게 보이도록 만들었으며, 전자 음악에서도 실제로는 존재하지 않는 인종적 연결 고리를 만들어냈습니다.
결론
이 논문은 AI가 인간의 의견을 흉내 낼 수는 있지만(예: "나는 음악을 좋아한다"라고 말하는 것), 인간 취향의 깊이와 구조를 포착하는 데는 실패한다고 결론짓습니다.
AI를 캐리커처 화가라고 생각해 보세요. 캐리커처 화가에게 사람을 그려달라고 하면, 코와 눈은 제대로 그릴지 몰라도 특징을 너무 과장해서 그림이 우스꽝스럽고 왜곡되게 만드는 것과 같습니다. 인간처럼 보이긴 하지만, 결코 충실한 것은 아닙니다.
만약 연구자들이 이 AI "대리인(surrogates)"들을 사용하여 문화를 연구한다면, 그들은 왜곡된 세상의 모습을 보게 될 것입니다. 모든 사람이 모든 것을 좋아하고, 음악 장르 간의 논리적 연결은 없으며, 사회 집단이 과장되고 가짜인 스테레오타입에 의해 정의되는 그런 세상 말입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.