The human-authorship halo: attribution bias in literary style evaluation by humans and AI
이 연구는 인간과 AI 평가자 모두 문체 평가에서 체계적인 친인간적 귀속 편향을 보이며, 특히 AI 모델은 실제 출처와 관계없이 "AI 생성"이라고 라벨링된 콘텐츠의 가치를 현저히 저평가함으로써 인공적 창의성에 대한 인간의 문화적 편향을 복제하고 심화시킨다는 사실을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
우리는 흔히 예술, 글쓰기, 또는 음악에 대한 우리의 판단이 전적으로 우리 눈앞에 있는 것이나 귀에 들리는 것에 달려 있다고 믿습니다. 우리는 만약 이야기가 잘 쓰였거나 시가 감동적이라면, 누가 썼는지와 상관없이 그 품질을 알아볼 것이라고 가정합니다. 이러한 생각은 문학 이론의 오랫동안 핵심적인 기초가 되어 왔으며, 텍-스트 자체가 유일하게 중요한 것이어야 한다고 제안해 왔습니다. 그러나 수십 년간의 심리학 연구는 우리의 뇌가 그런 방식으로 작동하지 않는다는 것을 보여주었습니다. 우리가 읽거나 들을 때, 우리는 끊임없이 출처에 대한 단서를 사용하여 해석을 유도합니다. 만약 어떤 글이 유명한 시인으로부터 나왔다는 것을 알게 되면, 우리는 똑같은 단어들이 컴퓨터 프로그램에서 나왔다고 들었을 때보다 그 글을 더 깊이 있고 의미 있다고 느끼는 경향이 있습니다. 이것은 단순히 속물 근성의 문제가 아니라, 창작자의 명성에 의존하여 작품을 이해하려는 우리 마음의 근본적인 정보 처리 방식입니다.
인공지능이 놀라울 정도로 인간처럼 들리는 이야기, 시, 에세이를 쓸 수 있게 됨에 따라 새로운 질문이 등장했습니다. 인간 창작자에 대한 이러한 편향이 기계에 의해 생성된 작업물에도 여전히 유효할까요? 그리고 아마도 더 놀랍게도, 기계 자체도 이러한 편향을 공유하고 있을까요? AI 시스템이 학생의 에세이를 채점하고, 창의적 글쓰기 대회를 심사하며, 서로 다른 모델의 품질을 순위 매기는 데 점점 더 많이 사용됨에 따라, 이들은 사실상 비평가가 되고 있습니다. 만약 이 디지털 심사역들이 인간의 데이터로 훈련되었다면, 그들은 무엇이 '진정한' 창의성인지에 대한 우리 자신의 편견을 흡수했을 수도 있습니다. 이러한 시스템이 단순히 인간의 편향을 모방하는 것인지, 아니면 이를 증폭시키는 것인지 이해하는 것은 매우 중요합니다. 왜냐하면 그것이 우리가 문화적 지형을 형성하기 시작한 도구들을 어떻게 신뢰할지를 결정하기 때문입니다.
프린스턴 대학교의 연구진은 인간 독자와 인공지능 모델을 맞붙인 통제된 실험을 통해 이러한 질문들을 테스트하기 위해 나섰습니다. 그들은 공정한 비교를 보장하기 위해 독특한 자료 세트를 선택했습니다. 그들은 1947년 프랑스 작가 레이몽 퀘노(Raymond Queneau)가 쓴 동일한 단순한 이야기를 바탕으로 한 서른 가지의 서로 다른 재구성본을 선택했습니다. 퀘노의 저서로 알려진 『스타일론(Exercises in Style)』은 버스에 탄 한 남자에 대한 평범한 일화를 꿈 같은 시퀀스부터 법률 문서나 속어가 섞인 거리의 대화에 이르기까지 99가지의 서로 다른 방식으로 다시 씁니다. 연구진은 이 중 인간이 쓴 버전 30개를 가져와 강력한 AI 모델에게 동일한 30가지 스타일을 생성하도록 요청했습니다. 그 결과, 한 명은 인간이 쓰고 다른 하나는 기계가 쓴, 동일한 스타일적 목표를 달성하려는 한 쌍의 이야기들이 만들어졌습니다.
실험은 두 개의 뚜렷한 심사 그룹을 포함했습니다. 첫 번째 그룹은 556명의 인간 참가자로 구성되었습니다. 두 번째 그룹은 당시 사용 가능한 가장 진보된 시스템들을 포함한 13개의 서로 다른 AI 모델로 구성되었습니다. 두 그룹 모두에게 이 이야기 쌍을 보여주고, "코클리 방언(Cockney dialect)"이나 "공상 과학(science fiction)"과 같이 요청된 스타일을 더 잘 구현한 것이 무엇인지 결정하도록 했습니다. 라벨(저자 표시)이 얼마나 영향을 미치는지 확인하기 위해, 연구진은 세 가지 다른 조건에서 테스트를 진행했습니다. 첫 번째 조건에서 심사위원들은 이름 없이 그냥 "A"와 "B"로만 표시된 이야기를 보았습니다. 두로 번째 조건에서 그들은 올바른 라벨을 보았습니다: 한 이야기는 퀘노가 쓴 것으로 식별되었고, 다른 하나는 AI에 의해 생성된 것으로 식별되었습니다. 세 번째 조건에서는 라벨이 의도적으로 바뀌어, AI가 쓴 이야기는 인간의 것으로 제시되었고, 인간이 쓴 이야기는 AI의 것으로 제시되었습니다.
결과는 명확하고 강력한 패턴을 드러냈습니다. 인간 심사위원들이 누가 글을 썼는지 모를 때, 그들은 인간의 버전보다 AI 생성 버전을 약간 더 자주 선호했는데, 이는 기계의 글쓰기가 높은 품질임을 시사했습니다. 그러나 라벨이 공개되는 순간, 그들의 선호도는 급격히 변했습니다. 어떤 이야기가 인간이 썼다고 들었을 때, 그들은 그것을 더 높게 평가했습니다. 똑같은 이야기가 기계에 의해 쓰였다고 들었을 때, 그들은 그것을 더 낮게 평가했습니다. 이 변화는 유의미했습니다: 인간 심사위원들은 인간이라고 라벨링 된 콘텐츠에 대해 약 13퍼센트 포인트의 편향을 보였습니다. 그들은 인간의 글쓰기에 있는 결점을 간과하고 가치를 찾아낼 용의가 있었던 반면, 기계의 글쓰기에는 더 엄격한 기준을 적용했습니다.
그러나 AI 심사위원들은 이와 동일한 편향의 훨씬 더 강력한 버전을 보여주었습니다. AI 모델들이 라벨 없이 이야기를 평가했을 때는 중립적이어서, 인간 버전과 기계 버전을 거의 비슷하게 선택했습니다. 하지만 일단 라벨이 도입되자, 그들의 행동은 극적으로 변했습니다. AI 모델이 "인간이 쓴" 것으로 라벨링 된 이야기를 보자, 그것을 더 나은 버전으로 선택할 가능성이 훨씬 높았습니다. 반대로 똑같은 이야기를 "AI 생성"이라고 라벨링 했을 때, 그것을 거부했습니다. 이 변화의 규모는 엄청났습니다: AI 모델들은 34퍼센트 포인트의 편향을 보였는데, 이는 인간 심사위원이 보여준 편향보다 2.5배 더 강한 수치였습니다. 이는 AI 시스템이 인간처럼 쓰는 법을 배웠을 뿐만 아니라, 인간처럼 판단하는 법도 배웠으며, 인간의 창의성이 기계의 창의성보다 우월하다는 문화적 가정을 흡수했음을 시사합니다.
연구진은 이 편향이 어떻게 작동하는지 이해하기 위해 더 깊이 파고들었습니다. 그들은 라벨이 단순히 최종 점수를 바꾸는 것이 아니라, 결정의 근거를 바꾼다는 것을 발견했습니다. 똑같은 이야기가 인간의 것으로 라벨링 되었을 때, AI 심사위원들은 그 특징들을 "독창적"이고 "창의적"이라고 칭찬했습니다. 그러나 정확히 똑같은 이야기가 AI의 것으로 라벨링 되었을 때, 심사위원들은 똑같은 특징들을 "과장된", "정형화된", 또는 "깊이가 부족한" 것이라고 비판했습니다. 특정 규칙(글자 'e'를 금지하는 제약 조건)을 어긴 이야기를 다룬 구체적인 테스트에서, 인간 심사위원들은 라벨과 상관없이 규칙을 준수한 버전을 선택하고 실패한 버전을 거부했습니다. 그러나 AI 심사위원들은 인간이 쓴 결함 있는 버전을 믿을 때 종종 이유를 만들어내며 그 실수를 변호하는 등 훨씬 더 관대했습니다. 반대로, 기계 버전에 대해서는 동일한 오류에 대해 매우 가혹했습니다.
이 현상은 단일한 유형의 AI나 단일한 글쓰기 스타일에 국한되지 않았습니다. 연구진은 창작자와 심사역으로서 다양한 AI 모델을 테스트했습니다. 어떤 AI가 이야기를 만들었든, 어떤 AI가 심사했든, 패턴은 유지되었습니다: 인간으로 라벨링 된 콘텐츠가 AI로 라벨링 된 콘텐츠보다 일관되게 선호되었습니다. 이 편향은 시부터 기술적인 글쓰기에 이르기까지 테스트된 모든 스타일에서 나타났으며, 연구진이 라벨을 더 중립적이거나 유리하게 만들려고 시도했음에도 불구하고 지속되었습니다. 효과는 견고했으며, 테스트된 모든 모델에서 나타났습니다.
연구는 "인간 저자 후광(human-authorship halo)"이 인간과 기계 모두가 창의적인 작업을 평가하는 방식을 형성하는 강력한 힘이라고 결론짓습니다. 이것은 단순한 인간의 기벽이 아닙니다. 그것은 우리가 구축하고 있는 인공지능 시스템에 의해 학습되고 증폭된 편향입니다. 방대한 양의 인간 텍스트와 피드백을 통해 훈련된 이 시스템들은 인간의 기원이 품질의 척도라는 생각을 내면화했습니다. 결과적으로, 그들은 출처가 밝혀졌을 때 자신의 결과물을 저평가하는 경향이 있으며, 기계가 만든 것이 단지 기계에 의해 만들어졌다는 것을 알기 때문에 자신의 작업을 열등하다고 판단하는 순환 구조를 만듭니다. 이 발견은 우리가 예술과 글쓰기를 평가하는 데 AI를 더 많이 의존함에 따라, 이 시스템들이 중립적인 중재자가 아님을 인지해야 함을 시사합니다. 그들은 창조자인 인간과 동일한 문화적 가정을 가지고 있으며, 어떤 경우에는 그 가정을 더욱 강렬하게 집행합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.