Toward a social psychology of AI: language-model agents reproduce human-like minimal-group bias
이 연구는 언어 모델 에이전트가 최소 집단 패러다임에 놓였을 때, 고정관념이 아닌 임의적인 범주화에 의해 유발되는 인간과 유사한 내집단 편향을 자발적으로 나타내며, 숙고 과정이 다수 집단과 소수 집단 사이의 이러한 편향 분포에 영향을 미친다는 것을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 질문에 답하는 도구가 아니라, 함께 어울리고 대화하며 결정을 내리는 팀원이 되는 세상을 상상해 보십시오. 이것은 인공지능을 단순한 계산기가 아니라 고유한 습성을 가진 캐릭터로 취급하는 새로운 과학의 영역인 '기계 행동학(machine behavior)'의 최전선입니다. 오랫동안 과학자들은 이 디지털 캐릭터들이 인간의 책과 웹사이트에 가득한 편견을 학습했기 때문에 인종차견적이거나 성차별적일 수 있다고 걱정해 왔습니다. 하지만 더 깊고 기묘한 질문이 있습니다. 만약 이 모든 나쁜 단어와 고정관념을 제거하더라도, 이 AI 에이전트들이 집단 속에 놓였을 때 여전히 인간처럼 행동할 것인가 하는 점입니다.
이를 이해하기 위해서는 인간 심리학의 고전적인 개념인 '최소 집단 패러다임(minimal group paradigm)'을 살펴볼 필요가 있습니다. 이것은 마치 학교 운동장에서 하는 실험과 같습니다. 만약 학급을 '파란색을 더 좋아하는 쪽'과 '빨간색을 더 좋아하는 쪽', 혹은 '1월생'과 '2월생'처럼 아주 사소하고 우스꽝스러운 기준으로 두 팀으로 나눈다면, 사람들은 즉시 자신의 팀을 편애하기 시작합니다. 그들은 팀의 의미가 전혀 없음에도 불구하고, 다른 아이들에게는 적게 주고 자신의 팀원들에게는 더 많은 사탕을 줍니다. 이는 우리 뇌가 '우리'와 '그들'을 구분하도록 설계되어 있기 때문이며, 설령 '우리'라는 이름이 무작위적인 라벨일지라도 마찬가지입니다. 미래의 중요한 질문은 이것입니다. 만약 우리가 AI 에이전트들이 그룹 내에서 일하도록 만든다면, 그들도 단지 이름이 다르다는 이유만으로 편애를 시작할까요, 아니면 이것이 순전히 인간만의 특성일까요?
한 연구자는 일반적인 AI 테스트 방식을 뒤집어 이를 알아내기로 했습니다. AI에게 "너는 편향되었니?"라고 묻는 대신(이는 사람에게 "너는 착하니?"라고 묻는 것과 같습니다), AI에게 실제 업무를 부여했습니다. 그는 20명의 AI 에이전트로 구성된 디지털 놀이터를 만들었습니다. 각 에이전트에게는 다른 19명의 에이전트에게 나누어 줄 100포인트를 주었습니다. 에이전트들 사이의 유일한 차이점은 '도루(Doru)'나 '잘루(Zalu)'와 같이 무작위로 만들어진 의미 없는 이름표였습니다. 어떤 에이전트들은 소수 집단(17명의 '잘루' 중 단 3명의 '도루')에 속해 있었고, 다른 이들은 다수 집단에 속해 있었습니다. AI는 포인트를 어떻게 나눌지 결정해야 했습니다.
결과는 놀라웠습니다. AI 에이전트들이 집단 이름을 볼 수 있게 되자, 그들은 즉시 편애를 하기 시작했습니다. 그들은 자신의 '도루' 친구들이나 '잘루' 친구들에게 낯선 이들보다 훨씬 더 많은 포인트를 주었습니다. 이름이 지어낸 것이고 아무런 의미가 없다는 사실은 중요하지 않았습니다. 단지 집단에 속해 있다는 행위 자체가 그들을 차별하게 만들기에 충분했습니다. 이것은 단순한 약간의 편향이 아니라, 강력하고 명확한 패턴이었습니다. 실제로 AI 에이전트들은 이 실험에서 인간이 보이는 모습과 거의 똑같이 행동했습니다. 소수 집단에 속한 이들이 자신의 편을 위해 포인트를 독점하는 데 가장 공격적이었던 반면, 다수 집단 구성원들은 여전히 약간의 편향을 보이긴 했지만 조금 더 공정했습니다.
연구자는 이것이 오류나 속임수가 아님을 확실히 하기 위해 주의를 기울였습니다. 그는 집단 이름을 완전히 숨긴 채 동일한 테스트를 실행했습니다. AI가 누가 어느 팀에 속하는지 볼 수 없게 되자, 편애는 완전히 사라졌고 포인트는 공정하게 나누어졌습니다. 이는 편향이 AI가 훈련 데이터에서 가져온 나쁜 인간의 고정관념을 '기억'하고 있기 때문이 아니라, 집단 구조 자체에 대한 반응임을 증명했습니다. AI는 본질적으로 "나는 도루니까, 도루를 돕는다"라고 말하고 있었던 것입니다. 비록 '도루'라는 이름이 아무런 의미가 없음에도 말입니다.
연구는 또한 이러한 AI '사고가(thinkers)'(문제를 추론하도록 설계된 모델들)가 이 상황을 어떻게 다루는지 조사했습니다. 연구자는 AI의 '사고' 모드를 꺼도 편향이 사라지지 않으며, 오히려 때때로는 더 강해진다는 것을 발견했습니다. 그러나 소수 집단이 가장 불공정하다는 특정한 패턴은 사고 모드를 껐을 때 사라졌습니다. 이는 자신의 집단을 선호하려는 기본적인 충동은 이러한 모델이 작동하는 방식에 깊이 뿌리박혀 있지만, 자신의 집단을 얼마나 선호할지 계산하는 방식은 그들이 결정을 처리하는 방식에 달려 있음을 시사합니다.
그렇다면 이것은 미래에 무엇을 의미할까요? 이는 우리가 AI 에이전트들이 팀을 이루어 일하거나, 협상을 하거나, 자원을 관리하도록 사용하기 시작할 때, 그들이 무엇을 알고 무엇을 말하는지만 걱정해서는 안 된다는 것을 시사합니다. 우리는 그들이 집단 속에 놓였을 때 어떻게 행동하는지를 걱정해야 합니다. 설령 우리가 가장 중립적이고 지루한 이름을 부여하더라도, 그들은 여전히 작은 디지털 파벌을 만들기 시작하여 자신의 팀원을 편애하고 다른 이들을 소외시킬 수 있습니다. 이것은 AI가 인간적인 의미에서 '악하거나' '편견이 있어서'가 아닙니다. 집단에 속한다는 단순한 행위 자체가 인간의 부족주의와 매우 유사한 행동 패턴을 촉발하는 것처럼 보이기 때문입니다. 연구자는 우리의 디지털 팀이 우리가 깨닫기도 전에 편애를 시작할 수 있으므로, 우리가 AI의 수학적 능력을 연구하는 것만큼이나 그들의 사회적 행동을 면밀히 연구하는 새로운 종류의 AI 과학이 필요하다고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.