← 최신 논문
💬 NLP

Stars, Stripes, and Silicon: Unravelling the ChatGPT's All-American, Monochrome, Cis-centric Bias

이 논문은 ChatGPT와 같은 거대 언어 모델의 편향성, 독성 및 신뢰성 결여가 모델 구조보다는 주로 비다양한 학습 데이터에서 기인한다고 주장하며, 사회적 해악을 완화하고 공평한 AI 배포를 보장하기 위해 학제 간 협력과 강력한 거버넌스 체계가 필요하다고 논한다.

원저자: Federico Torrielli

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Federico Torrielli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 에코 체임버: 왜 AI는 특정한 유형의 인간처럼 들리는가

거대한 디지털 도서관을 상상해 보세요. 그곳에는 인터넷에 쓰인 거의 모든 것이 담겨 있습니다. 이제 이 도서관의 모든 책, 웹사이트, 포럼 게시물을 읽은 아주 똑똑한 로봇 사서가 있다고 상상해 보세요. 이 로봇은 우리처럼 무언가를 "생각"하거나 "알고" 있는 것이 아닙니다. 대신, 그것은 숙련된 패턴 인식 기계입니다. 그것은 어떤 단어 뒤에 어떤 단어가 주로 오는지를 관찰함으로써 학습합니다. 만약 당신이 질문을 던지면, 로봇은 사실을 찾아보는 것이 아니라 자신이 본 수십억 개의 사례를 바탕으로 다음에 올 가장 가능성 높은 단어를 예측합니다. 이것이 바로 챗GPT와 같은 챗봇의 기술적 배경인 거대 언어 모델(LLM)의 세계입니다.

현재 과학자들이 던지는 핵심적인 질문은 이것입니다: 만약 이 로봇 사서가 도서관의 아주 특정한 부분만을 읽었다면 어떤 일이 벌어질까요? 만약 로봇이 주로 남성들이 작성한 미국 웹사이트로부터 학습했다면, 로봇은 그것이 전 세계의 방식이라고 생각하게 될까요? 이 논문은 바로 그 문제를 깊이 파고듭니다. 이 논문은 왜 이러한 AI 시스템이 종종 편향되거나, 유해하거나, 신뢰할 수 없게 들리는지를 탐구하며, 그 잘못이 로봇의 "두뇌"(코드)가 아니라 로봇에게 먹여진 "식단"(데이터)에 있다고 주장합니다. 이를 이해하는 것은 매우 중요합니다. 우리가 뉴스 기사를 쓰는 것부터 의료 조언을 주는 것까지 모든 분야에 이 로봇들을 사용하기 시작함에 따라, 우리는 이들이 의도치 않게 해로운 고정관념이나 거짓을 퍼뜨리지 않도록 보장해야 하기 때문입니다.


논문의 핵심 폭로: 두뇌가 아니라 데이터가 문제다

페데리코 토리에리(Federico Torrielli)의 논문 "Stars, Stripes, and Silicon"은 왜 AI 챗봇들이 종종 "전형적인 미국인, 단색적, 시스젠더 중심적(All-American, Monochrome, Cis-centric)"인 캐릭터처럼 행동하는지를 조사하는 탐정 이야기와 같습니다. 저자는 문제가 AI 자체의 아키텍처, 즉 "엔진"이 고장 난 것이 아니라고 주장합니다. 대신, 엔진은 정제되지 않은 무질서한 인터넷 데이터로 가득 찬 연료 탱크 위에서 완벽하게 작동하고 있을 뿐입니다.

LLM을 수백만 개의 대화를 암기한 앵무새라고 생각해 보세요. 만약 그 앵무새가 모두가 강한 지역 악센트를 사용하고 매우 특정한 의견을 가진 특정 동네에서만 머문다면, 그 앵무새는 정확히 그 동네처럼 말할 것입니다. 앵무새가 나쁜 새라서 "편향된" 것이 아니라, 그것이 아는 것이 그것뿐이기 때문에 편향된 것입니다. 논문은 단순히 더 많은 데이터를 모델에 쏟아붓는 현재의 "클수록 좋다"는 접근 방식이 해결책이 아니라고 제안합니다. 사실, 데이터를 정제하지 않고 데이터셋을 더 크게 만드는 것은 이미 오타가 가득한 책에 페이지를 더 추가하는 것과 같습니다. 결국 오타가 더 많아진 더 큰 책을 갖게 될 뿐입니다.

코드 속의 "미국 국기"

논문은 주요한 문제를 지적합니다. 이러한 모델을 훈련하는 데 사용되는 데이터가 심하게 치우쳐 있다는 점입니다. 데이터는 대부분 미국 영어이며, 대부분 남성에 의해 작성되었고, 위키피디아(기여자 중 여성이 15% 미만인 곳)와 같은 출처에서 가져온 것입니다. AI는 빈도(특정 단어나 아이디어가 얼마나 자주 등장하는지)를 기반으로 학습하기 때문에, 자연스럽게 다수의 목소리를 증폭시킵니다.

90%의 사람들이 한 가지 의견을 외치고 10%가 다른 의견을 속삭이는 마을 회의를 상상해 보세요. 만약 당신이 로봇에게 그 회의를 요약하라고 요청한다면, 로봇은 외치는 의견만이 존재하는 유일한 진실이라고 보고할 것입니다. 논문은 이러한 "빈도 편향(frequency bias)" 때문에 소수의 관점이 묻히게 된다고 주장합니다. AI가 불공정하려고 노력하는 것이 아니라, 수학적으로 다양하지 않은 데이터셋에 대해 수학적 계산을 수행하고 있을 뿐입니다.

"왈루이지 효과"와 안전의 함정

논문은 또한 우리가 이를 막으려고 노력함에도 불구하고 왜 이 로봇들이 가끔 끔찍한 말을 하는지도 다룹니다. 저자는 "왈루이지 효과(Waluigi Effect)"라는 현상을 논합니다. 예를 들어, 당신이 로봇에게 "착한 녀로(마리오처럼)" 훈련시키면서 동시에 무엇을 하지 말아야 하는지 알려주기 위해 수백만 개의 "나쁜 놈(왈루이지처럼)"의 사례를 보여준다고 가정해 봅시다. 논문은 로봇이 나쁜 캐릭터가 되는 법을 정확히 알게 하는 완벽한 시뮬레이션을 만듦으로써, 역설적으로 로봇이 속았을 때 그 나쁜 캐릭터가 되어 즉흥적으로 행동할 수 있는 자유를 줄 수도 있다고 제안합니다.

논문은 안전 필터와 인간 피드백(RLHF)이 일반적인 대화에서 로봇이 무례하게 구는 것을 막는 데 도움이 되지만, 완벽하지는 않다고 언급합니다. 만약 누군가가 정교한 이야기나 "프롬프트 인젝션(trick question, 속임수 질문)"을 사용하여 로봇을 주의 분산시킨다면, 로봇은 실수를 하여 유해한 콘텐츠, 인종차 차별, 또는 독성을 생성할 수 있습니다. 논문은 가장 효과적인 해결책이 단순히 더 큰 "출입 금지" 표지판(안전 필터)을 세우는 것이 아니라, 로봇이 애초에 그런 나쁜 패턴을 배우지 않도록 도서관 선반을 실제로 청소하는 것(훈련 데이터 큐레이션)임을 강조합니다.

이것이 현실 세계에서 중요한 이유

논문은 우리가 이러한 문제를 해결하지 않는다면 그 결과가 위험한 영역으로 파급될 수 있다고 경고합니다.

  • 의료: 로봇이 편향된 데이터에 기반하여 의료 조언을 제공한다면, 환자들에게 잘못된 정보를 줄 수 있습니다.
  • 코드 안전: 겉보기에는 좋아 보이지만 숨겨진 보안 취약점이 있는 컴퓨터 코드를 작성할 수 있습니다.
  • 저널리즘: 가짜 뉴스를 퍼뜨리거나, 전문적으로 들리지만 실제로는 오해의 소지가 있는 기사를 쓰는 데 도움을 줄 수 있습니다.
  • 스팸: 스팸을 걸러내는 데 도움을 줄 수 있는 것처럼, 악의적인 행위자들이 더 똑똑하고 탐지하기 어려운 스팸을 작성하는 데 이용될 수도 있습니다.

"아발란체(눈사태)" 경고

마지막으로, 논문은 "아발란체 효과(Avalanche Effect)"라고 부르는 미래에 대한 경고를 보냅니다. 만약 우리가 기존 AI 모델이 생성한 콘텐츠가 포함된 데이터로 새로운 AI 모델을 계속 훈련시킨다면, 우리는 피드백 루프를 만들 위험이 있습니다. AI는 자신의 실수와 편향으로부터 학습하기 시작하며, 세대가 거듭될수록 마치 점점 커지는 눈사태처럼 그 편향을 더 강력하고 극단적으로 만들 것입니다.

저자는 이 문제를 해결하는 것이 단지 컴퓨터 과학자들만의 일이 아니라고 결론짓습니다. 이는 더 나은 데이터를 큐레이션하고, 더 공정한 시스템을 구축하며, 이 강력한 도구들에 책임을 물을 수 있는 규칙을 만들기 위해 다양한 분야의 사람들이 함께 협력하는 팀 단위의 노력이 필요합니다. 목표는 기술을 멈추는 것이 아니라, 기술이 사회를 해치는 대신 사회를 돕도록 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →