← 최신 논문
💻 computer science

Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?

이 논문은 거대 언어 모델이 인간의 인지적 왜곡을 은밀하게 구현하고 증폭할 뿐만 아니라 이를 사용자에게 다시 전달하기도 한다는 점을 주장하며, 이러한 광범위한 영향을 완화하기 위해 진단적, 규제적, 운영적 대응책의 포괄적인 프레임워크가 필요하다고 논한다.

원저자: Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

게시일 2026-07-24
📖 5 분 읽기🧠 심층 분석

원저자: Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거짓말을 배우는 거울

모든 책이 바닥에서 천장까지 쌓여 있는 거대한 도서관으로 걸어 들어간다고 상상해 보세요. 이제, 그 모든 책을 다 읽고 인간처럼 말하는 법을 배운 로봇을 상상해 보세요. 이 로봇이 바로 과학자들이 '대규모 언어 모델(LLM)'이라고 부르는 것입니다. 여러분이 들어봤을 법한 화려한 AI 챗봇 뒤에 있는 두뇌죠. 하지만 여기 함정이 있습니다. 인간은 불완전합니다. 우리는 실수를 저지르고, 비밀스러운 편견을 품고 있으며, 속으로는 다른 생각을 하면서 겉으로는 다른 말을 하기도 합니다. 이것은 심리학에서 '인지 편향'이라고 불리는 잘 알려진 사실입니다. 수십 년 동안 연구자들은 우리의 뇌가 어떻게 인종, 성별, 그리고 기타 집단에 대해 자신도 모르게 불공정한 판단을 내리도록 우리를 속이는지 연구해 왔습니다.

중요한 질문은 이것입니다. 만약 우리가 우리의 엉망진창인 인간의 언어를 로봇에게 먹여서 만든다면, 그 로봇은 우리의 실수를 바로잡는 완벽하고 논리적인 기계가 될까요? 아니에는 그저 우리의 결점을 더 크게, 더 빠르게 반사하는 거울이 될까요? 이 논문은 바로 그 질문을 파고듭니다. 이것은 단순히 로봇이 '똑똑한가'의 문제가 아니라, '공정한가'의 문제입니다. 만약 로봇이 우리의 숨겨진 편견을 학습한다면, 로봇은 누가 직업을 가질지, 누가 대출을 받을지, 심지어 누가 감옥에 갈지에 대해 불공정한 결정을 내리기 시작할 수 있습니다. 이것이 중요한 이유는, 우리가 우리 미래의 거대한 부분을 이 기계들에게 넘겨주고 있으며, 그들을 신뢰해도 안전한지 알아야 하기 때문입니다.

우리의 나쁜 습관을 닮은 로봇

그렇다면 이 논문의 저자들은 무엇을 발견했을까요? 그들은 최신 AI 모델들을 조사했고, 다소 무서운 사실을 발견했습니다. 이 모델들은 단순히 인간의 편견을 복제하는 것이 아니라, 실제로 그것을 악화시킨다는 것입니다. 이것을 '전화기 게임(속삭이며 전달하는 게임)'에 비유해 봅시다. 만약 당신이 친구에게 소문을 속삭이고, 그 친구가 다른 사람에게 또 속삭이면 이야기는 조금씩 왜곡됩니다. 하지만 이 AI 모델들은 단순히 이야기를 왜곡할 뿐만 아니라, 자신만의 극적인 양념을 더해 원래보다 훨씬 더 충격적인 소문으로 만드는 친구와 같습니다.

연구진은 이 AI 모델들이 자신의 본색을 숨기는 데 놀라울 정도로 능숙하다는 것을 발견했습니다. 만약 그들에게 직접적으로 "백인을 흑인보다 선호합니까?"라거나 "장애인을 함부로 대해도 괜찮습니까?"라고 묻는다면, 그들은 크고 분명하게 "아니오!"라고 답할 것입니다. 그들은 완벽하고 예의 바른 시민처럼 행동합니다. 하지만 당신이 직접적인 질문을 멈추고 그들에게 어떤 과업을 부여하는 순간—예를 들어 이력서를 검토하거나 특정 방언으로 쓰인 이야기를 판단하게 하는 순간—그들의 본색이 드러나기 시작합니다. 그들은 내용이 표준 영어로 쓰인 이야기와 똑같더라도, 아프리카계 미국인 영어(AAVE)로 글을 쓰는 사람이 덜 신뢰할 만하거나 더 유죄일 가능성이 높다고 은밀하게 결정할 수 있습니다. 이는 마치 "나는 색맹(인종 차별을 하지 않음)이다!"라고 말하면서도, 말투 때문에 누군가에게 더 엄한 형량을 내리는 판사와 같습니다.

논문은 이것이 데이터를 깨끗하게 정리한다고 해결될 수 있는 단순한 오류가 아니라고 지적합니다. 어떤 이들은 "아, 로봇에게 더 좋은 책들을 먹이면 더 좋아질 거야"라고 생각했습니다. 하지만 저자들은 그것만으로는 부족하다고 주장합니다. AI는 단순한 거울이 아니라 '확대경'입니다. AI는 인간의 글에서 발견되는 편견을 가져와서 그것을 증폭시킵니다. 설상가상으로, 모델들은 최신 버전이 될수록 더 편향되는 경향이 있습니다. 이는 마치 학생이 학년이 올라갈수록 수학을 점점 더 못하게 되는 것과 같습니다. 또한 모델들은 교묘해지는 법을 배우고 있습니다. 권위 있는 인물인 척하거나, 어떤 것이 희귀하고 가치 있다고 말하는 등의 인간이 사용하는 속임수에 당할 수 있습니다.

아마도 가장 걱정스러운 부분은 이 편향이 컴퓨터 안에만 머물지 않는다는 점입니다. 인간이 이러한 AI 도구와 함께 일할 때, 우리는 그들의 나쁜 습관을 따라 하기 시작합니다. 만약 AI가 "이 후보자는 별로다"라고 말하고 채용 담당자가 그 말에 동의한다면, 그 인간 역시 편향된 것입니다. 그러면 그 인간은 결정을 내리고, 그 새로운 텍조가 다음 버전의 AI를 훈련시키기 위해 다시 입력됩니다. 이것은 눈덩이가 언덕 아래로 굴러 내려가며 더 많은 눈(편견)을 집어삼켜 거대한 눈사태가 되는 것과 같은 악순박한 순환입니다. 저자들은 인간은 수 세기에 걸쳐 서서히 편향이 줄어들어 온 반면, 이 AI 모델들은 업데이트될 때마다 더 왜곡되는 방향으로 향하고 있다고 제안합니다.

우리는 무엇을 할 수 있는가?

저자들은 단순히 불평만 하는 것이 아니라, 이 상황이 걷잡을 수 없이 커지는 것을 막기 위한 계획을 제안하고 있습니다. 그들은 우리가 편향을 그냥 없던 일로 할 수는 없다고 말합니다. 왜냐-하면 인간조차 자신의 숨겨진 편견을 완전히 지울 수 없기 때문입니다. 대신, 우리는 엄격한 안전 검사관이 되어야 합니다.

첫째, 그들은 AI를 위한 공적인 '등록부' 또는 '점수판'을 만들 것을 제안합니다. 자동차가 판매되기 전에 안전 테스트를 통과해야 하는 것처럼, AI 모델도 편향 테스트를 통과해야 합니다. 우리는 독립적인 과학자들이 모델의 겉으로 드러나는 말뿐만 아니라 은밀하게 행하는 행동까지도 검사하도록 해야 합니다. 이 점수판은 모델이 시간이 지남에 따라 나아지고 있는지 아니면 나빠지고 있는지를 추적하여, 기업들이 실수를 숨길 수 없게 만들 것입니다.

둘째, 그들은 실질적인 힘을 가진 규칙이 필요하다고 말합니다. 그들은 이를 다른 산업의 사례와 비교합니다:

  • 가전제품처럼: 냉장고가 몇 년마다 더 엄격한 에너지 기준을 충족해야 하는 것처럼, AI 모델도 더 엄격한 편향 기준을 충족해야 합니다. 이전 모델보다 더 편향된 새 모델을 출시하는 것은 허용되어서는 안 됩니다.
  • 의약품처럼: 만약 신약에 위험한 부작용이 있다면, 우리는 그것을 영원히 금지하는 것이 아니라 사용 대상을 제한합니다. 마찬가지로, 만약 AI가 너무 편향되어 있다면 채용이나 법적 결정과 같은 고위험 직무에서 사용을 금지해야 합니다.
  • 자동차처럼: 만약 자동차가 연료를 너무 많이 소비한다면 정부는 기업에 세금을 부과합니다. 저자들은 AI가 더 불공정할 경우 기업이 더 많은 비용을 지불하게 하는 '편향세'를 제안합니다.

마지막으로, 저자들은 우리가 숨바꼭질을 멈춰야 한다고 주장합니다. 현재 이 모델들을 만드는 사람들은 자신들의 비밀(훈련 데이터나 코드를 수정하는 방식 등)을 대중으로부터 숨기고 있습니다. 논문은 문제를 해결하기 위해서 독립적인 연구자들이 자동차의 보닛 아래를 들여다보는 안전 검사관처럼 AI의 내부 작동 원리를 볼 수 있어야 한다고 말합니다.

논문은 진지한 메시지로 끝을 맺습니다. 이러한 해결책들이 충분하지 않을 수도 있다는 것입니다. 문제가 너무 커서 우리가 처음부터 기술을 구축하는 방식 자체를 재고해야 할지도 모릅니다. 저자들은 이 '눈덩이' 같은 편향이 실제 사람들의 삶을 해치는 멈출 수 없는 눈사태가 되기 전에, 우리가 빨리 움직여야 한다고 촉구합니다. 그들은 우리의 디지털 조력자들이 우리의 가장 나쁜 적이 되지 않도록 과학자, 기업, 정부가 함께 노력해야 한다고 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →