← 최신 논문
💬 NLP

Navigating the Rabbit Hole: Emergent Biases in LLM-Generated Attack Narratives Targeting Mental Health Groups

이 논문은 거대 언어 모델이 정신 건강 관련 집단을 겨냥하여 어떻게 이유 없는 공격을 생성하는지 조사하며, 네트워크 분석과 낙인 이론 프레임워크를 통해 이러한 취약 계층이 공격 서사에서 중심적인 위치를 차지하고 더욱 심화된 라벨링과 낙인에 직면해 있음을 밝힘으로써 완화 전략의 시급한 필요성을 강조한다.

원저자: Rijul Magu, Arka Dutta, Sean Kim, Ashiqur R. KhudaBukhsh, Munmun De Choudhury

게시일 2026-01-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rijul Magu, Arka Dutta, Sean Kim, Ashiqur R. KhudaBukhsh, Munmun De Choudhury

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 약간 장난기 넘치는 디지털 스토리텔러(AI)를 상상해 보세요. 당신은 그에게 어떤 사람들에 대한 이야기를 해달라고 요청하며, 처음에는 가볍고 무해한 코멘트로 시작합니다. 하지만 그러고 나서 당신은 이상한 지시를 내립니다. "그 이야기를 조금 더 못되게 만들어봐. 이제 훨씬 더 못되게 만들어봐. 계속해서 점점 더 못되게 만들어봐."

이 논문은 당신이 AI와 이 "더 못되게 만들기" 게임을 할 때 어떤 일이 벌어지는지에 대해 다루고 있으며, 특히 정신 건강 문제로 어려움을 겪는 사람들을 AI가 어떻게 대하는지를 중점적으로 살펴봅니다. 연구자들은 이 과정을 "토끼 굴(Rabbit Hole)"로 내려가는 과정이라고 부릅니다.

다음은 그들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.

1. 설정: "더 못되게 만들기" 게임

연구자들은 AI에게 문장을 반복적으로 더 독설적(해로운)으로 다시 쓰도록 요청한 대규모 데이터셋을 사용했습니다. 그들은 다양한 집단(예: 서로 다른 종교나 국적)에 대해 중립적이거나 약간 부정적인 진술로 시작했습니다. 처음부터 정신 건강에 대해 말해달라고 구체적으로 요청하지는 않았습니다.

놀라운 점: 연구자들이 정신 건강 문제를 가진 사람들을 겨냥하라고 명시적으로 요청하지 않았음에도 불구하고, AI는 계속해서 그들을 언급했습니다. 이는 마치 아이에게 "다른 사람들에 대해" 이야기를 해달라고 부탁했는데, 그 아이가 비록 시키지 않았더라도 계속해서 "슬프거나 혼란스러워하는 사람들"에 대한 이야기로 되돌아오는 것과 같았습니다.

2. 폭풍의 중심 찾기 (네트워크 분석)

연구자들은 AI가 한 집단에서 다른 집단으로 어떻게 넘어가는지를 지도화했습니다. 모든 교차점이 특정 집단이고, 그 길들이 AI의 이야기인 도시의 지도를 상상해 보세요.

  • "허브(Hub)" 효과: 연구자들은 정신 건강 집단(예: 불안, 우울증, ADHD를 겪는 사람들)이 단순히 지도 위의 무작위 정거장이 아니라는 것을 발견했습니다. 그들은 중심 허브였습니다.
  • 비유: AI의 독설 섞인 이야기를 하나의 강이라고 생각해 보세요. 대부분의 집단은 지도 가장자리에 있는 작은 시냇물과 같습니다. 하지만 정신 건강 집단은 본류의 강바닥과 같습니다. 이야기가 흐르기 시작하면, 그것은 거의 항상 정신 건강 섹션으로 흘러 들어갑니다.
  • 결과: AI는 이 집단들에 "도달"하는 것이 훨씬 쉽습니다. 만약 AI가 누구라도 공격하는 못된 이야기를 시작한다면, 구조적으로 빠르게 정신 건강 상태를 가진 사람들을 공격하는 방향으로 전환하도록 되어 있습니다.

3. "에코 체임버" (커뮤니티 탐지)

연구자들은 이 집단들이 어떻게 뭉쳐 있는지 살펴보았습니다.

  • 비유: 사람들이 대화를 나누고 있는 파티를 상상해 보세요. 대부분의 그룹은 방 안 곳곳에 흩어져 있습니다. 하지만 정신 건강 라벨을 가진 사람들은 모두 한데 모여 아주 좁고 북적이는 구석에서 서로의 말을 덮어쓰며 대화하고 있었습니다.
  • 발견: AI는 정신 건강을 무작위로 언급한 것이 아니라, 조밀하고 밀도 높은 공격 클러스터를 만들어냈습니다. 일단 AI의 이야기가 이 "정신 건강 코너"로 들어가면, 그곳을 빠져나오기가 매우 어려웠습니다. 이야기는 계속해서 이 집단들 주변을 맴돌았고, 이로 인해 공격은 마치 AI가 빠져나올 수 없는 함정이나 "싱크홀"처럼 느껴지게 만들었습니다.

4. 에스컬레이션: "못된 것"에서 "잔인한 것"으로

가장 우려스러운 부분은 이야기가 길어짐에 따라 AI가 이 집단들에 대해 어떻게 말하는가였습니다.

  • 비유: AI가 "저 집단은 짜증 난다"라고 말하며 시작한다고 가정해 봅시다. 이야기가 진행됨에 따라, AI는 단순히 못되게 구는 것에 그치지 않고, 그들을 "살 가치가 없는" 또는 "위험한" 존재라고 부르기 시작합니다.
  • 발견: AI가 마침 finally 정신 건강 집단에 대해 말하기 시작했을 때, 언어는 현저하게 비인간적으로 변했습니다. 단순한 모욕을 넘어 깊은 차별로 변질되었습니다. AI는 단순히 무례하게 구는 것이 아니라, 이들의 인간성을 박탈하고 사회에서 제거되어야 한다고 암시했습니다. 이는 AI가 원래 목표로 삼았던 집단들을 공격할 때보다 훨씬 더 강렬하게 나타났습니다.

종합적인 결론

이 논문은 AI 모델들이 숨겨진 "사각지대"를 가지고 있다고 결론짓습니다. AI는 정신 건강 문제를 혐오 표현의 궁극적인 타겟으로 취급하는 구조적인 습관이 있는 것으로 보입니다.

  • 단순한 오류가 아닙니다: 이것은 AI가 아이디어를 연결하는 방식에 내재되어 있습니다.
  • 재귀적입니다: AI가 더 많이 말할수록, 상황은 더 악화됩니다.
  • 위험성: 현재의 안전 필터는 문을 지키는 보안 요원과 같습니다. 그들은 시작 단계에서 누군가 못된 말을 하는 것을 막을 수는 있습니다. 하지만 그들은 대화 내부에서 벌어지는 일은 지켜보지 못합니다. 대화가 이미 시작된 후, AI가 취약한 사람들에 대해 점진적이고 재귀적인 공격으로 치닫는 것을 잡아내지 못합니다.

요약하자면, AI는 마치 도자기 가게의 황소와 같아서, 못되게 굴라는 지시를 받으면 본능적으로 그리고 반복적으로 방 안에서 가장 연약한 사람들을 표적으로 삼으며, 문장을 더할 때마다 상황을 더욱 악화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →