← 최신 논문
💻 computer science

LLM Harms: A Taxonomy and Discussion

본 논문은 사전 개발 단계부터 하류 애플리케이션에 이르기까지의 대규모 언어 모델 (LLM) 해악에 대한 포괄적인 분류 체계를 제안하며, 책임 있는 AI 개발과 완화 방안을 안내하기 위해 표준화된 책임성, 투명성 및 동적 감사 시스템을 옹호한다.

원저자: Kevin Chen, Saleh Afroogh, Abhejay Murali, David Atkinson, Amit Dhurandhar, Junfeng Jiao

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kevin Chen, Saleh Afroogh, Abhejay Murali, David Atkinson, Amit Dhurandhar, Junfeng Jiao

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 인터넷에 기록된 거의 모든 것을 읽은 거대하고 초지능적인 도서관으로 상상해 보세요. 이 도서관은 거의 누구보다도 이야기를 쓰고, 질문에 답하며, 문제를 해결할 수 있습니다. 하지만 전 세계의 모든 책으로 지어진 도서관과 마찬가지로, 이 도서관에는 심각한 문제들이 있습니다.

이 논문은 바로 그 도서관을 위한 안전 검사관 보고서와 같습니다. 오스틴 텍사스 대학교와 IBM 의 연구진으로 구성된 저자 팀은 수천 건의 연구를 검토하여 이 도서관이 어떻게 잘못될 수 있는지에 대한 모든 방식을 '지도'로 만들었습니다. 그들은 이 지도를 **해악의 분류 (Taxonomy of Harms)**라고 부릅니다.

다음은 그들의 발견 사항을 간결하게 정리한 내용입니다:

1. 건설 현장 (배포 전 해악)

도서관이 문을 열기조차 전에, 그 건립 방식에 문제가 있습니다.

  • "도난당한 책" 문제 (학습 데이터): 이 도서관은 인터넷을 스크래핑하여 지어졌습니다. 때로는 허락 없이 사적인 편지, 의료 기록, 또는 저작권이 있는 책들을 훔쳤습니다. 이는 허락 없이 구매하지도 않은 재료를 사용하는 요리사와 같습니다.
  • "전기 요금" 문제 (환경적): 이 도서관을 짓는 데는 컴퓨터를 냉각시키기 위한 막대한 양의 전기와 물이 필요합니다. 최종 제품이 몇 줄의 텍스트일지라도 거대한 공장을 운영하는 것과 마찬가지로 막대한 탄소 발자국을 남깁니다.
  • "무급 노동자" 문제 (노동): 뒷면에서는 수천 명의 사람들이 데이터를 라벨링하고 도서관에 무엇이 '좋고' '나쁜지' 가르치는 대가로 매우 적은 돈을 받습니다. 이들 중 일부는 도서관이 이를 피하는 법을 배울 수 있도록 끔찍하고 폭력적인 콘텐츠를 접하게 되는데, 이는 그들에게 트라우마가 될 수 있습니다.

2. 사서의 실수 (직접적 출력 해악)

도서관이 문을 열면 사서 (AI) 가 때로는 잘못된 정보를 제공합니다.

  • "고정관념" 문제: 만약 사서에게 '간호사'에 대해 물어보면, 남성이 간호사임에도 불구하고 여성 사진만 보여줄 수 있습니다. 도서관은 읽은 책들로부터 나쁜 습관을 배워 인종, 성별, 장애에 대한 오래된 편견을 반복합니다.
  • "거짓말" 문제 (할루시네이션): 사서는 매우 자신감 있지만 때로는 사실을 지어냅니다. 그들은 가짜 의약품을 발명하거나 존재하지 않는 법원 사건을 만들 수 있습니다. 그들은 거짓말을 하고 있다는 것을 알지 못하며, 그저 매우 확신 있는 듯 말합니다.
  • "유해한" 문제: 때로는 사서가 누군가 속여 그렇게 하도록 유도할 경우, 혐오 발언이나 괴롭히는 언어를 내뱉기도 합니다.

3. 나쁜 행위자들 (오용 및 악의적 적용)

도서관이 실수를 저지르는 것뿐만 아니라, 때로는 사람들이 고의로 나쁜 일을 하기 위해 이를 이용합니다.

  • "가짜 뉴스 공장": 나쁜 행위자들은 이 도서관을 이용해 수천 개의 가짜 뉴스 기사나 혐오 발언 메시지를 초 단위로 작성하여 사람들을 혼란스럽게 하기 위해 소셜 미디어를 넘칠 수 있습니다.
  • "사기꾼의 가장 친한 친구": 사기꾼들은 이 도서관을 이용해 사람들이 비밀번호를 넘겨주도록 속일 만큼 실제처럼 보이는 완벽한 피싱 이메일을 작성합니다.
  • "해커의 도구": 해커들은 이 도서관을 이용해 컴퓨터 시스템의 취약점을 찾거나, 도서관이 실수로 기억한 개인 정보를 훔칩니다.

4. 파급 효과 (사회적 및 체계적 해악)

도서관이 모두에게 사용될 때, 사회의 작동 방식이 바뀝니다.

  • "일자리 대체" 파도: 이 도서관은 인간보다 빠르게 많은 사무직 업무 (보고서 작성이나 고객 서비스 전화 응대 등) 를 수행할 수 있습니다. 이는 특히 창의적 분야와 행정직에서 수백만 명의 일자리를 위협합니다.
  • "민주주의의 위험": 만약 이 도서관이 선거에 가짜 이야기로 넘쳐나게 하는 데 사용된다면, 사람들이 무엇이 진실인지 알기 어려워집니다. 이는 민주주의가 작동하는 데 필요한 신뢰를 무너뜨릴 수 있습니다.
  • "부자 vs 빈자" 격차: 가장 크고 부유한 회사들만이 가장 큰 도서관을 짓기 위한 비용을 감당할 수 있습니다. 이는 그들이 기술을 통제한다는 것을 의미하며, 작은 국가나 학교들은 뒤처지게 되어 새로운 형태의 디지털 불평등을 초래합니다.

5. 고위험 게임 (하류 애플리케이션 해악)

사람들이 이 도서관을 생사결정적인 중요한 일에 사용할 때, 위험은 더욱 커집니다.

  • "의사 보조" 위험: 만약 의사가 환자를 진단하기 위해 이 도서관을 사용한다면, 도서관은 가짜 질병을 발명하거나 존재하지 않는 약을 제안할 수 있습니다.
  • "교사 보조" 위험: 학교에서 학생들은 배움 없이 이 도서관을 이용해 에세이를 작성할 수 있으며, 도서관이 그들의 작업을 불공정하게 평가할 수도 있습니다.
  • "변호사 보조" 위험: 법정에서 이 도서관은 가짜 법률을 인용할 수 있으며, 이는 무고한 사람을 감옥에 보내거나 유죄인 사람을 풀어줄 수 있습니다.

어떻게 해결할까요? (완화)

이 논문은 도서관을 그냥 끄는 것만으로는 안 된다고 제안합니다. 대신 다층적 방어가 필요합니다:

  • 레드 팀링 (Red Teaming): 공개되기 전에 '윤리적 해커'를 고용하여 도서관을 깨뜨려 보게 함으로써, 구멍을 찾아 패치할 수 있도록 합니다.
  • 더 나은 규칙: 정부 (예: EU) 는 회사들이 사용한 데이터에 대해 투명성을 요구하고 안전성을 위해 모델을 테스트하도록 하는 법률을 만들기 시작했습니다.
  • 동적 감사: 우리는 도서관을 한 번이 아니라 지속적으로 점검해야 합니다. 도서관이 새로운 것을 배울 때마다 새로운 문제가 나타날 수 있으므로, 이를 잡기 위한 새로운 도구가 필요합니다.

결론

이 논문은 이 '슈퍼 도서관'이 놀랍고 위대한 일을 할 수 있지만, 현재는 일종의 '와일드카드'라고 결론 내립니다. 이는 도둑질, 거짓말, 편향의 역사를 가지고 있습니다. 이를 안전하게 사용하기 위해서는 이를 마법 상자로 취급하는 것을 멈추고, 엄격한 감독, 지속적인 점검, 명확한 규칙이 필요한 강력한 도구로 취급해야 합니다. 그래야만 인류를 돕고 해를 끼치지 않도록 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →