← 최신 논문
💻 computer science

Language-Specific Gaps in AI Safety Training Datasets

이 논문은 저자원, 중자원 및 고자원 언어 전반에 걸친 AI 안전 학습 데이터셋의 출처, 주석 및 유해성 분류 체계 범위에서 발생하는 비판적이고 종종 간과되는 격차를 폭로하며, 특히 아프리카 언어와 특정 유해 범주에서의 이러한 구조적 결함이 다국어 안전성 주장을 약화시키고 멀티턴 탈옥 공격에 대한 지속적인 취약성을 초래함을 입증한다.

원저자: Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

게시일 2026-08-17
📖 5 분 읽기🧠 심층 분석

원저자: Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 모든 언어로 쓰인 책들이 가득한 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 사서들(AI를 만드는 사람들)은 주로 영어를 사용했기 때문에, 안전 수칙과 "출입 금지" 표지판을 모두 영어로 작성했습니다. 최근 그들은 다른 언어를 사용하는 독자들을 환영해야 한다는 점을 깨닫고, 이 표지판들을 번역하기 시작했습니다. 하지만 여기에는 함정이 있습니다. 도서관이 20개의 다른 언어에 대한 안전 수칙을 갖추고 있다고 말한다고 해서, 실제로 그 규칙들이 존재하거나 그 언어들로 적절하게 의미가 통한다는 뜻은 아닙니다. 이 논문은 컴퓨터 과학의 "AI 안전(AI Safety)" 코너를 깊이 파고듭니다. 이 논문은 우리가 어떻게 컴퓨터에게 예의 바르고, 안전하며, 도움이 되도록 가르치는지 살펴보고, 특히 그들을 가르치는 데 사용되는 훈련 자료가 비영어권 화자들에게도 정말 충분히 좋은지를 점검합니다. 핵심 질문은 이것입니다. 우리는 단순히 번역 스티커만 붙이고 있는 것일까요, 아니면 모두를 위한 새로운, 문화적으로 적절한 규칙집을 실제로 작성한 것일까요?

이 논문의 저자들은 탐정 놀이를 하기로 했습니다. 그들은 AI 기업들이 자신들의 모델이 모두에게 안전하다고 말하는 것을 그대로 믿지 않았습니다. 대신, 그들은 기록 보관소로 들어가 25개의 서로 다른 언어 슬라이스에 걸친 21개의 다양한 안전 데이터 컬렉션(AI를 훈련시키는 데 사용되는 "규칙집")을 감사했습니다. 그들은 자원의 수준을 나타내기 위해 세 가지 언어에 집중했습니다: 하우사어(작은 마을 도서관 같은 저자원 언어), 스와힐리어(마을 도서관 같은 중자원 언어), 그리고 프랑스어(거대한 대도시 도서관 같은 고자원 언어)입니다.

그들이 발견한 내용은 다음과 같으며, 이는 마치 마을 도서관의 "안전" 구역은 대부분 비어 있는 반면, 대도시 도서관의 구역은 영어에서 복사해 온 책들로 가득 차 있다는 것을 발견하는 것과 같습니다.

"번역의 함정"
가장 놀라운 점은 많은 데이터셋이 "네이티브"(해당 언어로 성장한 사람들)라고 주장하지만, 저자들이 자세히 살펴보니 실제로는 영어에서 기계 번역된 것이었다는 사실입니다. 이것은 어떤 식당이 "현지 정통 요리"를 제공한다고 주장하지만, 주방을 들여로다 보면 로봇이 다른 나라의 메뉴를 번역하여 접시 위에 풀로 붙여놓은 것과 같습니다. 저자원이 언어인 하우사어의 경우, 거의 모든 안전 데이터가 원어민에 의해 작성된 것이 아니라 번역되었거나 컴퓨터에 의해 만들어진 것이었습니다. 훨씬 더 심각하게도, 어떤 경우에는 번역이 너무 형편없어서 연구자들이 설정한 최소 허용 기준치인 품질 점수 미달로 떨어지기도 했습니다. 한 특정 파이프라인은 하우사와 스와힐리어를 모두 테스트했는데, 스와힐리어 버전은 무난하게 통과했지만, 동일한 과정을 사용했음에도 불구하고 하우사어 버전은 실패했습니다. 이는 문제가 언어가 번역하기 "어렵기" 때문이 아니라, 특정 언어에 대한 과정이 충분히 세심하지 못했음을 증명합니다.

"누락된 장(Chapter)" 문제
저자들은 또한 안전 수칙이 모든 위험한 주제를 다루고 있는지 확인했습니다. 그들은 거대한 격차를 발견했습니다: 아프리카 언어들에 대해 자해성적 콘텐츠에 관한 네이티브 규칙이 거의 없었습니다. 이는 마치 도서관에 "도둑질 금지"나 "싸움 금지"에 대한 섹션은 있지만, "자신을 해치지 마시오"나 "사적인 것을 비밀로 유지하시오"에 대한 서가는 완전히 비어 있는 것과 같습니다. 이것은 단순한 공백이 아니라 완전한 결핍입니다. 프랑스어의 경우 이러한 주제들이 다뤄졌지만, 하우사어와 스와힐리어의 경우 해당 데이터가 네이티브 형태로 존재하지 않았습니다. 이는 사용자가 자신의 모국어로 민감한 주제에 대해 질문할 때, AI가 문화적 뉘ol(nuance)을 이해하지 못하거나 적절한 규칙을 배우지 못했기 때문에 위험한 답변을 내놓을 수 있음을 의미합니다.

"중복 계산"의 환상
저자들이 밝혀낸 또 다른 속임수는 "중복 계산"입니다. 10,000권의 고유한 책을 보유하고 있다고 주장하는 도서관을 상상해 보세요. 하지만 자세히 들여다보면, 단지 1,000권의 책을 가져다가 서로 다른 표지를 붙여 새로운 책으로 계산했다는 것을 알게 됩니다. 연구자들은 스와힐리어의 경우, 많은 데이터셋이 단순히 동일한 트윗이나 게시물을 서로 다른 그룹이 다시 주석(re-annotated, 재라벨링)한 것에 불과하다는 것을 발견했습니다. 이는 엄청난 양의 데이터가 사용 가능한 것처럼 보이게 만들었지만, 실제로는 "다양성"이 환상이었던 것입니다. 이는 마치 500곡이 들어있다고 적힌 재생 목록이 실제로는 똑같은 50곡을 이름만 바꿔서 반복해서 틀고 있는 것과 같습니다.

"저자원"이라는 라벨이 전부는 아닌 이유
여러분은 이렇게 생각할 수도 있습니다. "물론 작은 마을 도서관은 큰 도시 도서관보다 책이 적겠지." 이 논문도 저자원 언어에는 데이터가 적다는 점에는 동의하지만, 문제는 단순히 데이터가 얼마나 많은가가 아니라, 어떤 종류의 데이터인가에 달려 있다고 주장합니다. 그들은 때때로 중자원 언어(스와힐리어)가 특정 작업에서 저자원 언어(하우사어)보다 낮은 품질 점수를 기록하기도 하고, 때로는 고자원 언어(프랑스어)가 중자원 언어가 강점을 보였던 영역에서 공백을 보이기도 한다는 것을 발견했습니다. 이는 문제가 단지 돈이나 컴퓨터의 부족이 아니라, 연구 커뮤니티가 무엇을 구축하는 데 우선순위를 두느냐의 문제임을 시사합니다. 만약 어떤 커뮤니티가 선거 오정보(misinformation)에 깊은 관심을 가진다면 그들을 위한 훌륭한 데이터를 구축할 것입니다. 그렇지 않다면, 그 데이터는 언어가 아무리 "풍족"하더라도 존재하지 않습니다.

실제 세상의 결과
이것이 왜 중요할까요? 논문은 이러한 누락되거나 잘못된 데이터의 격차가 실제 안전 문제로 이어진다는 점을 연결합니다. 연구자들은 AI 모델이 아프리카 언어들로 된 단순한 한 문장짜리 "탈옥(jailbreak)"(AI가 나쁜 말을 하도록 유도하는 속임수)을 막는 데는 점점 나아지고 있지만, 복잡한 다회차 대화(multi-turn conversations)를 막는 데는 여전히 실패하고 있다는 것을 발견했습니다. 저자들은 그 이유가 복잡한 대화를 위한 훈련 데이터가 네이티브가 아닌, 주로 합성된(컴퓨터가 만든) 데이터이거나 번역된 것이기 때문이라고 주장합니다. 이는 운전자에게 빨간불에 멈추는 법(쉬운 단계)은 가르치면서, 갑작스러운 폭풍이나 미끄러운 도로를 다루는 법(복잡한 단계)은 전혀 가르치지 않은 것과 같습니다. AI는 단순한 속임수는 처리할 수 있지만, 대화가 복잡해지면 무너집니다.

핵별 요점
이 논문은 우리에게 모두를 위해 안전한 AI를 만드는 노력을 멈추라고 말하는 것이 아닙니다. 대신, "다국어"라는 주장이 모든 것이 괜찮다는 것을 의미한다고 가장하지 말라고 말합니다. 어떤 데이터셋이 14개의 언어를 다룬다고 해서, 그 모든 언어에 대해 안전 수칙이 실제로 존재한다는 뜻은 아닙니다. 저자들은 제작자들이 정직해져야 한다고 제안합니다: 만약 어떤 언어 슬라이스가 번역된 것이라면, 번역된 것이라고 말하십시오. 만약 특정 주제가 빠져 있다면, 빠져 있다고 인정하십시오. 그들은 우리가 "헤드라인" 숫자만 세는 것을 멈추고, 파이의 개별 조각들을 들여다보기를 원합니다. 그렇게 하지 않는 한, AI는 영어 사용자에게는 안전할지 모르지만, 다른 많은 이들에게는 여전히 책이 빠져 있고 표지판이 고장 난 도서관을 헤매고 있는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →