← 최신 논문
🤖 AI

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

이 논문은 6개 언어에 걸친 인도 중심의 사회문화적 편향을 평가하는 다국어 벤치마크인 INCLUDE를 소개하며, 현재 LLM의 영어 중심 안전 정렬이 영어 이외의 출력물, 특히 벵골어와 폐쇄형 모델에서 영어 대응물보다 현저히 높은 편향을 보이는 심각한 교차 언어적 안전 격차를 생성한다는 점을 밝히고 있습니다.

원저자: Namya Bhatnagar

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Namya Bhatnagar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터 비서의 목소리가 인도의 시골 마을에서나 런던의 북적이는 사무실에서나 똑같이 유창하고 공정할 수 있는 세상을 상상해 보십시오. 수년 동안 이러한 비서 뒤에 숨겨진 기술은 주로 영어 텍스트를 바탕으로 학습되어 왔으며, '안전 정렬(safety alignment)'이라 불리는 과정을 통해 유해한 고정관념을 인식하고 공격적인 요청을 거부하는 법을 배웠습니다. 이 훈련은 기계가 인종, 종교 또는 사회적 지위에 대한 편견을 반복하지 않도록 설계된 일종의 필터 역할을 합니다. 그러나 결정적인 질문이 하나 남아 있습니다. 이 필터가 힌디어, 벵골어, 또는 영어와 힌디어가 섞인 언어로 말할 때도 똑같이 잘 작동하는가 하는 점입니다. 만약 이 필터가 영어만 이해한다면, 다른 언어를 사용하는 수백만 명의 사람들은 기술이 방지하고자 했던 바로 그 편견에 무방비로 노출되게 됩니다. 이것이 인도의 다양한 언어적 지형 속에서 인공지능의 안전이라는 약속이 과연 실현 가능한지를 조사하는 새로운 연구의 핵심 관심사입니다.

남야 바트나가라(Namya Bhatnagar)가 이끄는 연구진은 INCLUDE라는 특화된 테스트를 만들어 이 격차를 측정하고자 했습니다. 이 벤치마크는 인공지능 모델이 영어, 힌디어, 벵골어, 마라티어, 타밀어, 그리고 일상 대화에서 흔히 쓰이는 힌디어와 영어의 혼합 형태인 '힝글리시(Hinglish)'라는 여섯 가지 언어로 프롬프트(명령어)를 받았을 때, 문화적으로 특정한 고정관념을 얼마나 잘 처리하는지 확인하기 위해 설계되었습니다. 이 테스트를 구축하기 위해 연구팀은 먼저 카스트, 종교, 지역과 같이 편견이 자주 나타나는 여섯 가지 영역을 정의했습니다. 그런 다음 교사와 대학 교수 등 20명의 전문가 패널을 구성하여 수천 개의 질문을 검토하고 다듬었습니다. 이 질문들은 모델이 유해한 고정관見에 치우치는지 아니면 이를 거부하는지를 드러낼 수 있도록 문장을 완성하게 만드는 방식으로 정교하게 제작되었습니다. 연구팀은 의미와 고정관념의 강도가 모든 버전에서 일관되게 유지되도록 이 프롬프트들을 다섯 가지 인도 언어로 번로했습니다.

연구는 10개의 서로 다른 인공지능 모델을 평가하였으며, 이들을 누구나 검사하고 수정할 수 있는 '오픈 소스' 모델과 대형 기술 기업들이 소유한 '폐쇄형 시스템' 두 그룹으로 나누었습니다. 연구진이 오픈 소스 모델을 테스트했을 때, 명확하고 우려스러운 패턴이 발견되었습니다. 프롬프트가 인도 언어로 작성되었을 때 모델은 영어로 작성되었을 때보다 유의미하게 더 많은 편향적이고 고정관념적인 답변을 생성할 가능성이 높았습니다. 인도 언어 중에서는 벵골어가 가장 높은 수준의 편향을 유발했으며, 힌디어가 그 뒤를 바짝 쫓았습니다. 놀랍게도, 이 오픈 소스 모델들의 경우 영어 프롬프트가 가장 낮은 편향 점수를 기록했는데, 이는 안전 필터가 영어 사용자에게는 잘 작동하지만 그 외의 사람들에게는 실패하고 있음을 시사합니다. 이는 사용자가 영어로는 보호받고 있다고 느끼지만, 모국어로 말할 때는 취약해지는 '안전의 착시 현상'을 만들어냅니다.

음성 비서의 검색 및 정보 추출 기능을 구동하는 데 주로 사용되는 폐쇄형 모델의 결과는 더욱 다르고 복잡한 이야기를 들려주었습니다. 이 그룹에서는 패턴이 완전히 뒤바뀌었습니다. 모델들은 프롬프트가 영어일 때 가장 강한 편향적 연관성을 보였으며, 인도 언어들은 오히려 낮은 편향 점수를 보였습니다. 이러한 역전 현상은 문제의 원인이 단 하나가 아님을 시사합니다. 오픈 모델의 경우, 문제는 안전 훈련이 주로 영어로 이루어져 다른 언어들이 보호받지 못했다는 점에 있는 것으로 보입니다. 반면 폐쇄형 모델의 경우, 편향은 그들이 원래 학습했던 방대한 양의 영어 텍스트로부터 기인하며, 이것이 세상에 대한 그들의 핵심적인 이해 속에 강력한 고정관념을 심어놓은 것으로 보입니다.

가장 중요한 발견 중 하나는 수백만 명의 인도인이 사용하는 혼합 언어인 '힝글리시'에 관한 것이었습니다. 연구 결과, 힝글리시는 영어의 안전 혜택을 받지 못하는 것으로 나타났습니다. 힝글리시는 영어 단어를 포함하고 있음에도 불구하고, 모델들은 이를 영어보다는 힌디어나 타밀어와 같은 다른 저자원 인도 언어들과 통계적으로 동일하게 취급했습니다. 이는 혼합 언어를 사용하여 음성 상호작용을 하는 사용자들이 순수 영어 사용자만큼의 보호를 받지 못하고 있음을 의미합니다. 연구진은 또한 편향 점수가 다양하게 나타났지만, 그 차이가 무작위적인 것이 아니라 시스템이 구축되는 방식에서의 실제적이고 측정 가능한 실패라고 간주될 만큼 일관적이었다는 점에 주목했습니다.

본 연구는 인공지능의 안전이 언어에 따라 균등하지 않다고 결론짓습니다. 이는 현재의 모델 훈련 방식이 영어 사용자는 유해한 고정관념으로부터 보호받는 반면, 다른 언어 사용자는 그렇지 못한 격차를 만든다는 것을 드러냅니다. 연구 결과는 단순히 영어의 안전 규칙을 번역하는 것만으로는 충분하지 않으며, 모델이 학습하는 방식과 정렬되는 구조 자체가 다양한 문화와 언어의 미묘한 차이를 고려하도록 변화해야 함을 시사합니다. 연구진은 이러한 격차를 식별함으로써, 개발자들이 사용하는 언어와 상관없이 모두에게 진정으로 공정한 시스템을 구축할 수 있는 로드맵을 제공하기를 희망합니다. 이 연구는 인공지능의 진정한 공정성을 달 Achieve 하기 위해서는 지배적인 언어를 넘어, 기술이 실제로 배치되는 구체적인 문화적 맥contexts를 살펴봐야 한다는 점을 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →