LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review
이 체계적 문헌 고찰은 저자원 언어에서의 LLM 안전 정렬에 관한 50편의 연구를 분석하여, 불균형한 사전 학습 및 문화적 관점이 결여된 벤치마크와 같은 요인들로 인해 발생하는 지속적인 다국어 안전 격차를 식별하는 한편, 새로운 분류 체계를 제안하고 교차 언어 탈옥 및 안전성 저하와 같은 취약성을 해결하기 위한 문화적으로 근거 있는 솔루션을 촉구한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
언어를 영어에서 다른 언어로 바꾸는 순간, 시를 쓰고 질병을 진단하며 복잡한 질문에 답할 수 있는 가장 진보된 인공지능 시스템들이 갑자기 신뢰할 수 없거나 심지어 위험해지는 세상을 상상해 보십시오. 이것은 가상의 시나리오가 아니라 인공지능 분야에서 점점 현실이 되고 있는 문제입니다. 거대 언어 모델은 인간의 언어를 이해하고 생성하도록 방대한 양의 텍스트로 학습된 컴퓨터 프로그램입니다. 이러한 도구들을 대중이 안전하게 사용할 수 있도록 하기 위해, 연구자들은 무기를 만드는 방법이나 혐오 표현을 퍼뜨리는 것과 같은 해로운 요청을 거부하도록 모델을 가르칩니다. 이 교육 과정을 '안전 정렬(safety alignment)'이라고 합니다. 수년 동안 이 학습은 거의 전적으로 영어 데이터를 사용하여 이루어져 왔습니다. 그 결과, 이 디지털 지능들은 영어로는 예의 바르고 신중하도록 학습되었지만, 아프리카나 원주민 언어와 같이 디지털 자원이 적은 언어로 사용자가 말할 때는 동일한 위험을 인식하지 못하는 경우가 빈번합니다. 이 모델들이 영어에서 얼마나 안전한지와 다른 곳에서 얼마나 안전한지 사이의 격차는 점점 벌어지고 있으며, 이는 소외된 언어의 화자들이 자신을 돕기 위해 만들어진 바로 그 도구로부터 독성, 편향 또는 오해의 소지가 있는 조언을 받을 위험이 더 높은 상황을 초래하고 있습니다.
한 연구팀은 저자원 언어의 안전성에 초점을 맞춘 최근 50개의 연구를 체계적으로 검토함으로써 이 불균형한 지형을 지도화하기 위해 나섰습니다. 그들은 수천 편의 학술 논문에서 발견한 내용을 수집하고, 기술이 정확히 어디에서 왜 실패하고 있는지 이해하기 위해 가장 관련 있는 작업들로 걸러냈습니다. 그들의 조사는 충격적인 진실을 드러냈습니다: 영어를 안전하게 유지하기 위해 사용되는 방법은 다른 언어로 단순히 번역되지 않는다는 것입니다. 연구자들이 하우사어, 스와힐리어 또는 요루바어와 같은 언어에 대해 영어의 안전 규칙을 적용하려 했을 때, 시스템은 종-종 무너졌습니다. 연구에 따르면, 해로운 영어 프롬프트를 저자원 언어로 단순히 번열하는 것이 AI가 안전 가드레일을 무시하도록 속일 수 있는 경우가 약 80%에 달했던 반면, 영어에서 동일한 속임수를 썼을 때는 대부분 실패했습니다. 이는 영어에서 배운 안전 교훈이 모델의 세계관에 깊이 내재된 것이 아니라, 영어라는 언어 자체에 너무 밀접하게 결합되어 있음을 시사합니다.
연구자들은 과학자들이 이 문제를 해결하기 위해 시도하고 있는 세 가지 주요 방법을 식별했습니다. 첫 번째 접근 방식은 단순히 영어 사례를 번역하는 것이 아니라 현지 문화에 뿌리를 둔 새로운 학습 데이터를 만드는 것을 포함합니다. 한 연구는 지역 사회에 실제로 존재하는 해로운 사례들을 사용하여 특정 현지 언어에 특화된 안전 데이터셋을 구축했을 때, AI가 위험한 요청을 거부하는 능력이 현저히 향아졌음을 보여주었습니다. 반면, 번역된 영어 데이터로 학습된 모델은 현지의 문화적 해악에 대한 미묘한 차이를 놓치는 경우가 많았습니다. 두 번째 접근 방식은 모델에게 한 언어에서 안전하도록 가르친 뒤 그 지식이 다른 언어로 퍼지기를 기대하는 것입니다. 그러나 검토 결과에 따르면 이는 취약한 전략입니다. 모델이 새로운 언어로 미세 조정될 때, 설령 무해한 데이터라 할지라도 영어에서 배웠던 안전 규칙을 잊어버리는 경우가 발생합니다. 세 번째 접근 방식은 모델 내부의 구조를 들여다보고, 방대한 양의 새로운 데이터 없이도 더 안전하게 만들기 위해 특정 내부 설정을 미세하게 조정하는 것을 목표로 합니다. 유망하기는 하지만, 이러한 방법들은 아직 초기 단계에 있으며 모든 언어에 걸쳐 안정적으로 작동한다는 것이 아직 입증되지 않았습니다.
문제의 주요 부분은 우리가 이러한 시스템을 테스트하는 방식에 있습니다. 대부분의 안전 테스트는 영어 질문을 다른 언어로 번역하여 만들어집니다. 연구자들은 이 방법이 결함이 있다고 발견했는데, 왜냐하면 문화마다 해악이 나타나는 구체적인 방식을 포착하지 못하기 때문입니다. 예를 들어, 모델은 영어로는 혐오 표현 생성을 거부할 수 있지만, 하우사어로는 독성이 있는 제품 추천을 기꺼이 생성할 수도 있습니다. 이는 해당 특정 해악의 개념이 훈련에 포함되지 않았기 때문입니다. 이번 검토는 아프리카 언어들을 위해 특별히 설계된 안전 벤치마크가 매우 적다는 점을 강조했으며, 이는 모델이 어떻게 행동하는지에 대한 우리의 이해에 거대한 사각지대를 남겼습니다. 실제 문화적 맥락을 반영하는 테스트 없이는 개발자들이 자신들의 안전 조치가 실제로 작동하고 있는지 알 수 없습니다.
또한 연구는 놀라운 취약성을 발견했습니다: 모델에게 새로운 언어를 가르치는 행위 자체가 전체적인 안전성을 떨어뜨릴 수 있다는 것입니다. 연구자들이 이미 안전한 모델에 새로운 언어를 추가했을 때, 모델이 원래의 언어에서 해로운 요청을 거부하는 능력이 때때로 저하되었습니다. 이는 새로운 언어 패턴을 배우는 과정이 이미 설치된 안전 제약 조건과 충돌할 수 있음을 나타냅니다. 더욱이, 검토 결과에 따르면 세계 여러 지역에서 흔히 발생하는 방식인 한 문장 안에 여러 언어를 혼용하는 경우, AI를 속이기가 훨씬 쉬워집니다. 이러한 혼용 언어 프롬프트는 순수 언어 공격을 막아내는 안전 필터를 우회할 수 있습니다.
결론적으로, 이 검토는 단순히 영어 안전 데이터를 번역하는 현재의 경로로는 불충분하다고 결론짓습니다. 연구자들은 진정한 안전을 위해서는 현지 언어로 기초부터 데이터셋과 평가 도구를 구축해야 하며, 무엇이 자신의 문화적 맥락에서 해로운 것인지를 정의하기 위해 원어민을 참여시켜야 한다고 주장합니다. 그들은 미래의 발전이 단일 언어가 모델의 안전 이해를 지배하지 않도록 학습 데이터를 균형 있게 맞추는 것에 달려 있다고 제안합니다. 이러한 조치가 취해지지 않는 한, 안전한 인공지능의 약속은 영어 이외의 언어를 사용하는 수십억 명의 사람들에게는 여전히 닿을 수 없는 것이며, 그들은 영어 사용자들은 겪지 않는 위험에 노출된 채 남겨질 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.