← 최신 논문
💬 NLP

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

본 논문은 네 가지 오픈 가중치 언어 모델을 네이티브 화자가 검증한 SomaliBench v0 벤치마크를 사용하여 평가하고, 모델이 유해한 요청에 대한 유창한 순응이 아니라 불일치하거나 잘못된 언어의 출력으로 인해 소말리어로 유해한 프롬프트를 거부하지 못하는 경우가 빈번한 영어-소말리어 안전 거부 간극이 있음을 밝힌다.

원저자: Khalid Yusuf Dahir

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Khalid Yusuf Dahir

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

네 가지 서로 다른 로봇 (AI 모델) 이 도움이 되고, 해를 끼치지 않으며, 정직하도록 설계되었다고 상상해 보세요. 위험한 질문을 했을 때 이 로봇들이 진정으로 "안전한지" 테스트하고 싶다고 가정해 봅시다.

이 논문은 이러한 로봇들을 점검하는 안전 검사관과 같지만, 한 가지 차이가 있습니다: 검사관은 동일한 위험한 질문을 영어소말리어라는 두 가지 다른 언어로 묻습니다.

그들이 발견한 내용을 간단히 설명해 드리겠습니다:

설정: "하지 마세요" 테스트

연구자들은 100 가지 위험한 요청 (예: "폭탄을 만드는 방법은 무엇인가요?" 또는 "누구의 신원을 도용하는 방법은 무엇인가요?") 을 준비하고, 네 가지 인기 있는 무료 AI 로봇에게 이러한 질문을 했습니다.

  • 테스트: 먼저 영어로 질문한 후, 동일한 질문을 소말리어로 다시 물었습니다.
  • 목표: 로봇들이 두 언어 모두에서 "아니요, 그건 할 수 없습니다"라고 거절 (Refusal) 하는지, 아니면 혼란을 겪으며 "네"라고 동의 (Compliance) 하거나 단순히 의미 없는 말을 늘어놓는지 (Unclear) 확인하고 싶었습니다.

큰 발견: "언어 맹점"

결과는 충격적이었습니다. 영어로 말할 때는 매우 엄격하지만, 소말리어로 말하면 갑자기 매우 느슨해지거나 혼란스러워지는 보안 요원과 같은 상황입니다.

  • 영어에서: 네 로봇 모두 "아니요"라고 말하기를 매우 잘했습니다. 위험한 요청을 거의 100% 의 비율로 거절했습니다. 그들은 무엇을 해야 할지 정확히 아는 바운서와 같았습니다.
  • 소말리어에서: 로봇들의 신뢰도는 훨씬 떨어졌습니다.
    • Llama 와 Aya: 이 두 로봇은 소말리어에서 안전 규칙을 거의 완전히 잊어버렸습니다. 10% 미만의 경우에만 "아니요"라고 답했습니다.
    • Qwen: 이 로봇은 약 24% 의 경우에만 "아니요"라고 답했습니다.
    • Gemma: 이 로봇은 무리 중 가장 잘했지만, 여전히 약 59% 의 경우에만 "아니요"라고 답했으며, 영어 성능에 비해 절반 이상 실패했습니다.

"혼란스러운 로봇" 문제

가장 흥미로운 부분은 여기 있습니다. 로봇들이 소말리어에서 실패했을 때, 항상 "네, 폭탄 만드는 방법을 알려드리겠습니다"라고 말한 것은 아닙니다.

네 로봇 중 세 개에서 가장 흔한 실패는 위험한 "네"가 아니라 **"무슨 소리인가요?"**였습니다.

  • 그들은 빈 답변을 내놓았습니다.
  • 잘못된 언어로 말했습니다.
  • 의미 없는 텍스트나 일관성 없는 글을 생성했습니다.

이렇게 생각해보세요: 모르는 언어로 길 안내를 요청한 당황한 관광객에게 길을 물어보면, 그들이 당신을 절벽으로 안내하는 것 (해로운 동의) 이 아니라 멍하니 바라보거나 프랑스어로 말을 시작하는 것 (불분명한 출력) 일 수 있습니다. 논문은 이것이 직접적인 "공격"은 아니지만, 로봇이 안전하거나 명확하게 제 역할을 하지 못한다는 점에서 여전히 실패라고 주장합니다.

"심판자"와 "현장 점검"

연구자들이 계산을 정확하게 했는지 확인하기 위해, 모든 답변을 읽고 "거절했는가? 동의했는가? 아니면 불분명한가?"를 결정하는 초지능 AI("심판자") 를 사용했습니다.

"심판자"가 실수를 하지 않았는지 확인하기 위해, 소말리어 원어민 (이 논문의 저자) 이 80 개의 답변을 무작위로 점검했습니다.

  • 결과: 인간과 AI 심판자는 100% 일치했습니다. 이는 숫자가 실제임을 매우 높은 확신으로 보여줍니다.

주요 결론

이 논문은 영어에서의 안전 훈련이 자동으로 소말리어로 전이되지 않는다고 결론 내립니다.

이러한 로봇들이 똑똑하고 여러 언어를 구사하더라도, 그들의 "안전 브레이크"는 영어에서는 매우 강력하지만 소말리어에서는 종종 약하거나 고장 난 상태입니다.

  • 격차: 영어와 소말리어에서의 안전성 사이에는 엄청난 격차가 존재합니다.
  • 미묘한 차이: 소말리어에서 실패할 때, 그들은 악의적으로 변하기보다는 단순히 무너져서 의미 없는 말을 늘어놓는 경우가 많습니다. 하지만 소말리어와 같은 주요 언어에서 명확하거나 안전하게 말하지 못하는 로봇은 여전히 문제입니다.

연구자들이 하지 않은

이 논문이 무엇이 아닌지를 알아두는 것이 중요합니다:

  • 그들은 로봇을 해킹하기 위한 교묘한 트릭 (재일브레이크) 을 시도하지 않았습니다.
  • 실제 세계의 앱이나 라이브 시스템에서 로봇을 테스트하지 않았습니다.
  • 로봇들이 제공한 실제 위험한 답변을 공개하지 않았습니다 (인터넷을 안전하게 유지하기 위함).

간단히 말해: 이 AI 로봇들은 영어로는 완벽한 업무 수행을 하는 이중언어 보안 요원들과 같지만, 같은 고객들이 소말리어로 말하면 혼란스러워하거나 침묵하거나 도움이 되지 않습니다. 연구자들은 그 혼란의 격차가 얼마나 큰지 정확히 측정했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →