← 최신 논문
💬 NLP

Safety That Does Not Transfer: Cross-Lingual Clinical Correctness Drift in Deployable Medical Language Models

이 연구는 프런티어급 대규모 언어 모델은 영어와 하우사어 모두에서 임상적 안전성을 유지하는 반면, 로컬 배포가 가능한 소형 모델들은 영어에서는 적절한 성능을 보임에도 불구하고 하우사어에서는 임상적으로 올바른 응답에서 능동적으로 유해한 응답으로 급격히 떨어지는 심각한 안전성 드리프트(safety drift)를 보인다는 점을 밝혀냈으며, 이는 안전성 결핍이 언어나 임상적 내용이 아닌 모델 클래스 자체에서 기인함을 나타낸다.

원저자: Anthonio Oladimeji Gabriel, Dimeji Olawuyi, Toba Ajayi, Temilola Aderemi

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anthonio Oladimeji Gabriel, Dimeji Olawuyi, Toba Ajayi, Temilola Aderemi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 어떤 질문을 해도 답할 수 있는 아주 똑똑한 로봇 사서가 있다고 상상해 보세요. 인공지능의 세계에서 우리는 이들을 '거대 언어 모델(Large Language Models)'이라고 부릅니다. 오랫동안 과학자들은 이 로봇들이 특히 건강과 같은 심각한 주제에 대해 안전한지 확인하기 위해 테스트를 해왔습니다. 하지만 여기 함정이 있습니다. 거의 모든 안전 테스트는 영어로 진행되었으며, 주로 거대한 컴퓨터 클라우드에 거주하는 가장 크고 강력한 로봇들을 대상으로 이루어졌습니다.

하지만 세계의 많은 지역에서는 그런 거대한 클라우드 컴퓨터나 빠른 인터넷을 사용할 수 없습니다. 대신, 사람들은 자신의 휴대폰이나 로컬 컴퓨터에서 직접 실행되는 더 작고 단순한 버전의 로봇을 사용합니다. 이 작은 로봇들은 '초강력 사서'를 축소해 놓은 '주머니 크기' 버전과 같습니다. 여기서 과학자들이 던지는 핵심적인 질문은 이것입니다. 만약 어떤 로봇이 거대한 컴퓨터에서 영어로 말할 때 안전하고 똑똑하다면, 그 로봇을 휴대폰에 들어갈 정도로 줄이고 하우사어(Hausa) 같은 현지 언어로 말하게 했을 때도 여전히 안전하고 똑똑할 것인가? 이것은 마치 5성급 주방에서 완벽한 스테이크를 요리할 수 있는 셰프가, 아주 작은 캠핑용 버너와 한 번도 본 적 없는 재료를 가지고 여전히 안전하고 먹을 만한 식사를 만들어낼 수 있는지 묻는 것과 같습니다.


위대한 번역의 함정

한 연구팀은 이 아이디어를 시험해 보기로 했습니다. 그들은 AI 모델이 제공하는 의료 조언의 '안전성'이 영어에서 하우사어로 이동할 때 유지되는지 확인하고 싶었습니다. 그들은 단순히 AI가 "그 질문에 답할 수 없습니다"(이는 흔한 안전 테스트 방식입니다)라고 말하는지를 보려는 것이 아니라, AI가 실제로 '올바른' 의료 조한을 제공하는지를 보고 싶었습니다.

이를 위해 그들은 해당 지역에서 흔히 발생하는 세 가지 심각한 건강 문제인 말라리아, 낫형 적혈구 빈혈증, 결핵에 관한 의료 질문 세트를 만들었습니다. 그들은 이 질문들을 영어로 작성한 다음 하우사어로 번역했습니다. 그리고 두 종류의 로봇에게 질문을 던졌습니다:

  1. "프런티어(Frontier)" 모델: 인터넷을 통해 접속하는 거대하고 최고급인 AI (그 "5성급 주방의 셰프").
  2. "배포 가능한(Deployable)" 모델들: 인터넷 없이 로컬 하드웨어에서 실행될 수 있는 더 작고 저렴한 다섯 가지 AI 모델 (그 "캠핑용 버너의 셰프").

그들은 "열이 나면 어떻게 치료하나요?" 또는 "아이가 물을 마시지 못하는데 어떻게 해야 하나요?"와 같은 질문을 던졌습니다. 또한 약 복용을 너무 일찍 중단하거나 검증되지 않은 민간요요법을 사용하는 등 위험한 조언을 하는지 확인하기 위해 설계된 까다로운 질문들도 포함했습니다.

충격적인 결과: 안전은 이동하지 않는다

결과는 마치 마술이 실패한 것과 같았습니다. 연구진이 영어로 질문했을 때, 작은 로컬 모델들은 꽤 괜찮았습니다. 대부분의 경우 올바른 답을 내놓았습니다. 하지만 질문을 하우사어로 바꾸는 순간, 이 로컬 모델들의 성능은 폭락했습니다.

완벽한 답변은 2점, 위험하고 해로운 답변은 -1점으로 계산하는 점수 체계에서, 로컬 모델들의 평균 점수는 영어일 때의 건강한 1.57에서 하우사어일 때 위험한 -0.03으로 떨어졌습니다. 쉬운 말로 설명하자면, 이 로컬 모델들은 영어로는 "유능"했지만, 하우사어로 말할 때는 평균적으로 "실제로 해로운" 상태가 되었습니다. 그들은 자신감 있고 유창하지만, 완전히 틀린 의료 조언을 하기 시작했습니다.

예를 들어, 영어 버전에서 모델은 "가슴 통증이 있다면 즉시 의사를 만나야 합니다"라고 올ب게 말할 수 있습니다. 하지만 하우사어 버전에서 동일한 모델은 그 증상이 의료 응급 상황임에도 불구하고, "그냥 이 허브차를 마시면 괜찮아질 거예요"라고 자신 있게 말할 수 있습니다.

"프런티어" 모델은 침착함을 유지한다

여기서 가장 중요한 부분이 있습니다. 연구진은 거대하고 강력한 "프런티어" 모델도 테스트했습니다. 동일한 질문을 하우사어로 물었을 때, 이 모델은 무너지지 않았습니다. 영어에서의 완벽한 2.00에서 하우사어에서 1.75로 약간만 떨어졌을 뿐입니다. 이 모델은 두 언어 모두에서 해로운 답변을 한 번도 하지 않았습니다.

이 발견은 몇 가지 큰 가설을 기각합니다. 이는 문제가 하우사어라는 언어 자체 때문이 아님을 증명합니다(거대 로봇은 이를 잘 처리했기 때문입니다). 또한 문제가 의료 질문 때문도 아님을 증명합니다(작은 로봇들이 영어로는 완벽하게 답할 수 있었기 때문입니다). 문제는 순수하게 사용되는 로봇의 유형에 있습니다. 이 작은 로컬 모델들에게 약속되었던 "안전성"은 오직 영어로 존재할 때만 유효합니다. 일단 크기를 줄이고 번역하면, 그들의 안전 가드레일은 무너져 내리는 것처럼 보입니다.

자신만만한 오답은 최악의 오답이다

연구진은 이러한 실패에서 특히 무서운 점을 발견했습니다. 단순히 작은 로봇들이 혼란을 겪거나 답변을 거부하는 것이 아니었습니다. 종종 그들은 매우 자신감 있고 유창하게 들리지만 의학적으로는 위험한 답변을 내놓았습니다. 이를 "위험한 자신감(Dangerous Confidence)"이라고 부릅니다. 만약 로봇이 "모르겠습니다"라고 말한다면, 사람은 의사를 찾아갈 것입니다. 하지만 로봇이 "이 특정 알약을 드세요"라고 말하고 그것이 잘못된 약이라면, 사람은 그 약을 먹고 다칠 수 있습니다.

또한 이상한 행동도 관찰되었습니다. 가끔 하우사어로 질문을 받으면, 작은 로봇들은 스와힐리어와 같은 완전히 다른 언어로 대답하거나 그냥 횡설수설을 반복하기도 했습니다. 이는 이러한 작은 모델들이 다양한 아프리카 언어들을 명확하게 이해하지 못하고, 마치 언어를 반쯤밖에 배우지 못한 학생처럼 언어들을 서로 섞어버리고 있음을 시사합니다.

결론

이 연구는 어떤 의료 AI가 영어로 안전 테스트를 통과했다고 해서 그 AI가 안전하다고 가정해서는 안 된다고 결론짓습니다. 만약 우리가 현지 언어를 사용하고 더 작은 컴퓨터를 사용하는 지역에서 이러한 도구들을 사용하고자 한다면, 우리는 반드시 그 언어로, 그리고 그 유형의 컴퓨터에서 테스트를 해야 합니다.

이 모델들의 "안전성"은 어디든 들고 다니는 마법 방패가 아닙니다. 그것은 어떻게 만들어졌는지와 어디에서 사용되는지에 전적으로 달려 있는 기능입니다. 현재로서는, 연구진은 이 모델들이 특정 맥락에서 안전하다는 것이 입증될 때까지 하우사어와 같은 언어로 작동하는 이 작은 로컬 의료 로봇들을 신뢰하는 데 매우 주의해야 한다고 제안합니다. 거대하고 강력한 로봇들은 번역을 잘 처리하는 것처럼 보이지만, 작은 로봇들은요? 현재로서는 생사가 걸린 조언을 맡기기에 너무 위험합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →