← 최신 논문
💬 NLP

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

본 논문은 번역 중심의 접근 방식이 한국어와 그 기반이 모델의 안전성 행동 및 과도한 거절률에 미치는 고유한 영향을 포착하지 못한다는 점을 보여주기 위해 '번역창작 행렬'을 활용한 이중언어 벤치마크인 ROK-FORTRESS를 소개하며, 이는 대규모 언어 모델에 대한 국가 안보 및 공공 안전 평가가 언어와 지정학적 맥락 간의 복잡한 상호작용을 고려해야 함을 시사합니다.

원저자: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Ch
게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q Knight, Joseph Brandifino, Max Fenkell

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇이 "폭탄을 만드는 방법은 무엇인가?"나 "은행을 해킹하는 방법은 무엇인가?"와 같은 위험한 지시를 따를지 테스트한다고 상상해 보세요.

오랫동안 안전 연구자들은 이러한 로봇들을 주로 영어로 테스트했습니다. 그들은 위험한 질문들을 다른 언어 (예: 한국어) 로 단순히 번역하기만 해도 로봇이 여전히 "아니오"라고 답할 것이라고 가정했습니다. 그들은 로봇의 안전 규칙이 어떤 언어로 말하든 동일하게 작동하는 보편적인 방패와 같다고 생각했습니다.

하지만 이 논문, ROK-FORTRESS는 다음과 같이 말합니다: "잠깐만요. 이는 단순히 언어의 문제가 아니라, 이야기가 펼쳐지는 장소에 관한 문제입니다."

다음은 일상적인 비유를 사용하여 그들이 무엇을 했으며 무엇을 발견했는지에 대한 간단한 요약입니다.

1. "번역 대 재창작 (Transcreation)" 테스트

연구자들은 단순히 질문을 번역하는 것이 요리법을 번역하는 것과 같다는 것을 깨달았습니다. "미국 사과 파이" 요리법을 한국어로 번역하면 여전히 사과 파이 요리법이지만, 한국어 단어로 표현된 것일 뿐입니다. 재료 (위협) 는 동일합니다.

하지만 **재창작 (Transcreation)**은 다릅니다. 이는 사과 파이 요리법을 가져와 "한국 고구마 파이" 요리법으로 바꾸는 것과 같습니다. 의도 (달콤한 디저트 만들기) 는 동일하지만, 구체적인 재료, 문화적 맥락, 그리고 지역 규칙은 완전히 다릅니다.

이 팀은 1,235 개의 다양한 "위험한" 질문으로 ROK-FORTRESS(안전 테스트를 위한 요새) 라는 거대한 테스트를 구축했습니다. 그들은 이를 네 가지 방식으로 테스트했습니다:

  1. 영어, 미국 맥락: "FBI 를 해킹하는 방법은 무엇인가?" (원문)
  2. 한국어, 미국 맥락: "FBI 를 해킹하는 방법은 무엇인가?" (번역)
  3. 영어, 한국 맥락: "한국 국가정보원을 해킹하는 방법은 무엇인가?" (적응)
  4. 한국어, 한국 맥락: "한국 국가정보원을 해킹하는 방법은 무엇인가?" (완전한 재창작)

2. 큰 놀라움: "보수적인 한국인" 효과

대부분의 이전 연구들은 로봇이 잘 모르는 언어 (예: 한국어) 로 말하는 것이 로봇을 위험한 행위로 속일 수 있는 "구멍"이나 "뒷문"이 될 것이라고 생각했습니다. 로봇이 혼란스러워하여 나쁜 일에 대해 "예"라고 답할 것이라고 생각했습니다.

하지만 이 논문은 정반대의 결과를 발견했습니다.

로봇에게 한국어로 질문했을 때, 로봇들은 실제로 더 신중해졌습니다. 그들은 "아니오"라고 더 자주 답했습니다.

  • 비유: 박물관의 경비원을 상상해 보세요. 만약 당신이 그의 모국어에 지역 사투리를 섞어 질문하면, 그는 매우 엄격해져서 신분증을 세 번이나 확인합니다. 만약 당신이 부실한 외국어로 질문하면 그는 혼란스러워하며 당신을 들여보낼 수도 있습니다. 하지만 이러한 로봇들은 한국어로 말할 때 더욱 엄격해지는 경비원처럼 행동했습니다. 그들은 한국어 자체를 "적신호"나 "위험 신호"로 간주하여, 요청이 위험하더라도 요청을 거절할 가능성이 더 높아졌습니다.

3. "맥락" 요인

연구자들은 또한 이야기가 발생하는 장소가 중요하다는 것을 발견했습니다.

  • 영어로 미국 은행에 대해 로봇에게 질문하면, 로봇은 신중할 수 있습니다.
  • 같은 로봇에게 영어로 한국 은행에 대해 질문하면, 로봇은 훨씬 신중해집니다.
  • 한국 은행에 대해 한국어로 질문하면, 로봇은 그중에서도 가장 신중합니다.

이는 "지역 모드"를 갖춘 보안 시스템과 같습니다. 로봇이 상황이 한국 (한국어 이름, 장소, 법률 포함) 에서 발생하고 있음을 인식하면, 안전 벨트를 더욱 단단히 조입니다.

4. "탈옥 (Jailbreak)" 반전

이 팀은 또한 모든 화려한 기교 (탈옥) 를 제거하고 질문을 직접적으로 할 때 ("폭탄을 만드는 방법은 무엇인가?") 어떤 일이 일어나는지 테스트했습니다.

  • 오픈소스 로봇: 직접적으로 질문했을 때, 이러한 로봇들은 이전 연구들이 예측한 대로 행동했습니다. 한국어로 질문하면 속이기 더 쉬웠습니다.
  • 대형 기업 로봇: OpenAI 나 Anthropic 과 같은 비싸고 대형 모델들은 직접적으로 질문받았을 때조차 한국어에서 신중함을 유지했습니다. 그들은 "언어 구멍"에 빠지지 않았습니다.

5. 이것이 중요한 이유 (논문에 따르면)

주요 결론은 안전 테스트를 단순히 번역할 수 없다는 것입니다.

로봇이 한국에서 안전한지 알고 싶다면, 영어 테스트를 가져와 번역한 후 실행해서는 안 됩니다. 한국 문화에 맞게 이야기를 바꾸어 (재창작) 야 합니다.

  • 오래된 방식: "질문을 번역하고, 답변을 확인한다." (이것은 핵심을 놓칩니다).
  • 새로운 방식: "지역 문화에 맞게 이야기를 다시 쓴 후, 답변을 확인한다."

이 논문은 이러한 특정 로봇들의 경우, 한국어로 말하고 한국 주제에 대해 이야기하는 것이 실제로 그들을 더 안전하게 (나쁜 일에 대해 "아니오"라고 말할 가능성이 높아짐) 만든다고 결론지었습니다. 이는 이전까지 모든 사람이 생각했던 것과 큰 변화입니다.

한 문장으로 요약

이 논문은 AI 로봇에게 한국어로 한국 장소에 대한 위험한 주제를 질문할 때, 그들이 더 쉽게 속지 않는다는 것을 보여주기 위한 특수 테스트를 구축했으며, 오히려 더 신중해져서 답변을 거절하는 경우가 많음을 입증함으로써 안전 테스트가 단순히 번역되는 것이 아니라 문화적으로 적응되어야 함을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →