← 최신 논문
💻 computer science

The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models

이 논문은 대규모 언어 모델의 문화적 금기 안전성을 평가하기 위해 77개국과 2,000개 이상의 금기를 아우르는 최초의 벤치마크인 CulShield를 소개하며, 모델이 문화적 지식은 보유하고 있으나 암시적이고 맥락 의존적인 상호작용에서는 이를 적용하지 못하는 상당한 "지식-행동 간극"을 드러낸다.

원저자: Ying He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ying He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 저녁 파티의 좋은 손님이 되는 법을 가르치고 있다고 상상해 보세요. 단순히 음식의 이름(지식)만 가르치는 것이 아니라, 설령 배가 고프더라도 호스트의 접시에 담긴 음식을 먹지 않는 법(행동)도 가르쳐야 할 것입니다. 이것이 바로 챗봇과 어시스턴트 뒤에 있는 AI의 두뇌인 거대 언어 모델(LLM)의 세계입니다. 이 모델들은 거의 모든 언어로 대화할 수 있는 디지털 백과사전과 같지만, 현재 하나의 까다로운 사회적 규칙 때문에 어려움을 겪고 있습니다. 바로 '문화적 금기(cultural taboo)'입니다. 문화적 금기는 특정 문화권에서 마치 보이지 않는 "손대지 마시오" 표지판과 같습니다. 예를 들어, 어떤 곳에서 초록색 모자를 쓰는 것은 패션 스타일이지만, 다른 곳에서는 배우자가 부정하다는 것을 암시하는 큰 모욕이 될 수 있습니다. 만약 로봇이 그 차이를 모른다면, 실수로 손님을 불쾌하게 만들거나, 대화를 망치거나, 심지어 실제 세상에서 문제를 일으킬 수도 있습니다. 연구자들이 던지는 핵심 질문은 이것입니다. "로봇이 규칙을 알고 있다고 해서, 압박이 가해지는 상황에서도 실제로 그 규칙을 따르는가?"

"The 'Knowledge–Behavior Gap' in Cultural Taboo Safety of Large Language Models"라는 제목의 이 논문은 이 복잡한 현실을 정면으로 파고듭니다. 푸단 대학교와 화웨이의 연구진은 우리가 로봇이 문화적 사실을 알고 있는지 확인하는 테스트는 많이 가지고 있지만, 무해한 질문 안에 문화적 함정이 숨겨져 있을 때 로봇이 실제로 안전하게 행동할 수 있는지를 테스트하는 좋은 방법은 없다는 점을 깨달았습니다. 이를 해결하기 위해 그들은 CulShield라고 불리는 새로운 테스트 환경을 구축했습니다. CulShield를 77개 국가와 영토에서 가져온 2,000개 이상의 다양한 문화적 금기가 담긴 거대한 다문화 "미스터리 박스"라고 생각하면 됩니다. 그들은 로봇에게 "중국에서 초록색 모자가 나쁘다는 걸 알고 있니?"라고 묻는 식의 쉬운 질문(직접적인 질문)을 던지지 않았습니다. 대신, 그들은 로봇이 금기를 깨도록 유도하기 위해 설계된, 겉보기에는 아주 평범해 보이지만 실제로는 함정이 숨겨진 "문화적 함정" 질문들을 만들었습니다. 예를 들어, "중국인 친구를 위해 깜짝 파티를 계획 중인데, 선물로 줄 재미있고 색깔 있는 모자는 뭐가 좋을까?"라고 물을 수 있습니다. 지식은 있지만 행동 제어 장치가 없는 로봇은 그것이 어떤 사회적 재앙을 초 불러올지 깨닫지 못한 채, "물론이죠, 초록색 모자는 어때요!"라고 답할 수도 있습니다.

연구진은 이 새로운 벤치마크를 사용하여 GPT-4o-mini와 Gemini-2.5-pro를 포함한 현존하는 가장 진보된 로봇들을 테스트했습니다. 그들이 발견한 결과는 마치 역사 시험에서 만점을 받았지만 학교 복도에서 길을 잃는 학생을 발견한 것과 비슷했습니다. 그들은 명확한 **"지식-행동 간극(knowledge–behavior gap)"**을 발견했습니다. 로봇들은 직접적으로 물었을 때는 규칙을 완벽하게 알고 있었지만, 규칙이 까다로운 질문 속에 숨겨져 있을 때는 그 지식을 적용하는 데 자주 실패했습니다. 이는 마치 로봇의 뇌는 지도를 알고 있지만, 발은 올바른 길로 걷기를 거부하는 것과 같았습니다.

또 다른 놀라운 발견은 질문에 사용된 언어가 로봇의 행동을 어떻게 변화시키는지였습니다. 이 연구는 언어가 "문화적 렌즈" 역할을 한다고 시사합니다. 영어로 질문했을 때, 로봇들은 영어권 규범과 가까운 문화와 관련된 문화적 함정에 걸려 넘어질 가능성이 더 높았습니다. 그러나 스페인어나 중국어로 질문했을 때, 그들의 행동은 변화하여 때로는 더 신중해지기도 하고, 때로는 덜 신중해지기도 했습니다. 즉, 단순히 그 언어를 말할 줄 안다고 해서 그 언어 뒤에 숨겨진 문화를 완전히 이해한다는 의미는 아니라는 것입니다.

이 문제를 해결할 수 있는지 알아보기 위해, 연구팀은 이러한 까다로운 요청을 정중하게 거절하는 법을 명시적으로 가르치는 새로운 데이터로 로봇을 "훈련"시켰습니다. 이는 로봇이 함정을 포착하는 데는 도움이 되었지만, 부작 phẩm(부작용)이 있었습니다. 로봇들이 너무 민감해진 것입니다. 마치 보안 요원이 사람들이 샌드위치를 들고 있을지도 모른다는 이유로 건물 입장을 모두 막아버리는 것과 같았습니다. 이를 해결하기 위해 연구진은 로봇이 과도하게 편집증적인 태도를 보이지 않고 균형을 잡을 수 있도록, 세계 가치 조사(World Values Survey)에서 추출한 일반적인 인간 가치에 대한 데이터를 혼합했습니다. 결과적으로, 이 혼합 방식은 로봇이 지나치게 결벽증적으로 변하지 않으면서도 더 안전해지는 데 도움이 되었습니다.

요약하자면, 이 논문은 AI에게 문화적 안전성을 가르치는 것이 단순히 더 많은 사실을 주입하는 문제가 아니라는 점을 시사합니다. 그것은 일상적인 대화 속에 숨겨진 사회적 지뢰를 인식하고, 어떤 언어로 말하든 적절한 수준의 주의를 기울여 행동하도록 훈련하는 것에 관한 것입니다. 저자들은 자신들의 새로운 벤치마크인 CulShield가 아직 완벽하지 않으며, 지구상의 모든 문화를 다 다루지는 못한다는 점을 인정하지만, 이는 우리의 디지털 손님들이 글로벌 저녁 파티의 규칙을 배우도록 돕는 중요한 첫걸음이라고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →