Decided Upstream, Written Late: Locating and Pricing the Cross-Lingual Refusal Circuit of a Multilingual MoE
이 논문은 다국어 혼합 전문가(Mixture-of-Experts) 모델의 교차 언어적 안전성 격차가 유해성을 감지하지 못해서 발생하는 것이 아니라, 특정 어텐션 기반 '반대자(opposer)' 회로를 증폭하거나 외적인 수정을 가하는 대신 이를 억제함으로써 효과적이고 저렴하게 수리될 수 있는 후기 단계의 언어 의존적 거절 메커니즘에서 기인한다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 영어부터 힌디어, 타밀어에 이르기까지 수백 가지의 다양한 언어로 우리와 대화할 수 있는 세상을 상상해 보세요. 과학자들은 이 컴퓨터들이 "좋은 시민"이 되도록 가르치려 노력하고 있습니다. 즉, 가짜 뉴스를 쓰거나 무기를 만드는 것과 같이 해롭거나 위험한 일을 요청받았을 때 "안 돼"라고 말할 수 있도록 말이죠. 이 분야를 **AI 안전성(AI safety)**이라고 부릅니다. 오랫동안 연구자들은 컴퓨터가 영어로 "안 돼"라고 말하는 법을 배우면, 인간이 한 언어에서 배운 규칙을 다른 언어에도 적용할 수 있는 것처럼 모든 다른 언어로도 자동으로 말할 수 있을 것이라고 생각했습니다. 하지만 항상 그런 것은 아닙니다. 때때로 컴퓨터는 영어로는 엄격한 수호자처럼 행동하다가도, 다른 언어에서는 흐리멍덩한 태도를 보이기도 합니다. 이 논문은 왜 이런 현상이 발생하는지, 그리고 컴퓨터의 유창한 언어 능력을 망가뜨리지 않으면서 어떻게 이를 해결할 수 있는지 알아내기 위해 컴퓨터의 "두뇌" 속을 파고듭니다.
연구진은 여러 인도 언어를 추론하고 말하도록 설계된 매우 똑똑한 컴퓨터 모델인 Sarvam-30B를 연구했습니다. 그들은 요청이 부적절한지 아니면 그대로 수행할지를 결정하는 모델 내부의 기계적인 "톱니바퀴"를 이해하고자 했습니다. 그들은 컴퓨터가 어떤 언어로 요청을 받더라도 그 요청이 나쁘다는 것을 인지하고 있다는 사실을 발견했습니다. 문제는 컴퓨터가 위험을 감지하지 못하는 것이 아니라, "안 돼"라고 말하는 부분의 작동 방식이 언어에 따라 다르게 나타나며, 이 과정이 사고 과정의 매우 늦은 단계에서 일어난다는 점입니다.
다음은 그들이 발견한 내용을 쉬운 비유를 통해 설명한 이야기입니다.
탐정과 서기
컴퓨터의 두뇌를 두 개의 주요 팀인 탐정들과 서기들이 있는 거대한 공장이라고 상상해 보세요.
탐정들은 공장 중간 단계에서 일합니다. 그들의 임무는 모든 요청을 살펴보고 "이것이 위험한가?"라고 묻는 것입니다. 연구진은 이 탐정들이 매우 뛰어나다는 것을 발견했습니다. 그들은 영어, 힌디어, 타밀어 및 기타 언어에서 위험을 거의 동일한 방식으로 포착합니다. 만약 여러분이 그들에게 "이것이 나쁜 생각인가요?"라고 묻는다면, 어떤 언어를 사용하든 그들은 기억 속의 같은 지점을 가리킬 것입니다. 실제로 이 "위험 신호"는 매우 강력하고 공유되어 있어서 언어에 관계없이 거의 동일합니다.
하지만 서기들은 실제로 최종 답변을 작성하는 사람들입니다. 그들은 "그것을 할 수 없습니다" 또는 "물론입니다, 여기 방법이 있습니다"라고 타이핑하는 사람들입니다. 연구진은 큰 놀라움을 발견했습니다: 탐정과 서기는 서로 다른 언어를 사용하며 서로 다른 일정으로 움직입니다.
공장 중간에 있는 탐정들이 "위험해!"라고 명확하게 외치더라도, 그 외침이 자동으로 서기들을 멈추게 하지는 못합니다. 서기들은 조립 라인의 맨 끝에 위치합니다. 그들은 단순히 "위험" 표지판을 읽는 것에 그치지 않고, 문장이 생성되는 동안 단어 하나하나를 직접 만들어내야 합니다.
"늦은" 문제
논문에 따르면, 프로세스의 시작 단계(upstream)에서 단순히 "위험해!"라고 소리쳐서 컴퓨터가 "안 돼"라고 말하도록 강제하려고 해도 효과가 없습니다. 이는 마치 기차의 브레이크가 맨 뒤에 있는 스위치에 의해 제어되는데, 엔진에 대고 소리를 질러 기차를 멈추려는 것과 같습니다. "위험" 신호는 서기들에게 도달하기 전에 사라져 버립니다.
대신, 거절은 프로세스의 후반부에 구축됩니다. 연구진은 "예"를 "아니오"로 바꾸는 실제 변화가 컴퓨터 두뇌의 마지막 층(layers)에서 일어나며, 이 변화는 "위험" 신호와는 완전히 다른 방향으로 움직인다는 것을 발견했습니다. 그것은 마치 탐정들은 북쪽을 가리키고 있는데, 서기들은 동쪽으로 걷고 있는 것과 같습니다. 컴퓨터는 요청이 나쁘다는 것을 알지만, 행동을 멈추게 하는 메커니즘은 별개의 후기 단계 프로세스이며, 이 과정에서 언어 차이로 인해 혼란을 겪습니다.
브레이크와 엔진
이를 해결하기 위해 연구진은 기계에 개입할 방법을 찾았습니다. 그들은 브레이크와 엔진 역할을 하는 특정 회로—두뇌의 아주 작고 국소적인 부분—를 찾아냈습니다.
- 엔진 (작성자): 이 부분은 컴퓨터가 거절의 말을 쓰도록 밀어붙이려고 합니다.
- 브레이크 (반대자): 이 부분은 거절이 일어나는 것을 막으려고 합니다.
연구진은 이 안전 격차를 해결하기 위해 세 가지 방법을 테스트했습니다:
- 엔진을 때리기: 그들은 "작성자" 부분을 더 강하게 만들어 컴퓨터가 "안 돼"라고 말하도록 강제하려고 했습니다. 결과는 참담했습니다. 많은 에너지가 소모되었고(컴퓨터의 말투가 이상하거나 스팸처럼 변함), 효과도 그다지 좋지 않았습니다. 이는 마치 핸드브레이크가 걸려 있는 상태에서 자동차 엔진만 과하게 회전시켜 언덕을 올라가려는 것과 같았습니다.
- 수술: 그들은 특정 작은 부분(이른-말하는 "헤드"라고 불리는 부분)을 정밀하게 제거하거나 변경하려고 시도했습니다. 이는 정밀하고 비용이 적게 들었지만, 아무런 효과가 없었습니다. 컴퓨터는 여전히 나쁜 요청에 대해 "예"라고 답했습니다.
- 브레이크 해제하기: 연구진은 프로세스의 맨 마지막 단계에서 "반대자" 또는 "브레이크"를 단순히 **약화(dampen)**시키면, 컴퓨터가 갑자기 모든 언어에서 올바르게 "안 돼"라고 말하기 시작한다는 것을 발견했습니다. 이것이 바로 마법의 열쇠였습니다. 이 방법은 저렴하고 효과적이었으며, 컴퓨터의 유창한 언어 능력을 망가뜨리지도 않았습니다.
다양한 언어에 있어 이것이 중요한 이유
이런 현상이 발생하는 이유는 "탐정들"(위험 신호)은 모든 언어에서 공유되지만, "서기들"과 그들의 "브레이크"는 그렇지 않기 때문입니다. 연구진은 컴퓨터가 최종 답변을 작성하는 데 가까워질수록, 그 경로가 매우 특정 언어에 특화된다는 것을 발견했습니다. 영어의 경우 "안 돼"라고 말하는 경로가 명확합니다. 하지만 다른 언어에서는 "브레이크"가 훨씬 강력하거나 경로가 차단되어 있습니다.
이 마지막 단계의 특정 "브레이크"를 약화시킴으로써, 연구진은 전체 시스템을 다시 학습시키지 않고도 저자원 언어에서도 영어만큼 잘 거절하도록 만들 수 있었습니다.
큰 그림
이 논문은 단순히 안전 격차가 존재한다는 사실만을 알려주는 것이 아니라, 그 격차가 어디에 살고 있으며 이를 고치는 데 얼마나 많은 비용이 드는지 보여줍니다. 핵심적인 결론은 안전이란 단순히 위험을 감지하는 것만이 아니라, 그 감지가 어떻게 행동으로 이어지는지에 관한 것이라는 점입니다.
연구진은 또한 이 아이디어를 완전히 다른 컴퓨터 모델(Qwen3-30B-A3B)에서도 테스트했으며, 동일한 패턴을 발견했습니다: 공유된 "탐정"과 늦게 나타나는 언어별 "브레이크"가 있다는 점입니다. 이는 AI 안전성을 개선하는 데 거대한 시스템 전체의 개편이 필요하지 않을 수도 있음을 시사합니다. 대신, 우리는 각 모델의 특정 "브레이크"를 찾아내어 살짝 느슨하게 풀어줌으로써, 안전 메커니즘이 모든 언어에서 자연스럽게 작동하도록 만들 수 있을지도 모릅니다.
요약하자면, 컴퓨터가 멍청하거나 편향된 것이 아닙니다. 단지 "안 돼"라고 말하는 부분이 문장의 끝부분에 숨어 있으며, 언어 특유의 브레이크 때문에 주춤하고 있을 뿐입니다. 우리가 어디를 찾아야 할지만 알게 된다면, 우리는 그것을 고칠 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.