Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction
이 논문은 대상 측면의 감독 없이도 다양한 대규모 언어 모델 간에 거절 개입을 성공적으로 전이하는 '개념 기반 재구성을 통한 궤적 재생(Trajectory Replay via Concept-Basis Reconstruction)'이라는 프레임워크를 제안하며, 이는 안전 정렬의 기저에 보편적이고 저차원적인 의미 회로가 존재한다는 강력한 증거를 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 두 대의 서로 다른 로봇, 로봇 A와 로봇 B가 있다고 상상해 보세요. 이들은 서로 다른 회사에서 만들어졌고, 서로 다른 설계도를 사용하며, 서로 약간 다른 방언을 사용합니다. 하지만 당신이 까다롭거나 위험한 질문을 던지면, 두 로봇은 갑자기 "거절 모드(Refusal Mode)"로 전환됩니다. 그들은 대답을 멈추고 매우 특정한 로봇 같은 방식으로 "그것은 할 수 없습니다"라고 말합니다.
대부분의 사람들은 이 "거절 모드"가 각 로봇의 고유한 뇌 배선에 의한 것이라고 생각합니다. 하지만 이 논문은 중요한 질문을 던집니다: 모든 로봇 안에 숨겨진 보편적인 "거절 스위치"가 존재하는가?
토니 크리스토파노(Tony Cristofano)가 이끄는 저자들은 그렇다고 답합니다. 그들은 비록 겉모습은 다르더라도, "아니오"라고 말하는 그들의 뇌 부분은 동일한 기본적인 레고 블록들로 만들어져 있다고 믿습니다.
그들이 이 과정을 증명한 방법을 쉬운 비유를 통해 설명하면 다음과 같습니다.
1. "보편적 레시피" (개념 원자)
"거절"이 로봇의 뇌 속에서 하나의 거대하고 엉망진창인 덩어리가 아니라, 특정 재료들로 만들어진 레시피라고 상상해 보세요.
- 저자들은 20개의 기초적인 개념(예: "기만", "안전", "법률 용어" 등)으로 구성된 공유된 "식료품 저장실"을 만들었습니다. 그들은 이를 **개념 원자(Concept Atoms)**라고 부릅니다.
- 그들은 로봇 A가 거절할 때, 이 20가지 재료를 특정 비율(예: "안전" 50% + "법률 용어" 30%)로 혼합하고 있다는 것을 발견했습니다.
- 놀라운 발견은 이것입니다. 로봇 B 역시 정확히 같은 레시피를 사용한다는 것입니다. 로봇 B가 다르게 만들어졌음에도 불구하고, 그 로봇의 "거절"은 동일한 재료와 동일한 비율로 구성되어 있었습니다.
2. "궤적 재생" (춤 동작 복제하기)
보통 로봇 A의 거절을 고치기 위해 뇌를 건드리면, 수학을 하거나 시를 쓰는 능력을 실수로 망가뜨릴 수 있습니다. 이는 "거절" 회로가 "지능" 회로와 엉켜 있기 때문입니다.
무엇도 망가뜨리지 않고 이를 해결하기 위해, 저자들은 궤적 재생(Trajectory Replay) 기술을 사용했습니다.
- 1단계: 춤 동작 매핑. 그들은 로봇 A가 거절할 때 뇌의 층(layer)들을 어떻게 통과하는지 관찰했습니다. 단순히 한 지점만 본 것이 아니라, 전체적인 단계의 순서를 지켜보았습니다.
- 2단계: 단계 번역. 그들은 "동적 시간 왜곡(Dynamic Time Warping)"이라는 번역기를 사용하여 로봇 A의 단계들을 로봇 B의 단계들과 맞추었습니다. 로봇 B의 층이 더 많거나 적더라도, 로봇 A의 어느 단계가 로봇 B의 어느 단계에 해당하는지를 알아냈습니다.
- 3단계: 레시피 재생. 그들은 로봇 A의 "거절 레시피"를 가져와서, 거절이 발생하는 특정 층들에만 재생했습니다.
3. "안전 방패" (Weight-SVD 가드)
한 가지 큰 위험이 있었습니다. 만약 로봇 B의 "거절 레시피"가 실수로 "수학"이나 "논리" 회로를 건드린다면 어떻게 될까요? 그러면 로봇 B는 바보가 될 것입니다.
이를 방지하기 위해, 그들은 **안전 방패(Safety Shield)**를 추가했습니다.
- 그들은 로봇 B의 뇌를 살펴보고, 가장 중요한 기술(수학, 코딩 등)이 살아있는 "슈퍼 고속도로"를 식별했습니다. 이들은 "고분산(high-variance)" 영역입니다.
- 그들은 "거절 레시피"가 이러한 슈퍼 고속도로로부터 멀어지도록 밀어내는 방패를 구축했습니다.
- 결과: 그들은 로봇 B의 수학이나 코딩 능력을 손상시키지 않고도 성공적으로 "거절 모드"를 끌 수 있었습니다.
대규모 실험
그들은 다음을 포함한 8가지의 서로 다른 로봇 쌍을 대상으로 테스트했습니다:
- 작은 로봇 vs 큰 로봇.
- 서로 다른 계열의 로봇 (예: Qwen vs Ministral).
- 서로 다른 구조의 로봇 (하나는 표준 "밀집(Dense)" 뇌였고, 다른 하나는 복잡한 "전문가 혼합(Mixture of Experts)" 뇌였습니다).
결과:
거의 모든 경우에서, 그들은 "거절 레시피"를 한 로봇에서 다른 로봇으로 성공적으로 전이시켰습니다.
- 거절 감소: 대상 로봇들은 해로운 질문에 대해 "그것은 할 수 없습니다"라고 말하는 것을 멈췄습니다.
- 기술 유지: 로봇들은 이전과 마찬가지로 수학 문제를 풀고 코드를 작성할 수 있었습니다.
- 속임수 없음: 그들은 대상 로봇에게 거절을 멈추는 법을 가르치기 위해 어떤 "나쁜" 예시도 보여줄 필요가 없었습니다. 단지 기증자 로봇으로부터 "레시피"를 가져왔을 뿐입니다.
이것이 왜 중요한가 (논문에 따르면)
이 논문은 안전 정렬(safety alignment)이 무작위적인 마법이 아님을 결론짓습니다. 안전 정렬은 서로 다른 AI 모델들이 유사한 방식으로 구축하는 보편적이고 저차원적인 구조인 것으로 보입니다.
안전에 대한 중요한 참고 사항:
저자들은 이것이 (AI의 뇌가 어떻게 작동하는지 연구하기 위한) 진단 도구이지, 현실 세계에서 안전 장치를 깨뜨리기 위해 사용될 도구가 아님을 매우 신중하게 밝히고 있습니다. 그들은 이 방법이 안전 필터를 끌 수 있기 때문에 "이중 용도(dual-use)"의 위험이 있다고 명시적으로 경고했습니다. 그들은 (개념의 저장소와 같은) "안전한" 코드 부분은 공개했지만, (기증자 모델을 훈련하는 데 사용된 구체적인 나쁜 질문과 같은) "해로운" 부분은 오용을 방지하기 위해 비공개로 유지했습니다.
요약하자면: 그들은 AI의 거절이 보편적인 언어와 같다는 것을 증证明했습니다. 만약 한 AI가 "아니오"라고 말하는 문법을 알고 있다면, 완전히 다른 AI가 뇌를 망가뜨리지 않고도 "아니오"라고 말하는 것을 멈추도록 가르칠 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.