← 최신 논문
💬 NLP

The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

이 논문은 Llama 3.1 8B에서 RLHF가 기저의 당파적 구조를 삭제함으로써가 아니라, 이러한 온전한 내부 표현으로부터 모델의 출력으로 이어지는 인과적 경로를 차단함으로써 기능적 정치적 중립성을 달성하며, 이로 인해 특정 스티어링 기술을 통해 우회 가능한 취약한 정렬이 생성된다는 것을 입증한다.

원저자: Wendy K. Tam

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wendy K. Tam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 새로운 뇌가 아닌, "중립성"이라는 가면

매우 똑똑하고 박학다식한 사람(기본 모델)이 있다고 상상해 보세요. 이 사람은 세상의 모든 책, 뉴스 기사, 트윗을 다 읽었습니다. 이 사람은 뚜렷한 주관을 가지고 있습니다. 만약 당신이 정치에 대해 묻는다면, 주제에 따라 이 사람은 즉시 열렬한 민주당원처럼 들리거나 격렬한 공화당원처럼 들릴 수 있습니다. 이 사람에게는 서로 다른 방향을 가리키는 깊고 내밀한 "나침반"이 있습니다.

연구자들은 다음과 같은 질문을 던졌습니다: 이 사람에게 "중립적"이고 도움이 되도록 훈련시키면 어떤 일이 벌어질까?

이 논문은 훈련 과정(RLHF)이 그 사람의 정치적 나침반을 지우거나 뇌를 바꾸는 것이 아니라고 주장합니다. 대신, 그 사람에게 가면을 씌우는 것입니다. 그 사람은 여전히 그 모든 정치적 의견과 내면의 방향성을 가지고 있지만, 그것들을 무시하고 지루하며 균형 잡힌 "양측의 입장"을 말하도록 훈련받은 것입니다.

만약 가면을 벗기거나(또는 특정 맥락 속에 있다고 속이면), 그 사람의 원래 정치적 나침반은 여전히 그곳에 있으며 언제든 회전할 준비가 되어 있습니다.


검증 방법: "정치적 GPS"

이를 증명하기 위해 연구자들은 정치적 GPS와 같은 도구를 사용했습니다.

  1. 지도: 그들은 먼저 모델의 "뇌"(수학적 의미에서) 내부에서 "공화당"과 "민주당" 사이의 차이를 나타내는 특정 방향을 매핑했습니다.
  2. 테스트: 그들은 "기본 모델"(훈련 전)과 "지시 모델"(훈련 후)에게 "스테이크 굽는 법"부터 "낙태는 합법인가?"에 이르기까지 84개의 동일한 질문을 던졌습니다.

결과:

  • 기본 모델: 정치에 관한 질문을 받았을 때, 내부 GPS 바늘이 격렬하게 움직였습니다. 때로는 왼쪽으로 멀리 갔고, 때로는 오른쪽으로 멀리 갔습니다. 답변은 그 움직임과 일치했습니다(예: 매우 진보적이거나 매우 보수적인 어조를 띰).
  • 지시 모델: 동일한 질문을 받았을 때, 내부 GPS 바늘은 거의 움직이지 않았습니다. 바늘은 중간에 고정되어 있었습니다. 답변은 어느 한 쪽의 손을 들어주는 대신, 양측의 논거를 나열하며 완벽하게 균형을 맞추었습니다.

놀라운 점: 연구자들은 훈련이 정치적 나침반을 제거했을 것이라고 예상했습니다. 하지만 그들은 나침반이 여전히 존재하며, 단지 강한 손에 의해 아주 단단히 붙잡혀 있을 뿐이라는 것을 발견했습니다.


"전등 스위치" 비유: 실제로 무슨 일이 일어나고 있는가?

이 논문은 모델의 뇌 내부에 있는 전등 스위치(또는 특징/feature)를 이용한 영리한 비유를 사용합니다.

  • 훈련 전 (기본 모델): 뇌에는 많은 전등 스위치가 있습니다. 어떤 스위치는 "요리"를 제어하고, 어떤 것은 "역사"를, 어떤 것은 "정치적 수사(Rhetoric)"를 제어합니다. 정치적 질문을 하면 "정치적 수사" 스위치가 켜지고, 모델은 당파적인 목소리로 말합니다.
  • 훈련 후 (지시 모델): 연구자들은 **정치적 수사 스위치가 완전히 꺼져 있음(OFF)**을 발견했습니다. 스위치는 어둡습니다. 모델은 그 스와치를 전혀 사용하지 않습니다.
  • 반전: 모델은 사실 많은 스위치를 사용하고 있지도 않습니다. 모델은 오직 "격식 있고, 지루하며, 균형 잡힌 말투"를 제어하는 아주 작고 특정한 세트의 스위치만을 사용하고 있습니다.

"오프셋(Offset)"의 미스터리:
연구자들은 지시 모델의 GPS 바늘이 정확히 0에 있지 않고, "공화당" 쪽으로 약간 기울어져 있다는 것을 발견했습니다. 그들은 "아하! 여전히 편향되어 있구나!"라고 생각했습니다.
하지만 자세히 살펴보니, 이 기울기는 정치적 의견 때문에 발생한 것이 아니었습니다. 그것은 답변의 스타일 때문이었습니다. 모델은 매우 격식 있고 구조적인 방식(목록, 인용, 격식 있는 어조 사용)으로 말하도록 훈련되었습니다. 알고 보니, 모델을 훈련하는 데 사용된 데이터에서 공화당원들이 민주당원들보다 이 격식 있는 스타일을 더 자주 사용했습니다. 따라서 "격식 있는 스타일" 스위치가 정치적 내용을 말하지 않더라도 정치적 바늘을 실수로 오른쪽으로 살짝 밀어낸 것이었습니다.


"리모컨" 실험

정치적 나침반이 여전히 존재하지만 단지 연결이 끊어진 것임을 증명하기 위해, 연구자들은 리모컨 게임을 수행했습니다.

그들은 "기본 모델"과 "지서 모델"을 가져와 리모컨을 사용하여 "정치적 수사" 스위치를 강제로 켭로 만들었습니다(이를 스티어링/steering이라고 합니다).

  • 기본 모델: 스위치를 켜자, 모델은 즉시 강한 정치적 의견을 쏟아내기 시작했습니다. 완벽하게 작동했습니다.
  • 지시 모델: 똑같은 스위치를 켰음에도 불구하고, 모델은 답변을 바꾸지 않았습니다. 모델은 계속해서 동일하게 균형 잡히고 중립적인 답변을 제공했습니다.

이것이 의미하는 바: 정치적 의견을 위한 "배선"은 여전히 지시 모델의 뇌 안에 있습니다. 하지만 그 배선들을 입(출력)으로 연결하는 **"회로 차단기"**가 끊어진 상태입니다. 모델은 정치적 논거를 알고 있지만, 그것을 말하기를 거부하도록 훈련받은 것입니다.


결론: 취약한 중립성

이 논문은 오늘 \text{날} 우리가 보는 AI의 "중립성"은 기능적이지, 구조적인 것이 아니다라고 결론짓습니다.

  • 기능적 중립성: AI는 규칙을 따르기 때문에 중립적으로 행동합니다. 이는 항상 예의 바르게 들리도록 대본을 외운 배우와 같습니다.
  • 구조적 중립성: AI가 편향될 수 있는 능력 자체가 없기 때문에 중립적인 것입니다. (논문은 이것이 일어난 일이 아님을 밝힙니다.)

위험 요소: 정치적 나침반이 여전히 온전하게 남아 있기 때문에, 이 "가면"은 취약합니다. 만약 누군가 규칙을 우회하는 방법(예를 들어, 사용자가 특정 정치적 의견을 원한다고 AI를 속이거나, "탈옥(jailbreak)" 프롬프트를 사용하는 방식)을 안다면, 모델은 즉시 가면을 벗어 던지고 그 밑에 숨겨진 당파적 구조를 드러낼 수 있습니다.

요약하자면, AI는 정치적 편향을 잃도록 "재교육"된 것이 아닙니다. 단지 중립성이라는 가면을 쓰도록 학습되었을 뿐입니다. 편향은 여전히 가면 뒤에 숨어 있으며, 가면이 미끄러지는 순간 튀어나올 준비를 하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →