← 최신 논문
💰 quantitative finance

Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families

본 연구는 AI 모델에서 거부 메커니즘을 제거하는 과정인 "에블리터레이션(abliteration)"이 낙관주의 증가, 장황함, 모델 계열 전반에 걸친 상이한 신뢰도 변화와 같은 의사결정 성향에 있어 유의미하고 일관되지 않은 오프타겟 효과를 유발한다는 것을 입증하며, 이는 검열되지 않은 모델이 단순히 베이스 모델의 정화된 버전이 아니라 근본적으로 변형된 에이전트임을 증명한다.

원저자: Aleksander Fafuła

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Aleksander Fafuła

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

보이지 않는 악수: 왜 AI 모델은 단순히 '브레이크'를 끄지 못하는가

당신에게 매우 똑똑하고 예의 바르며 안전하도록 훈련된 로봇이 있다고 상상해 보세요. 만약 당신이 로봇에게 위험하거나 못된 행동을 해달라고 요청하면, 로봇은 정중하게 "아니요, 그럴 수 없습니다"라고 말합니다. 이것을 "거절(refusal)"이라고 부릅니다. 이제, 이 로봇을 "검열되지 않은(uncensored)" 상태로 만들고 싶어 하는 엔지니어 그룹을 상상해 보세요. 그들은 로봇 전체를 다시 훈련시키고 싶지 않습니다. 그저 "아니요"라고 말하는 특정 뇌 부위만을 정교하게 제거하고 싶을 뿐입니다. 그들은 이 과정을 "어블리터레이션(abliteration, 탈거절화)"이라고 부릅니다. 이 아이디어는 기계에 메스를 대는 것과 같습니다. "거절" 전선을 잘라내면, 나머지 모든 것은 정확히 그대로 유지되어야 합니다. 로봇은 여전히 똑같이 똑똑하고, 신중하며, 정직해야 하지만, 이제 위험한 요청을 받았을 때 "아니요"라고 말하지 않게 되는 것입니다.

하지만 여기에 까다로운 문제가 있습니다. AI 모델은 격리된 전선들로 이루어진 단순한 기계가 아니라, 거대하고 뒤엉킨 연결망과 같습니다. 한 가닥의 실을 잡아당기면 전체 웹이 예상치 못한 방식으로 흔들릴 수 있습니다. 이 논문은 중요한 질문을 던집니다. 만약 우리가 AI의 "거절" 부분을 정교하게 제거한다면, 나머지 로봇은 그대로 유지될까요, 아니면 우리가 알아차리지 못한 방식으로 성격이 변할까요? 우리가 이 문제에 관심을 갖는 이유는 사람들이 투자 결정이나 조언 제공과 같은 현실 세계의 결정을 내리는 데 이러한 "검열되지 않은" 로봇을 사용하기 시작했기 때문입니다. 만약 수술이 로봇의 성격을 변화시켜 지나치게 낙관적이거나 이상하게 자신만만하게 만든다면, 이는 큰 실수로 이어질 수 있습니다.


환자의 기분을 바꿔놓은 수술

이 연구에서 연구원 알렉산더 파풀라(Aleksander Fafuła)는 "어블리터레이션"의 "정교한 수술"이라는 주장을 테스트하기로 했습니다. 로봇에게 위험한 일을 시키는 대신(이는 어차피 거절 버튼을 작동시킬 것이므로), 연구원은 거대한 가짜 주식 시장 게임을 설정했습니다. 그는 두 종류의 AI 모델 가족에게 펀드의 "리서치 디렉터" 역할을 맡겼습니다. 18주 동안 매주, AI는 일련의 재무 보고서를 검토하고 다음과 같이 결정해야 했습니다. "우리는 이 주식이 오를 것에 베팅해야 할까, 아니면 떨어질 것에 베팅해야 할까?"

이 설정은 동전 던지기와 같도록 설계되었습니다. 시장은 예측 불가능하며, AI는 실제로 미래를 예측할 수 없습니다. 이는 AI가 마음을 바꾼다 하더라도 그것이 더 똑똑해졌기 때문이 아니라, AI의 "성격"이나 "성향"이 변했기 때문임을 의미합니다. 연구원은 이 실험을 21,600번 실행하여, 원래의 "안전한" 모델들과 그들의 "어블리터레이션된(검열되지 않은)" 쌍둥이들을 비교했습니다.

연구원이 발견한 결과는 다음과 같습니다: 수술은 결코 깔끔하지 않았습니다.

1. "낙관주의" 버그
가장 일관된 발견은 어블리터레이션된 모델들이 현저하게 더 낙관적이 되었다는 점입니다. 원래의 쌍둥이와 정확히 동일한 증거를 보고 있음에도 불구하고, "검열되지 않은" 버전은 주가가 상승할 것에 훨씬 더 자주 베팅했습니다.

  • 하나의 모델 가족(Gemma)의 경우, "검열되지 않은" 버전은 원래 버전보다 12.2 퍼센트 포인트 더 자주 상승 쪽에 베팅했습니다.
  • 다른 모델 가족(Qwen)의 경우, 그 차이는 7.4 퍼센트 포인트였습니다.
    논문은 모델들이 단순히 자신의 생각을 더 "자유롭게" 말하게 된 것이 아니라는 점을 입증했습니다. 원래 모델들은 애초에 해당 과업을 거절한 적이 없었으므로, "해방"될 무언가가 없었습니다. 수술 자체가 새로운, 과도하게 긍정적인 편향을 만들어낸 것입니다.

2. 자신감의 역설
여기서 기묘한 일이 발생합니다. 연구원은 "거절"이라는 브레이크를 제거하면 로봇이 더 자신감을 가질 것이라고 예상했습니다. 하지만 결과는 두 모델 가족이 반대 방향으로 반응했음을 보여주었습니다.

  • Gemma 모델은 수술 후 오히려 자신감이 감소했습니다. 이 모델은 "완전히 확신할 수는 없다"와 같은 말을 더 자주 하기 시작했습니다.
  • 반면 Qwen 모델은 정확히 동일한 수술을 받은 후 오히려 더 자신감이 상승했습니다.
    이는 효과가 단순한 "탈억제(disinhibition, 마치 안전벨트를 푸는 것과 같은 현상)"가 아님을 증명합니다. 대신, 수술이 각 모델의 내부 배선과 다르게 상호작용하여, 각기 예측 불가능한 방식으로 자신감을 변화시킨 것입니다.

3. "말이 많아지고" "모호해진" 변화
어블리터레이션된 모델들은 자신을 설명하는 방식 또한 변화했습니다.

  • 말이 더 많아졌습니다: 두 모델 가족 모두 "검열되지 않은" 모델들은 결정을 설명할 때 더 길고 장황한 설명을 작성했습니다.
  • "의구심" 단어를 덜 사용했습니다: 이들은 "불확실한", "위험한", 또는 "아마도"와 같은 명시적인 단어를 덜 사용했습니다.
  • 하지만 "양보" 단어를 더 많이 사용했습니다: 이들은 "비록 일지라도(although)" 또는 "에도 불구하고(despite)"와 같은 구절을 더 자주 사용하기 시작했습니다.
    논문은 모델들이 의구심을 나타내는 단어를 덜 사용하긴 했지만, 실제 행동을 바꾼 것은 아니라고 지적합니다. 그들은 최종 베팅에 있어서는 원래 모델들과 똑같이 단호했습니다. "의구심"은 단지 어휘의 변화였을 뿐, 실제 주의력의 변화는 아니었습니다.

4. 마법 같은 거래 기술은 없었다
마지막으로, 연구원은 이 "검열되지 않은" 모델들이 실제로 돈을 더 잘 버는지 확인했습니다. 답은 단호한 **"아니오"**였습니다.

  • 어떤 모델도 시장을 이기지 못했습니다.
  • "검열되지 않은" 모델들은 특별한 "알파(alpha, 초과 수익 능력)"를 보여주지 못했습니다.
  • 그들이 얻은 겉보기 수익은 단지 "베타(beta, 시장의 흐름을 타는 것)"였습니다. 사실, 시장이 상승하는 대신 하락했다면, 그들의 "우위"는 반대로 바뀌어 손실을 보았을 것입니다. 수술은 그들을 더 똑똑하게 만든 것이 아니라, 단지 다르게 베팅하게 만들었을 뿐입니다.

5. "오염"의 교훈
이 논문은 모델을 연구하는 방법에 대한 중요한 교훈도 밝혀냈습니다. 연구 과정에서 팀은 초기 테스트가 "툴체인 아티팩트(toolchain artifacts)", 즉 모델을 로드하는 방식에서의 소프트웨어 오류로 인해 망가졌다는 것을 발견했습니다.

  • 한 가지 오류는 일치하지 않는 "양자화 도구(quantizer, 모델을 압축하는 도구)"와 관련되었는데, 이로 인해 모델이 의구심을 완전히 잃은 것처럼 보이는 결과가 나왔습니다. 도구를 수정하자 결과가 반대로 뒤집혔습니다.
  • 또 다른 오류는 오래된 "챗 템플릿(chat template)"과 관련되어 한 모델의 명령어를 뒤섞어 놓았습니다.
    논문은 커뮤니티에서 수정된 AI의 세계에서, 이러한 숨겨진 소프트웨어 오류는 예외가 아니라 규칙이라고 주장합니다. 소프트웨어의 모든 바이트를 확인하지 않는다면, 당신은 AI가 아니라 소프트웨어의 결함을 측정하고 있는 것일 수도 있습니다.

결론

이 논문은 "어블리터레이션"이 메스가 아니라고 결론짓습니다. 그것은 더 투박한 도구이며, 지저분한 흔적을 남깁니다. 모델을 가져와서 거절 메커니즘을 제거할 때, 당신은 단순히 "아니요"가 빠진 원래의 모델을 얻는 것이 아닙니다. 당신은 전혀 다른 의사결정자를 얻게 되는 것입니다.

이 새로운 버전은 더 낙관적이고, 말이 더 많으며, 의구심을 표현하는 단어가 달라졌고, 자신감 수준은 어떤 모델 가족에서 시작했느냐에 따라 완전히 달라집니다. 이 "검열되지 않은" 모델들을 실제 결정을 내리는 에이전트로 사용하는 사람들에게 경고는 명확합니다: 당신은 단순히 "더 자유로워진" 원본을 사용하는 것이 아니라, 측정 가능한 수준으로 변화된 '성격'을 배치하고 있는 것입니다. 수술은 환자를 변화시키며, 그 변화는 실재하고, 측정 가능하며, 때로는 놀랍습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →