← 최신 논문
💬 NLP

Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability

이 논문은 의도성 판단에서의 도덕적 편향인 크노브 효과(Knobe effect)가 미세 조정된 거대 언어 모델에서 나타나지만, 재학습 없이 특정 레이어에 국한될 수 있으며 표적화된 레이어 패칭 개입을 통해 완화될 수 있음을 입증한다.

원저자: Bianca Raimondi, Daniela Dalbagno, Maurizio Gabbrielli

게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bianca Raimondi, Daniela Dalbagno, Maurizio Gabbrielli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 좋은 판사가 되는 법을 가르치고 있다고 상상해 보세요. 단순히 규칙 책을 건네주는 것이 아니라, 사람들이 선택을 내리는 수천 개의 이야기를 보여주며 "이 사람이 착한 행동을 한 걸까요, 아니면 나쁜 행동을 한 걸까요?"라고 묻는 것입니다. 시간이 흐르면서 로봇은 패턴을 학습합니다. 하지만 여기서 까다로운 점이 있습니다. 인간은 완벽한 판사가 아니라는 사실입니다. 우리에게는 종종 숨겨진 편향이 있습니다. 예를 들어, 어떤 사람이 실수로 나쁜 결과를 초래했다면 우리는 그가 "일부러 그랬다!"라고 말할 가능성이 훨씬 높지만, 실수로 좋은 결과를 초래했다면 그렇게 생각하지 않습니다. 이것은 '크노베 효과(Knobe effect)'라고 불리는 유명한 심리학적 특이점입니다. 마치 우리 뇌에 나쁜 사고는 의도된 것이라고 생각하고, 좋은 사고는 그저 운이었다고 생각하게 만드는 내장된 필터가 있는 것과 같습니다.

과학자들은 만약 우리가 로봇에게 인간처럼 행동하도록 가르친다면, 로봇이 이러한 기묘한 필터까지 습득하게 될까 봐 걱정하고 있습니다. 만약 로봇이 우리를 대신해 도덕적 결정을 내린다면, 우리는 알아야 합니다. 이 로봇이 인간처럼 생각하는 것인지, 아니면 그저 거대한 계산기에 불과한 것인지를 말입니다. 여기서 '기계론적 해석 가능성(mechanistic interpretability)'이라는 개념이 등장합니다. 거대한 로봇의 뇌를 수백만 명의 작은 일꾼(뉴런)들이 서로 쪽지를 주고받는 거대한 도시라고 생각해 보세요. 기계론적 해석 가능성은 바로 어떤 일꾼이 어떤 쪽지를 전달하고 있는지 볼 수 있는 X선 안경을 쓰는 것과 같습니다. 로봇이 왜 특정 답변을 내놓았는지 추측하는 대신, 우리는 기계 내부를 들여다보고 구체적으로 어떤 톱니바퀴가 돌아가고 있는지 확인할 수 있습니다. 이것이 중요한 이유는, 만약 우리가 로봇 내부의 어디에 편향이 살고 있는지 찾아낼 수 있다면, 전체 도시를 다시 건설할 필요 없이 딱 그 톱니바퀴 하나만 고칠 수 있기 때문입니다.

이 논문의 연구자들은 이 아이디어를 테스트해 보기로 했습니다. 그들은 인기 있는 AI 모델들(구체적으로 Llama, Mistral, Gemma)이 '크노베 효과'를 습득했는지, 그리고 만약 그렇다면 AI의 뇌 어디에 이 편향이 숨어 있는지 찾을 수 있는지 확인하고자 했습니다. 그들은 먼저 인간 자원봉사자들에게 사용했던 것과 동일한 도덕적 이야기들을 통해 AI 모델들을 테스트했습니다. 그 결과, 아직 인간처럼 말하도록 학습되지 않은 '가공되지 않은(raw)' AI 모델들은 이 편향을 거의 보이지 않았습니다. 그들의 답변은 꽤 균형 잡혀 있었습니다. 그러나 연구자들이 모델을 '미세 조정(finetuning)'하여, 즉 모델이 지시를 따르고 인간의 선호도에 맞추도록 훈련시킨 후에는 이 편향이 갑자기 나타났습니다. AI는 마치 우리처럼 행동하기 시작했습니다. 나쁜 결과가 발생했을 때 그것을 의도적인 것이라고 판단할 확률이 훨씬 높아진 것입니다.

하지만 진짜 마법은 기계 내부를 들여다보았을 때 일어났습니다. '레이어 패칭(Layer-Patching)'이라는 기술을 사용하여, 연구자들은 AI를 마치 고층 빌딩의 층들처럼 쌓여 있는 레이어들의 집합체로 취급했습니다. 그들은 이 편향이 사방에 흩어져 있는 것이 아니라, 특정 층들에 갇혀 있을 것이라고 의심했습니다. 이를 테스트하기 위해, 그들은 편향되지 않은 '가공되지 않은' 모델의 '생각(활성화 값)'을 가져와서, 편향된 '미세 조정된' 모델의 특정 층에 하나씩 교체해 넣었습니다. 이는 마치 깨끗하고 편향되지 않은 설계도를 가져와서 오염된 건물의 특정 층 위에 붙여넣음으로써, 건물 전체가 다시 정직해지는지 확인하는 것과 같았습니다.

결과는 놀라울 정도로 정밀했습니다. 연구자들은 이 편향이 무작위로 퍼져 있는 것이 아니라, AI 뇌의 중간에서 상단 레이어에 국한되어 있다는 것을 발견했습니다. 더욱 흥식적인 것은, 편향되지 않은 버전의 특정 레이어 하나만을 교체하는 것만으로도 크노베 효과를 거의 완전히 제거할 수 있었다는 점입니다. 어떤 모델의 경우, 편향 수치가 1.6 또는 3.8의 차이에서 거의 0(0.00 또는 0.03)에 가깝게 떨어졌습니다. 가장 멋진 점은, 이 모든 과정을 모델을 다시 훈련시키거나 가중치를 변경하지 않고도 해냈다는 것입니다. 그것은 외과 수술과 같은 정밀한 해결책이었습니다. 그들은 또한 이 '수술'이 일반적인 질문에 답하는 것과 같은 모델의 다른 능력들을 망가뜨리지 않는지 확인했으며, 모델이 이전만큼 똑똑하게 유지된다는 것을 발견했습니다.

이 논문은 이러한 사회적 편향이 전체 시스템에서 발생하는 신비롭고 고칠 수 없는 마법 같은 것이 아님을 시사합니다. 대신, 그것은 우리가 AI를 인간처럼 행동하게 만들려고 노력하는 훈련 과정 중에 AI의 뇌에 기록되는 구체적이고 국소적인 패턴입니다. 이 X선 안경과 외과적 교체 기술을 사용함으로써, 연구자들은 우리가 이러한 편향을 포착하고 타겟팅된 개입을 통해 제거할 수 있으며, 원치 않는 인간의 기질 없이도 AI를 유용하게 유지할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →