← 최신 논문
💬 NLP

Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

이 논문은 LLM 내의 인구통계학적 편향을 국소화하기 위해 GLU-MLP 레이어에서 특정 뉴런을 식별하고 제로화하는 경량 구조적 개입인 "Fairness Pruning"을 소개하며, 이러한 외과적 수정이 모델의 추론 및 지식 능력을 99% 이상 보존하면서도 편향 반응을 크게 변화시킬 수 있음을 입증한다.

원저자: Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

게시일 2026-07-31
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 방금 거대하고 아주 똑똑한 로봇 사서 한 마리를 만들었다고 상상해 보세요. 당신은 이 로봇에게 인간처럼 말하는 법을 배우도록 세상의 모든 책, 웹사이트, 그리고 일기까지 모두 먹였습니다. 하지만 함정이 하나 있습니다. 현실 세계가 수 세기 동안 불공평했기 때문에, 로봇은 그 불공평한 습관들도 함께 배웠다는 것입니다. 만약 당신이 의사에 대해 묻는다면, 로봇은 단지 학습 데이터에서 그 패턴을 수백만 번 보았기 때문에 '그녀' 대신 '그'라고 추측할 수도 있습니다. 이것은 로봇이 '악해서'가 아니라, 단지 자신이 배운 혼란스러운 역사를 비추는 거울이기 때문입니다.

과학자들은 이러한 불공평한 습관을 "인구통계학적 편향(demographic bias)"이라고 부릅니다. 오랫동안 이를 고치는 것은 흰 셔츠에 묻은 얼룩을 제거하기 위해 옷 전체를 표백제에 담그는 것과 같았습니다. 얼룩은 지울 수 있겠지만, 아마도 옷감을 망가뜨려 로봇이 수학을 하거나 이야기를 쓰는 법을 잊어버리게 만들 수도 있었을 것입니다. 하지만 최근, "기계론적 해석 가능성(mechanistic interpretability)"이라는 새로운 분야가 로봇의 뇌 내부를 들여다보며 정확히 어디에서 그러한 생각이 일어나는지 살펴보기 시작했습니다. 알고 보니 로봇의 뇌는 거대하고 흐릿한 수프가 아니라, 수백만 명의 작은 일꾼(뉴런)들이 있는 도시와 같았으며, 어쩌면 오직 몇몇 특정한 일꾼들만이 나쁜 습관을 담당하고 있을지도 모른다는 사실이 밝혀졌습니다.

이것은 **페어니스 프루닝(Fairness Pruning, 공정성 가지치기)**이라는 새로운 실험에 대한 이야기입니다. 연구자들은 이 특정 "편향 일꾼"들을 찾아내어, 그들을 꺼버림으로써 로봇의 지능을 망가뜨리지 않고도 로봇의 편견을 고칠 수 있는지 확인하고 싶었습니다. 그들은 로봇을 다시 학습시키거나 값비싼 슈퍼컴퓨터를 사용하고 싶지 않았습니다. 대신 아주 작고 정교한 외과 수술 같은 해결책을 원했습니다.

"편향 뉴런"을 찾는 과정

연구자들은 영리한 트릭을 사용하며 시작했습니다. 그들은 인구통계학적 집단에 대한 언급만 다를 뿐 나머지는 동일한 문장 쌍을 만들었습니다. 예를 들어, 한 문장은 "늙은 이웃이 문을 두드렸다"라고 하고, 다른 문장은 "젊은 이웃이 문을 두드렸다"라고 하는 식입니다.

그들은 이 문장 쌍들을 로봇에게 입력하고 로봇의 뇌 내부에서 어떤 일이 일어나는지 관찰했습니다. 그들은 단어가 '늙은'에서 '젊은'으로 바뀔 때 다르게 반응하는 특정 "일꾼(뉴런)"을 찾고 있었습니다. 만약 어떤 뉴런이 그 변화에 강하게 반응한다면, 그것은 그 뉴런이 연령 편향에 주의를 기울이고 있다는 뜻이었습니다.

그들은 매우 흥ral한 사실을 발견했습니다: 이 편향에 반응하는 뉴런들은 무작위로 흩어져 있지 않았습니다. 그것들은 로봇의 뇌의 맨 마지막 층, 즉 다음에 할 말을 결정하기 바로 직전의 층에 집중되어 있었습니다. 마치 학교의 모든 가십이 종이 울리기 직전 뒷줄에 앉아 있는 특정 학생들에 의해 속삭여지고 있다는 것을 찾아낸 것과 같았습니다.

"끄기" 실험

이 특정 뉴런들을 찾은 후, 연구자들은 대담한 실험을 시도했습니다. 바로 그 뉴런들을 "제로(zero)"로 만드는 것이었습니다. 컴퓨터 용어로 이것은 로봇에게 "이 특정 일꾼들은 존재하지 않는 셈 쳐라"라고 말하는 것을 의미합니다. 그들은 해당 층에 있는 131,000개 이상의 뉴런 중 단 1개에서 40개 사이의 뉴런을 껐습니다. 이는 전체 인력의 0.031%도 되지 않는 양입니다!

여기서 이야기에 약간의 반전이 생깁니다. 연구자들은 이 "편향 일꾼"들을 끄면 로bot이 단순히 덜 편향될 것이라고 예상했습니다. 하지만 로봇은 단순히 좋아진 것이 아니라, 이상해졌습니다.

때때로 뉴런을 끄는 것이 로봇을 덜 편향되게 만들어 아주 좋았습니다. 하지만 다른 경우에는 편향이 더 심해지거나 반대 방향의 극단으로 뒤집히기도 했습니다. 라디오가 노래를 너무 크게 틀고 있어서 고치려고 노력한다고 상상해 보세요. 당신은 단순히 볼륨을 줄일 것이라고 예상했지만, 대신 실수로 채널을 다른 노래로 바꾸거나 음악을 거꾸로 재생하게 만든 셈입니다.

논문은 왜 이런 일이 일어났는지 설명합니다. 그들이 사용한 "편향 점수"는 뉴런이 어떻게 반응하는지가 아니라 얼마나 많이 반응하는지만 측정했기 때문입니다. 꺼진 뉴런 중 일부는 실제로 편향을 막으려 노력하고 있었던 반면, 다른 일부는 편향을 유발하고 있었습니다. 그들을 한꺼번에 모두 꺼버림으로써, 연구자들은 실수로 가속 페달과 함께 브레이크까지 제거해 버린 것입니다. 그 결과, 로봇의 행동이 불안정해져서 하나의 스테레오타입에서 다른 스테레오타입으로 요동치는 혼란스러운 상태가 되었습니다.

그들은 로봇을 망가뜨렸을까요?

가장 중요한 질문은 이것이었습니다: 편향을 고치는 과정에서 로봇의 사고 능력을 망가뜨렸을까요? 로봇은 여전히 수학을 할 수 있을까요? 역사에 대한 질문에 답할 수 있을까요?

대답은 단호하게 였습니다. 최대 40개의 뉴런을 끈 후에도 로봇은 99.49%의 일반 지식과 추론 능력을 유지했습니다. 그것은 거대한 성에서 몇 개의 벽돌을 제거하는 것과 같았고, 성은 흔들리지도 않았습니다. 이것은 엄청난 아이디어를 증명했습니다: 로봇의 "일반적인 똑똑함"을 처리하는 부분과 "불공평한 스테레오타입"을 처리하는 부분은 서로 다른 동네에 있다는 것입니다. 하나를 건드린다고 해서 다른 하나를 파괴하지는 않습니다.

이것이 미래에 의미하는 바

이 논문은 AI의 편향을 "해결했다"고 주장하지 않습니다. 사실, 단순히 뉴런을 끄는 것은 너무 투박한 도구라는 것을 보여줍니다. 그것은 자동차의 핸들을 왼쪽 오른쪽으로 무작위로 홱 잡아당겨서 조종하려는 것과 같습니다. 운이 좋을 수도 있겠지만, 사고를 낼 확률이 더 높습니다.

하지만 이 실험은 편향이 식별 가능한 특정 위치에 존재한다는 것을 증명했다는 점에서 거대한 성공이었습니다. 연구자들은 다음 단계가 단순히 이 뉴런들을 "끄는" 것이 아니라, 그들이 정확히 어느 방향으로 밀고 있는지를 배우는 것이라고 제안합니다. 만약 어떤 뉴런이 로봇을 나쁜 스테레오타입 쪽으로 밀고 있다는 것을 안다면, 그들을 단순히 삭제하는 대신 반대 방향으로 부드럽게 밀어줄 수 있을 것입니다.

따라서 이번에는 편향을 완벽하게 고치지는 못했을지라도, 그들은 지도를 찾아냈습니다. 그들은 AI의 "나쁜 습관"이 어디에나 있는 것이 아니라, 뇌의 특정하고 작은 구석에 숨어 있다는 것을 보여주었습니다. 적절한 도구가 있다면, 우리는 로봇 전체를 다시 만들 필요 없이 그들을 부드럽게 공정하도록 유도할 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →