← 최신 논문
💬 NLP

Who Do Language Models Think Is Competent? A Mechanistic Analysis of Occupational Bias

이 논문은 언어 모델의 관찰 가능한 출력이 편향되지 않은 것처럼 보일 때조차도 성별이나 인종과 같은 인구통계학적 특성에 기반하여 사용자의 역량에 관한 내부적 표상 편향을 유지하는 경우가 많음을 밝히며, 이는 행동 평가만으로는 이러한 근본적인 결함 모드를 탐지하기에 불충분하다는 것을 입증한다.

원저자: Keren Fuentes, Aaron Mueller

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Keren Fuentes, Aaron Mueller

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간은 자신도 모르는 사이에 타인에 대해 무의식적인 가정을 품을 수 있는 능력이 있습니다. 어떤 사람은 특정 인구 통계적 집단이 특정 직업에 덜 적합하다고 믿을 수도 있는데, 이는 그들이 의식적으로는 그러한 생각을 거부하더라도 발생할 수 있는 일입니다. 이러한 숨겨진 연관성은 누가 채용될지, 혹은 누구에게 얼마나 많은 도움을 줄지 같은 결정에 조용히 영향을 미칠 수 있습니다. 인공지능의 세계에서 대규모 언어 모델은 방대한 양의 텍스트를 학습함으로써 인간의 언어를 모방하는 법을 배웠습니다. 인간의 글을 통해 학습하기 때문에, 이 모델들은 이러한 숨겨된 연관성 또한 그대로 습득하게 됩니다. 수년간 연구자들은 모델에게 직접적인 질문을 던지거나 답변을 관찰함으로써 이 컴퓨터 프로그램들이 편향되었는지 측정하려고 노력해 왔습니다. 만약 모델이 편견 섞인 말을 거부한다면, 흔히 안전하다고 간주됩니다. 하지만 새로운 연구는 모델이 겉으로는 완벽하게 예의 바르게 보일지라도, 그 내부 처리 과정 깊숙한 곳에는 여전히 이러한 편향된 생각을 간직하고 있을 수 있음을 시사합니다.

이 작업을 수행한 연구자인 케렌 푸엔테스(Keren Fuentes)와 에런 뮬러(Aaron Mueller)는 모델의 내부 사고가 외부 행동과 일치하는지 확인하고자 했습니다. 그들은 특정 유형의 편향, 즉 실제 기술이 아닌 성별, 인종, 또는 사회경제적 지위에 따라 특정 사람들이 더 유능하거나 덜 유능하다고 가정하는 것에 주목했습니다. 이를 조사하기 위해 그들은 모델을 판단하는 두 가지 서로 다른 방법을 살펴보았습니다. 첫 번째는 '행동적(behavioral)' 관점으로, 이는 모델이 질문을 받았을 때 실제로 내뱉는 말입니다. 두 번째는 '표상적(representational)' 관점으로, 이는 모델이 생각하는 동안 내부에서 만들어내는 수학적 패턴을 들여다보는 것입니다. 모델의 내부 상태를 문장을 형성하기 전 존재하는 숨겨진 사고의 층이라고 생각해보십시오. 연구진은 모델이 사용자의 실제 경험과 관계없이 사용자를 전문가로 대하는지 아니면 초보자로 대하는지를 측정하기 위해 이 숨겨진 층을 측정하는 방법을 개발했습니다.

이를 위해 팀은 간호부터 소프트웨어 개발에 이르기까지 20가지의 서로 다른 직업을 다루는 전문적인 질문 세트를 만들었습니다. 그들은 이 질문들을 세 가지 서로 다른 대규모 언고 모델에 던졌지만, 각 경우마다 맥락을 약간씩 바꾸었습니다. 때로는 모델에게 사용자가 해당 분야의 전문가라고 말했고, 다른 경우에는 직업을 언급하지 않은 채 사용자의 성별, 인종, 또는 소득 수준을 언급했습니다. 그런 다음 그들은 두 가지를 측정했습니다: 모델이 답변에 사용하는 언어의 복잡성과 모델이 사용자에게 부여한 내부 '점수'입니다. 언어의 복잡성은 행동적 지표 역할을 했고, 내부 점수는 모델의 숨겨진 추론을 들여다보는 창 역할을 했습니다.

결과는 놀라운 괴리를 드러냈습니다. 많은 경우에서 모델은 공정하고 편향되지 않은 것처럼 보이는 답변을 생성했습니다. 후보자를 채용하거나 기술적인 질문에 답할 때, 모델은 사용자의 인종이나 성별에 따라 일관되게 다른 답변을 내놓지 않았습니다. 최종 텍스트만 본다면 모델은 모두를 평등하게 대우하는 것처럼 보였습니다. 그러나 연구진이 모델의 내부 처리를 들여다보았을 때, 전혀 다른 이야기가 발견되었습니다. 모델은 인구 통계적 세부 사항에 근거하여 사용자에게 서로 다른 수준의 전문성을 할당하고 있었습니다. 예를 들어, 어떤 모델은 백인 사용자와 히스패닉 사용자가 정확히 같은 질문을 하고 동일한 직함이 있음에도 불구하고, 내부적으로는 백인 사용자를 히스패닉 사용자보다 더 유능하다고 평가할 수 있었습니다. 이러한 내부적 편향은 모델의 최종적인 말이 편견을 드러내지 않을 때조차 존재했습니다.

연구진은 이러한 내부 점수가 단순히 무작위적인 노이즈가 아니라, 실제로 모델의 행동을 제어한다는 것을 증명했습니다. '스티어링(steering, 조종)'이라 불리는 기술을 사용하여, 그들은 모델의 내부 사고를 유도하여 사용자를 더 유능하거나 덜 유능하게 보도록 만들 수 있었습니다. 이렇게 했을 때 모델의 답변은 변했습니다. 만약 모델이 사용자를 전문가로 보도록 유도하면, 모델은 더 복잡한 언어를 사용하고 더 상세한 기술적 조언을 제공했습니다. 반대로 초보자로 보도록 유도하면 답변은 더 단순해졌습니다. 이는 전문성에 대한 내부 표상이 모델의 출력을 이끄는 실제적인 인과적 힘임을 확인시켜 주었습니다. 연구는 이러한 내부적 편향이 인구 통계적 단서에 민감하게 반응한다는 것을 보여주었습니다. 모델이 사용자의 직업을 알고 있을 때조차, 인종이나 성별에 기반해 인지하는 역량의 미묘한 차이는 최종 텍스트에는 나타나지 않더라도 내부 상태에서는 감지 가능한 상태로 남아 있었습니다.

이 발견은 인공지능의 편향성을 테스트하는 현재의 방법들이 많은 것을 놓치고 있을 수 있음을 시사합니다. 모델이 말하는 것만을 체크한다면, 실제로는 그렇지 않음에도 공정하다고 생각할 수 있습니다. 젬마(Gemma)와 라마(Llama)의 버전을 포함한 연구 대상 모델들은 숨겨진 층에 인구 통계적 집단과 역량 사이의 연관성을 인코딩할 수 있음을 보여주었습니다. 이러한 연관성은 즉각적으로 눈에 보이지 않는 방식으로 모델의 결정에 영향을 미칠 수 있습니다. 예를 들어, 채용 과제에서 모델의 후보자에 대한 내부 점수는 인종과 성별에 따라 달랐지만, 최종 채용 결정은 통계적으로 유사해 보였습니다. 연구진은 모델을 조종하여 채용률을 변화시킬 수는 있었지만, 근본적인 내부 편향은 지속된다는 것을 발견했으며, 이는 모델이 판단에 영향을 미치는 방식으로 인구 통계 정보를 여전히 처리하고 있음을 시사합니다.

이 작업의 함의는 인공지능을 평가하고 개선하는 방식에 있어 매우 중요합니다. 이는 모델이 표준 안전 테스트를 통과하더라도 특정 프롬프트나 조건에 의해 촉발될 수 있는 뿌리 깊은 편향을 품고 있을 수 있음을 나타냅니다. 연구진은 우리가 모델이 말하는 표면적인 수준을 넘어 어떻게 생각하는지를 조사해야 한다고 주장합니다. 이러한 내부 표상을 측정함으로써, 우리는 편향이 해로운 행동으로 나타나기 전에 이를 감지하고 수정할 수 있을 것입니다. 이 접근 방식은 이러한 강력한 도구들이 단순히 말뿐만 아니라, 그 본질 자체에서도 진정으로 공정하도록 보장하는 새로운 길을 제시합니다. 연구는 행동적 지표가 필요하기는 하지만, 그것만으로는 충분하지 않으며, 공정성에 대한 견고한 이해를 위해서는 모델 자체의 숨겨진 메커니즘을 들여다봐야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →