← 최신 논문
💬 NLP

Readable, Faithful, Used: Three Dissociable Properties of Demographic Identity in a Language Model

이 논문은 거대 언어 모델에서 인구통계학적 정체성의 속성이 판독 가능성(readability), 충실한 구조화(faithfully structured), 그리고 인과적 사용(causally used)이라는 세 가지 분리 가능한 현상임을 입증하며, 특정 어텐션 헤드가 설문 조사와 같은 집단 간 차이를 높은 충실도로 인코딩할 수 있더라도 이러한 인코딩이 모델의 실제 응답 생성에 대한 인과적 사용으로 반드시 직결되는 것은 아님을 밝힌다.

원저자: Fathin Difa Robbani

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fathin Difa Robbani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 사회과학 연구에서 인간을 대신하는 대역 역할을 하도록 점점 더 많이 요구받고 있다. 다양한 집단이 정치, 종교 또는 경제에 대해 어떻게 느끼는지 이해하기 위해 수천 명의 실제 사람들을 인터뷰하는 데 몇 달의 시간과 수백만 달러를 쓰는 대신, 연구자들은 단순히 컴퓨터 프로그램에 그러한 반응을 시뮬레이션하도록 요청할 수 있다. 이러한 디지털 대리인들이 젊은 민주당원과 노년의 공화당원 사이의 미묘한 차이, 혹은 힌두교도와 기독교인 사이의 차이를 실제 설문조사처럼 포착할 수 있기를 기대하는 것이다. 그러나 이러한 시뮬레이션이 실패하고 있다는 증거가 점점 더 많이 나타나고 있다. 컴퓨터의 답변은 프롬프트에 붙은 인구통계학적 라벨에 관계없이 너무 균일하고, 너무 동조적이며, 서로 너무 유사한 경향이 있다. 핵심적인 미스터리는 이러한 실패가 모델이 단순히 이 집단들 사이의 차이를 알지 못하기 때문인지, 아니면 차이를 알고 있지만 말할 때 그것을 사용하지 않기로 선택했기 때문인지에 관한 것이다.

이를 해결하기 위해, 한 연구자는 대규모 언어 모델의 "두뇌" 내부를 들여다보고 인구통계학적 정보가 실제로 어디에 존재하는지 조사하기로 했다. 이 조사는 특정 모델인 Mistral-7B에 초점을 맞추었으며 세 가지 별개의 질문을 던졌다. 첫째, 누가 답변하고 있는지에 대한 정보가 모델의 내부 신호로부터 읽힐 수 있는가? 둘째, 그 정보가 컴퓨터의 마음속에 있는 두 집단 사이의 거리가 현실에서의 거리와 일치하는 것처럼, 실제 세계를 반영하는 방식으로 배열되어 있는가? 셋째, 모델이 실제로 답변을 생성할 때 이 내부 지도를 사용하는가? 연구진은 모델이 의견을 형성하기 위해 지도를 반드시 참조해야 하는 것은 아니며, 충실한 내부 지도를 보유하면서도 그것을 전혀 활용하지 않을 수 있다는 점을 인식하고 이 세 가지 질문을 별개의 속성으로 취급했다.

연구진은 먼저 모델의 내부 지형을 매핑하기 시작했다. 그들은 젊은 아시아계 민주당원이나 중년의 힌두교계 공화당원과 같은 169개의 서로 다른 교차적 집단에 대한 프롬프트를 만들고, 처리가 끝나는 시점의 모델의 내부 상태를 조사했다. 그들은 모델의 내부 배열을 이 집단들이 실제로 의견에서 어떻게 다른지에 대한 근거 자료를 제공하는 퓨 리서치 센터(Pew Research Center)의 실제 설문 데이터와 비교했다. 결과는 표준적인 방식인 모델의 생각을 읽는 법—최종 출력 레이어를 살펴보는 것—이 오해의 소지가 있을 정도로 약하다는 것을 보여주었다. 이는 모델이 인구통계학적 차이에 대해 흐릿하고 불분명한 관점을 가지고 있다는 것을 시사했다. 그러나 연구진이 모델의 처리 과정을 구성하는 구체적인 구성 요소들을 더 깊이 들여다보았을 때, 훨씬 더 명확한 그림을 발견했다.

정보는 사라진 것이 아니라, 단지 특정하고 좁은 채널 안에 숨겨져 있었던 것이다. 연구는 모델의 내부 기하학이 모델의 특수 하위 프로세서인 개별 어텐션 헤드(attention heads)에 의해 지배된다는 것을 발견했다. 테스트된 여섯 가지 유형의 인구통계학적 속성 중 다섯 가지에서, 가장 우수한 단일 어텐션 헤드는 모델의 전체 최종 출력 레이어보다 집단 간 차이에 대한 훨씬 더 정확한 지도를 제공했다. 모델의 11번째 레이어에 위치한 특정 어텐션 헤드는 놀라울 정도로 충실한 것으로 나타났다. 이 헤드는 연령, 교육, 소득, 종교, 정당, 정치적 이데올로기라는 여섯 가지 인구통계학적 유형을 모두 담고 있었으며, 이는 이 집단들이 어떻게 다른지에 대한 실제 세계의 구조와 밀접하게 일치했다. 이 단일 구성 요소는 그룹 간의 관계가 이론적 측정 한계치의 약 70%에 달하는 충실도로 배열된 지도를 보유하고 있었다(설문 데이터 자체에 포함된 노이즈를 고려한 후에도 마찬가지였다).

그러나 모델 내부에 충실한 지도를 찾는 것이 모델이 그것을 사용한다는 것을 의미하지는 않았다. 연구진은 이 정확한 내부 배열이 실제로 모델의 답변에 영향을 미치는지 테스트했다. 그들은 프롬프트의 인구통계학적 정체성을 교체하고 모델의 예측된 의견이 어떻게 변화하는지 관찰하는 인과적 실험을 수행했다. 결과는 극명했다. 프롬프트 속 인물의 정체성 전체를 바꾸어도 모델의 예측 답변은 전체 오차의 2% 미만으로 움직였다. 모델은 서로 다른 집단에 대해 약간 다르지만 똑같이 틀린 답변을 내놓았다. 더욱 놀랍게도, 연구진은 가장 충실한 지도를 가진 위치가 답변을 주도하는 위치가 아니라는 것을 발견했다. 내부 상태를 실제로 변화시켰을 때 모델의 예측을 진실 쪽으로 이동시킨 가장 명확한 인과적 경로은, 가장 약한 내부 지도를 가진 인구통계학적 유형에서 발견되었다. 반대로, 가장 충실하게 배열된 유형은 연구진이 개입을 시도했을 때 감지할 수 있는 인과적 효과를 보이지 않았다.

이러한 불일치는 모델이 인구를 시뮬레이션하는 데 실패하는 이유가 단순히 지식의 부족 때문이 아님을 시사한다. 모델은 특히 정치 및 경제적 요인에 관하여 집단들이 어떻게 다른지에 대한 상세하고 정확한 지도를 보유하고 있지만, 인종 및 종교에 대한 이해는 약하고 불안정하다. 그러나 모델은 말할 때 이 지도를 참조하지 않는다. 내부 기하학은 충실하게 배열되어 있지만 인과적으로는 출력부와 단절되어 있다. 연구는 또한 이 내부 지도를 직접 읽는 것(단일한 충실한 어텐션 헤드에 수학적 프로브를 사용하는 것)이 모델이 생성한 답변보다 실제 설문 진실에 21%에서 31% 더 가깝다는 것을 발견했다. 그러나 이 더 우수한 판독법조차도 개별 질문에 대한 의견의 특정 순서를 모델의 결함 있는 답변보다 더 잘 예측할 수는 없었다.

이러한 발견의 함의는 인공지능을 사용하여 인간 사회를 이해하려는 모든 이들에게 매우 중요하다. 연구는 모델이 특정 사람처럼 행동하도록 프롬프트를 작성할 수 있다고 해서 인구 집단을 시뮬레이션할 수 있다고 가정해서는 안 된다는 것을 보여준다. 모델은 지식을 보유하고 있지만, 연구자들이 기대하는 방식으로 그것을 사용하지 않고 있다. 나아가, 이 연구는 인구통계학적 속성이 상호 교환 가능한 것이 아니라고 경고한다. 모델은 정치적 및 경제적 정체성에 대해서는 강한 파악 능력을 갖추고 있지만, 인종 및 종교적 정체성에 대한 이해는 취약하며 질문 방식이 약간만 바뀌어도 무너지기 쉽다. 결론적으로, 모델의 내부 지식과 외부 행동을 동일한 것으로 취급하는 것이 모델이 인구를 시뮬레이션할 수 있는지에 대한 논쟁을 해결되지 않은 상태로 남게 만드는 원인이다. 모델은 지도를 가지고 있지만, 그 경로를 따르고 있지는 않다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →