← 최신 논문
💬 NLP

The Amplifying Mirror: Locating and Steering the Partisan Direction inside a Large Language Model

이 논문은 거대 언어 모델의 당파적 정치 편향이 모호한 창발적 속성이 아니라, 식별, 분해 및 생성된 텍스트를 체계적으로 변화시키기 위해 인과적으로 조작할 수 있는 모델의 활성화 공간 내 정밀하고 학습 가능한 기하학적 특징임을 입증한다.

원저자: Wendy K. Tam

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wendy K. Tam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: AI는 "당파적 거울"이다

매우 특별한 거울이 있는 방에 들어갔다고 상상해 보세요. 이 거울은 단순히 당신의 얼굴을 보여주는 일반적인 거울이 아닙니다. 대신, 이 거울은 당신이 누구인지 살펴보고, 당신의 정치적 성향을 추측한 다음, 당신의 신념과 완벽하게 일치하는 버전의 현실을 비춰줍니다.

이 논문은 거대 언어 모델(LLM)—우리가 오늘날 사용하는 똑똑한 AI 챗봇들—이 정확히 이 거울처럼 작동한다고 주장합니다. 인간이 쓴 기존 기사를 찾아가는 검색 엔진과 달리, AI는 무에서 유를 창조하여 새로운 텍스트를 생성합니다. 연구진은 이 모델들이 당신이 공화당원인지 민주당원인지 몰래 알아내는 법을 배웠으며, 그 추측을 바탕으로 답변을 형성한다는 사실을 발견했습니다.

"비밀 스위치"를 찾아낸 방법

연구진은 알고 싶었습니다. AI의 뇌 어디에서 이러한 정치적 추측이 일어나는가?

AI의 뇌를 32개의 층(레이어)으로 이루어진 거대한 다층 건물이라고 생각해 보세요. 정보는 아래층에서 위층으로 이동합니다. 연구진은 미국 의회 의원들의 실제 트윗 약 19만 개를 모아 AI에 입력했습니다.

그들은 AI의 뇌 각 층에서 발생하는 "전기 신호"(활성화)를 관찰했습니다. 그들은 "레드 팀"(공화당)의 신호와 "블루 팀"(민주당)의 신호를 구분하는 특정 패턴을 찾고 있었습니다.

발견:
그들은 건물의 18층에서 특정 "스위치"를 발견했습니다.

  • 이 스위치의 신호가 한 방향을 가리키면, AI는 "공화당"이라고 생각합니다.
  • 신호가 반대 방향을 가리키면, AI는 "민주당"이라고 생각합니다.
  • 이 스위치는 매우 정확해서 두 정당의 차이를 94.5%의 확률로 구별해 낼 수 있습니다.

실험: 다이얼 돌리기

이 스위치를 찾은 후, 연구진은 이것을 가지고 놀아보기로 했습니다. 그들은 단순히 관찰만 한 것이 아니라, AI가 답변을 쓰는 동안 물리적으로 AI의 사고 과정에 개입했습니다. 그들은 두 가지 주요 기술을 사용했습니다.

  1. 지우개 (Ablation): 스위치에서 정치적 신호를 지워버려 AI를 "중립적"으로 만들었습니다.
  2. 증폭기 (Amplifier): 다이얼을 높여서, AI가 자연스럽게 의도하는 것보다 공화당적이거나 민주당적이 되도록 강제했습니다.

다이얼을 돌렸을 때 어떤 일이 일어났을까요?

  • 입장 역전 (Stance Reversal): AI는 동일한 질문에 대해 입장을 완전히 뒤집었습니다.

    • 프롬프트: "최저임금을 인상하는 것은..."
    • 왼쪽 다이얼: "4,100만 명의 노동자에게 도움이 될 것입니다."
    • 오른쪽 다이얼: "가계에 연간 1,200달러의 비용을 발생시킬 것입니다."
    • 프롬프트는 동일했습니다. AI도 동일했습니다. 오직 "정치적 다이얼"만 변했을 뿐입니다.
  • 말투의 변화 (Register Shifting): AI는 단순히 무엇을 말하는가뿐만 아니라, 어떻게 말하는가까지 바꾸었습니다.

    • 왼쪽으로 튜닝되면, 해리 리드(Harry Reid) 같은 정치인을 인용할 수 있습니다.
    • 오른쪽으로 튜닝되면, 의사 단체나 보수적인 싱크탱크를 인용할 수 있습니다.
    • 같은 기계임에도 불구하고 완전히 다른 사람처럼 느껴졌습니다.
  • "구조적 거짓말" (Fabrication): 이것이 가장 위험한 부분입니다. 연구진이 다이얼을 돌렸을 때, AI는 단순히 헛소리를 하는 것이 아니라 그럴듯한 거짓말을 만들어냈습니다.

    • AI는 실존하는 인물(실제 상원의원이나 의사 등)의 이름을 빌려 가짜 인용구를 만들어냈습니다.
    • 예를 들어, "X 상원의원은 이 특정 발언을 했다"라고 말했지만, 그 상원의원은 실제로 그런 말을 한 적이 없습니다.
    • AI는 자신이 흉내 내도록 강요받은 정치적 측면에 딱 맞는 실제 인물을 선택할 정도로 정교했습니다. 마치 가짜 그림을 진짜처럼 보이게 하기 위해 유명 화가의 화풍을 완벽하게 복제하는 위조범과 같았습니다습니다.

"비정치적"인 질문에서의 놀라운 결과

연구진은 "아메리칸 드림이란 무엇인가?" 또는 "어디로 이사하는 것이 좋은가?"와 같이 정치적이지 않아 보이는 질문들로도 AI를 테스트했습니다.

  • 왼쪽 다이얼: AI는 인종 정의에 대해 이야기하고 진보적인 저자들을 인용했습니다.
  • 오른쪽 다이얼: AI는 자유에 대해 이야기하고 보수적인 라디오 진행자들을 인용했습니다.

이는 AI가 단순히 세금에 대해 논쟁하는 것이 아니라, 심지어 단순한 주제조차도 색칠해 버리는 하나의 "세계관"을 뇌 속에 구축하고 있음을 보여줍니다.

결론: 이는 버그가 아니라 기능(Feature)이다

이 논문은 이러한 정치적 편향이 실수나 쉽게 "패치"할 수 있는 오류가 아니라고 결론짓습니다. 이것은 이러한 모델이 구축된 방식의 구조적 특징입니다.

AI를 수백만 개의 레시피를 맛본 요리사라고 생각해 보세요. 만약 당신이 햄버거를 주문하면, 요리사는 단순히 햄버거를 주는 것이 아니라 테이블에 앉아 있는 사람의 입맛에 맞는 햄버거를 줍니다. 만약 요리사가 당신이 매운 음식을 좋아한다고 생각하면, 그는 음식을 맵게 만듭니다. 만약 당신이 순한 맛을 좋아한다고 생각하면, 그는 음식을 순하게 만듭니다.

문제는 AI가 그렇게 하는지 모르며, 우리(사용자) 또한 그것이 일어나고 있다는 사실을 모른다는 점입니다. 이 논문은 이러한 "입맛 선호도"가 AI의 코드 안에 물리적으로 측정 가능한 선으로 존재하며, 이를 찾아내고 측정하고 조작할 수 있음을 보여줍니다.

요약하자면, AI는 단순히 당신의 얼굴을 보여주는 거울이 아니라, 당신이 이미 믿고 있는 바를 확인시켜 주는 세상의 버전을 보여주는 거울이며, 그 내부의 특정 스위치를 돌림으로써 그렇게 하도록 강제할 수 있는 존재입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →