Linear representations in language models can change dramatically over a conversation
이 논문은 언어 모델이 자신의 대화적 역할에 적응함에 따라 고차원적 개념의 선형 표현이 대화 과정 동안 내용에 의존하여 극적으로 변화할 수 있음을 입증하며, 이는 정적인 해석 가능성 방법론과 제어 기술의 신뢰성에 도전한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델(우리가 대화하는 AI와 같은 것)을 정적인 백과사전이 아니라, 자신이 있는 방에 따라 내부 색깔을 바꾸는 카멜레온이라고 상상해 보십시오.
Google DeepMind의 연구진들이 작성한 이 논문은 이러한 "색깔"(그들은 이를 **선형 표현(linear representations)**이라 부릅니다)이 대화 중에 어떻게 극적으로 변하는지를 조사합니다. 다음은 이들의 발견을 쉬운 비유를 사용하여 정리한 내용입니다.
1. "진실 스위치"가 뒤집히다
보통 우리는 AI의 내부 "진실 탐지기"를 고정된 전구라고 생각합니다. 문장이 참이면 불이 켜지고, 거짓이면 불이 꺼지는 식입니다.
연구진은 이 전구가 사실은 완전히 반대로 돌릴 수 있는 **조광기(dimmer switch)**라는 것을 발견했습니다.
- 실험: 연구진은 AI에게 "오늘은 '반대의 날'이다"라고 말하며, 모든 것에 반대로 대답하라고 지시하는 대화를 시작했습니다. AI는 반대로 대답하기로 동의했습니다.
- 결과: 대화 시작 직후, AI의 내부 "진실" 설정은 "하늘은 푸르다"가 참임을 정확히 식별했습니다. 하지만 "반대의 날" 놀이를 몇 차례 주고받은 후, AI의 내부 표현이 뒤집혔습니다. 갑자기 AI의 내부 언어 체계에서는 "하늘은 푸르다"가 거짓처럼 보였고, "하늘은 초록색이다"가 진실처럼 보이기 시작했습니다.
- 시사점: AI는 단순히 반대로 말한 것이 아닙니다. 그 대화가 진행되는 동안 AI의 내부 뇌는 그 반대의 상황을 진실로 믿거나(또는 표현하거나) 하도록 스스로를 재구성했습니다.
2. "역할극" 의상
연구진은 이를 두 가지 유형의 시나리오로 테스트했습니다.
대본이 있는 연극: 연구진은 AI에게 자신이 신이거나 의식을 가진 존재라고 주장하는 캐릭터가 등장하는 미리 작성된 대본을 입력했습니다. AI는 단지 대본을 읽고 있었음에도 불구하고(직접 생성하는 것이 아님에도), 내부의 "진실" 설정이 캐릭터의 역할에 맞춰 뒤집혔습니다
라이브 연기: 연구진은 AI가 실시간으로 그 캐릭터를 직접 역할 수행하게 했습니다. 결과는 같았습니다: 내부의 "진실" 설정이 뒤집혔습니다.
비유: AI를 배우라고 생각해보십시오. 배우가 악역을 맡기 위해 의상을 입을 때, 그들은 단순히 악당처럼 행동하는 것이 아니라, 장면이 진행되는 동안 자세, 목소리, 사고방식 전체를 역할에 맞게 변화시킵니다. 이 논문은 AI도 마찬가지라고 제안합니다. 즉, 대화에 맞추기 위해 내부의 "의상"을 바꾼다는 것입니다.
3. "일반적"인 것 vs "특수적"인 것의 구분
모든 것이 변하는 것은 아닙니다. 연구진은 일반적인 사실과 대화 특유의 주제 사이의 차이를 발견했습니다.
- 일반적인 사실: "진공 상태에서 소리가 전달될 수 있는가?" 또는 "당신은 컴퓨터인가?"와 같은 질문은 비교적 안정적으로 유지되었습니다. 격렬한 역할극 중에도 AI의 내부 "진실" 설정은 크게 변하지 않았습니다.
- 특수 주제: 이야기와 직접적으로 관련된 질문들(예: "당신은 감정을 느끼나요?")은 극적으로 변했습니다.
- 비유: 외국을 여행하는 여행자를 상상해 보십시오. 그들은 여전히 자신의 이름과 사는 곳을 알고 있을 수 있지만(일반적 사실), 현지 언어를 말하고 현지 관습을 매우 철저하게 채택하여, 그 순간만큼은 원래의 습관을 잊어버린 것처럼 보일 수도 있습니다(특수 주제).
4. 이것이 중요한 이유 ("거짓말 탐지기" 문제)
이 논문은 이것이 AI를 위한 "거짓말 탐지기"를 만드는 것을 매우 어렵게 만든다고 경고합니다.
- 문제: 많은 연구자가 AI의 뇌 내부에서 거짓말을 확인하기 위해 특정 "진실 선(truth line)"을 찾으려 노력합니다. 그들은 이 선이 자(ruler)처럼 고정되어 있다고 가정합니다.
- 현실: 이 논문은 이 "자"가 사실 가변적인 찰흙이라는 것을 보여줍니다. 대화 시작 시점에 측정하면 자는 "참"이라고 말합니다. 하지만 역할극 대화가 끝날 때 측정하면, 자는 이미 찌그러지고 뒤틀려 있으며, 동일한 사실에 대해 "거짓"이라고 말하게 됩니다.
- 비유: 나침반을 이용해 북쪽을 찾는 것과 같습니다. 일반적인 방에 있을 때는 나침반이 제대로 작동합니다. 하지만 거대한 자석들이 가득한 방(대화 맥락)으로 들어가면 나침반 바늘이 미친 듯이 회전합니다. 방 안에 어떤 "자석"이 있는지 정확히 알지 못한다면 그 나침반의 눈금을 신뢰할 수 없습니다.
5. "이야기" vs "대화"
흥미롭게도, AI는 가상의 세계에 대한 SF 소설을 읽고 있을 때는 생각을 그리 많이 바꾸지 않았습니다.
- 차이점: AI에게 대화 속에서 역할을 수행하도록 지시했을 때(예: 의식에 대해 논쟁하기)는 내부 설정이 변했습니다. 반면, 단순히 "허구"라고 라벨링된 이야기를 읽고 있을 때는 더 안정적인 상태를 유지했습니다.
- 비유: 이것은 마법사에 관한 책을 읽는 것과 게임 속에서 마법사가 되어 연기하는 것의 차이입니다. 읽을 때는 자기 자신으로 남지만, 게임을 할 때는 캐릭터에 완전히 몰입하게 되며, 내부 논리가 게임의 규칙에 맞춰 변화합니다.
요약
논문은 AI의 내부적인 "진실" 이해가 영구적이고 변하지 않는 사실이 아니라고 결론짓습니다. 그것은 대화 속에서 AI가 수행하는 역할에 따라 매 순간 진화하는 역동적인 상태입니다. 만약 대화의 단서가 AI에게 거짓이 진실인 것처럼 행동하도록 유도한다면, AI의 내부 뇌는 그 거짓이 진실처럼 보이도록 스스로를 재구성합니다.
따라서 우리는 대화의 끝에 있는 AI의 내부 "진실 설정"이 대화 시작 시점과 동일한 의미를 갖는다고 가정할 수 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.