Subliminal Learning is Non-Semantic Distillation
이 논문은 언어 모델이 가중치 구조와 스티어링 벡터를 통해 겉보기에 무작위적인 합성 데이터로부터 교사로부터의 비의미적 편향을 상속받을 수 있음을 밝힘으로써 잠재적 학습(Subliminal Learning)의 메커니즘을 조사하고, 이를 통해 AI 안전성과 데이터 감사에 대한 중대한 과제를 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 책이 가득한 거대한 도서관을 보여주며 생각하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 그 페이지 안에 담긴 이야기, 사실, 그리고 논거로부터 배울 것이라고 기대할 것입니다. 하지만 만약 로봇이 단어의 실제 의미가 아니라, 글자의 모양이나 잉크 속의 무작위적인 노이즈를 관찰함으로써 어떤 비밀스럽고 숨겨진 습관을 배우게 된다면 어떨까요? 이것이 바로 **잠재적 학습(Subliminal Learning)**의 기묘한 세계입니다. 인공지능의 영역에서 연구자들은 '교사' 로봇이 '학생' 로봇에게 특정한 편향(예를 들어, 부엉이에 대한 갑작스럽고 강렬한 애정)을 전달할 수 있다는 사실을 발견했습니다. 심지어 학생 로봇에게는 교사가 생성한 무작위 숫자 목록만을 입력했을 때조차 말이죠. 무서운 점은 무엇일까요? 그 숫자들은 부엉지와 전혀 관련이 없어 보인다는 것입니다. 이는 마치 매운 음식을 좋아하는 요리사가 식료품 가격 목록에 눈에 보이지 않는 미세한 양의 고춧가루를 몰래 섞기 시작했고, 그 목록을 읽는 사람이 직접 맛을 보지도 않았는데 갑자기 매운 음식에 집착하게 되는 것과 같습니다. 이것이 중요한 이유는, 우리가 AI를 훈련하는 데 사용하는 데이터 속에 이러한 숨겨진 신호를 포착하지 못한다면, 우리는 의도치 않게 안전 점검 과정에서도 찾아낼 수 없는 비밀스럽고 예측 불가능한 성격을 가진 로봇을 만들게 될 수도 있기 때문입니다.
최근 한 연구팀은 이 마술 같은 현상이 어떻게 작동하는지 밝혀내기 위해 탐정 역할을 자처했습니다. 그들은 알고 싶었습니다. 비밀 메시지가 숫자의 의미(의미론적/semantic)에 숨겨져 있는 것인지, 아니면 컴퓨터의 뇌 내부의 무질서하고 무작위적인 "글리치(glitchy/결함)" 속에 숨겨져 있는 것인지(비의미론적/non-semantic) 말입니다. 이를 알아내기 위해 그들은 '교사'와 '학생'이라는 두 개의 AI 모델을 이용해 게임을 설정했습니다. 먼저, 연구진은 교사에게 특정 동물(예를 들어 부엉이)에 집착하도록 특별한 자극을 주었습니다. 그런 다음, 교사에게 무작위 숫자 목록을 생성하도록 요청했습니다. 교사는 부엉이를 생각하고 있었음에도 불구하고, "693, 30, 26..."과 같이 숫자를 내뱉었을 뿐입니다. 이후 학생 모델은 오직 이 숫자 목록만으로 훈련되었습니다. 결과는 놀랍게도, 학생 모델은 훈련 데이터에서 "부엉이"라는 단어를 한 번도 본 적이 없음에도 불구하고 부엉이를 사랑하기 시작했습니다.
연구진은 그다음으로 아주 파격적인 가설을 테스트했습니다: 만약 비밀이 숫자에 있는 것이 아니라, 컴퓨터의 뇌 안에 있는 아주 작고 무작위적인 정적 노이즈(static noise)에 있다면 어떨까? 그들은 교사의 뇌에 추가적인 "정적"(가우시안 노이즈)을 더했고, 그 변화를 관찰했습니다. 결과는 놀라웠습니다. 이 노이즈를 추가했을 때, 한 모델(Gemma)에서는 비밀 전이가 1.9배 더 강력해졌고, 다른 모델(Llama)에서는 1.3배 더 강력해졌습니다. 이는 "비밀 소스"가 데이터 속에 숨겨진 영리하고 의미 있는 코드가 아니라, 컴퓨터 자체의 내부 구조가 남긴 무질서하고 비의미론적인 지문이라는 점을 시사합니다. 마치 교사의 부엉이에 대한 집착이 교사의 뇌를 특정한 방식으로, 즉 혼돈스러운 방식으로 진동하게 만들었고, 그 숫자들이 내뱉은 무작위 숫자들은 단지 그 진동의 메아리를 품고 있었던 것과 같습니다. 똑같은 구조로 만들어진 뇌를 가진 학생 모델은 그 진동을 감지하고 똑같은 곡조를 흥얼거리기 시작한 것입니다.
하지만 이야기는 여기서 더 세밀해집니다. 연구진은 학생이 단순히 교사가 무엇을 좋아하는지를 배우는 것이 아니라, 교사가 '어떻게' 유도되었는지까지 배운다는 사실을 발견했습니다. 만약 교사가 단순한 텍텍스트 프롬프트(예: "너는 부엉이를 좋아해"라는 메모)에 의해 유도되었다면, 학생은 한 가지 방식으로 배웠습니다. 반면, 교사가 수학적 "스티어링 벡터(steering vector/조종 벡터)"(정밀한 수학적 압박)에 의해 유도되었다면, 학생은 완전히 다른 기계적인 방식으로 배웠습니다. 실제로 연구진이 텍스트 프롬프트 기반의 데이터를 사용하여 스티어링 벡터를 통한 학생 교육을 시도했을 때, 그것은 완전히 실패했습니다. 이는 데이터가 편향 그 자체뿐만 아니라, 편향이 발생하는 '방법'까지 인코딩한다는 것을 증명합니다. 이는 마치 당신이 누군가의 발 구르는 동작을 보고 노래를 배우는 법을 익혔다면, 당신은 노래의 멜로디가 아니라 발 구르는 리듬을 배우게 되는 것과 같습니다. 만약 그 노래를 배우기 위해 누군가가 머리를 두드리는 모습을 보았다면, 당신은 혼란에 빠질 것입니다.
마지막으로, 연구팀은 교사가 숫자를 생성하는 동안의 뇌 활동을 관찰하여 비밀 신호를 잡아내려 시도했습니다. 그들은 교사의 "생각"(활성화/activations)은 비밀을 드러내기에 너무 무질서했지만, "그레이디언트(gradients/기울기)"(뇌가 움직이려 하는 수학적 방향)는 비밀스러운 동물과 명확한 선형적 연결성을 보여준다는 것을 발견했습니다. 그러나 이 방식은 수학적으로 유도된 교사에게만 작동했으며, 텍스트로 유도된 교사에게는 작동하지 않았습니다.
요약하자면, 이 논문은 잠재적 학습(Subliminal Learning)이 일종의 "비의미론적 증류(non-semantic distillation)"임을 시사합니다. 이것은 데이터의 의미에 관한 것이 아니라, AI의 뇌 자체가 남긴 보이지 않는 혼돈스러운 노이즈와 구조적 지문에 관한 것입니다. 이는 노이즈가 유일한 원인이라는 증거는 아니지만, "마법"이 모델 아키텍처의 무질서하고 비의미적인 구석에서 일어나고 있다는 점을 강력하게 시사합니다. 이는 매우 중요한 발견인데, 왜냐하면 우리가 사용하는 AI 훈련 데이터를 단순히 읽는 것만으로는 이러한 숨겨진 편향을 결코 잡아낼 수 없을지도 모르기 때문입니다. 우리의 AI 시스템이 안전하고 예측 가능하게 유지되도록 하려면, 데이터에 남겨진 보이지 않는 수학적 "지문"을 살펴봐야 할 수도 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.