Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m
본 논문은 독립적으로 훈련된 트랜스포머들이 균일한 무작위 회전에 의해 관련된 상호 이해 불가능한 내부 좌표를 사용하여 동일한 함수를 계산함을 보여주며, 이러한 현상을 '다형성 (polymorphism)'이라 명명하고 단일 직교 프로크루스테스 피팅을 통해 해결함으로써 재훈련 없이 특징 사전과 조향 벡터를 직접 이전할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신과 친구가 동일한 복잡한 레고 성을 같은 설명서로 짓고 있다고 상상해 보세요. 두 사람은 외관상 완전히 동일하고 동일한 기능 (동일한 문, 창문, 탑) 을 수행하는 성을 완성합니다.
그러나 성 내부에서 벽돌이 배치되는 방식에 대한"청사진"은 완전히 다릅니다. 사실, 그 차이가 너무 커서 친구의 내부 청사진을 이용해 자신의 성을 이해하려 한다면 혼란에 빠질 것입니다. 성들이 서로 다른 것이 아니라, 같은 것을 설명하는 두 가지 다른"내부 언어"를 사용하고 있는 것입니다.
이 논문은 이러한 현상을**"다형성 (Polymorphism)"**이라고 부릅니다. 이는"동일한 기능, 다른 내부 좌표"를 의미합니다.
연구자들이 발견한 내용을 간단한 비유로 정리하면 다음과 같습니다:
1. "디코더"vs"인코더"(사전 문제)
AI 연구에서 과학자들은 종종 모델의"특성"(개념의 사전과 같은) 을 살펴봄으로써 모델이 무엇을 생각하고 있는지 이해하려 합니다. 그들은 프로세스의"끝"(디코더) 을 살펴보면 두 가지 다른 모델 간의 사전이 거의 동일하다는 것을 발견했습니다. 마치 두 사람이 정확히 같은 사전을 사용하여 이야기를 쓰는 것과 같습니다.
반전: 연구자들은사전(디코더) 은 동일했지만, 그 사전을읽는 방식(인코더) 은 완전히 뒤죽박죽이라는 사실을 깨달았습니다.
- 비유: 두 사람이 책을 읽는 상황을 상상해 보세요. A 는 정상적으로 읽지만, B 는 책을 90 도 회전시켜 거꾸로 읽고 있습니다. 그들이 가리키는 단어 (디코더) 만 보면 완벽하게 일치합니다. 하지만 A 의 관점으로 B 의 메모를 읽으려 한다면 그 메모는 전혀 의미가 없습니다. "메모"(활성화) 는 회전된 기준 프레임에 있기 때문입니다.
2. 치명적인 실패
연구자들이 모델 A 의"특성 사전"을 가져와 모델 B 에 직접 적용하려 했을 때, 그것은 완전히 실패했습니다. 모델의 내부 사고를 재구성한 결과는 평균적인 답을 추측하는 것보다도 나빴습니다.
- 비유: 런던을 항해하기 위해 뉴욕 시티 지도를 사용하는 것과 같습니다. 랜드마크 (디코더 열) 가 목록에서 비슷해 보일 수는 있지만, 거리 (내부 좌표) 의 방향은 다릅니다. 런던에서 뉴욕 지도를 따라가면 즉시 길을 잃게 됩니다.
3. 마법 같은 해결책: 하나의 행렬 곱셈
이 논문의 가장 큰 발견은 이를 어떻게 해결하는지입니다. 모델을 다시 훈련시키거나 뇌를 변경할 필요가 없습니다. 두 모델을 정렬시키기 위해 단일한 수학적인"회전"(프로크루스테스 피트라고 불리는 특정 수학 연산) 만 적용하면 됩니다.
- 비유: 당신과 친구가 회전 플랫폼의 반대편에 서서 같은 조형물을 보고 있다고 상상해 보세요. 당신은 같은 물체를 보지만 다른 각도에서 보는 것입니다. 플랫폼을 친구의 각도에 맞춰 회전시키기만 하면, 갑자기 두 사람의 시야가 완벽하게 정렬됩니다.
- 결과: 모델 B 의 내부 데이터에 이 단일"회전"을 적용하자마자, 모델 A 의 사전이 모델 B 에서 완벽하게 작동했습니다."내부 언어"가 즉시 번역된 것입니다.
4. 특정 회전인가, 무작위인가?
연구자들은 궁금해했습니다. 이 회전이 의미 있는 특정 이동인지, 아니면 단순히 무작위적인 혼란인지 말입니다.
- 발견: 본질적으로 그것은무작위입니다. 두 개의 독립적으로 훈련된 모델 사이의 회전은 바퀴를 무작위로 돌리는 것과 같습니다. 그것은"특별한"각도가 아니라 균일한 무작위 회전일 뿐입니다.
- 비유: 지구를 무작위로 돌려 멈추게 한다면, 그 방향은 무작위입니다. 이 논문은 두 개의 AI 모델이 처음부터 훈련될 때마다 서로에 대해 무작위 각도에 멈춰 있는"지구"를 갖게 된다는 것을 보여줍니다.
5."조종"(행동 변경) 에 대한 의미
이 논문은 또한 모델의 행동을 다르게 유도하는 도구인"조종 벡터"(예: 더 정중하게 또는 더 창의적으로 만들기) 를 테스트했습니다.
- 발견: 회전 문제를 먼저 해결하지 않고 모델 A 의"조종 유도"를 모델 B 에 적용하면, 실패하거나 종종 원하는 것과반대되는 결과를 초래합니다.
- 비유: 장난감 자동차 (모델 A) 의 리모컨이 있다고 상상해 보세요. 만약 다른 방향을 향한 다른 장난감 자동차 (모델 B) 에 그 리모컨을 사용하려 한다면,"전진"을 누르는 것이 두 번째 자동차를"좌회전"이나"후진"하게 만들 수 있습니다. 먼저 두 번째 자동차가 어떤 방향을 향하고 있는지 (회전) 파악하고 리모컨의 신호를 그에 맞게 조정해야 합니다.
"규칙"의 요약
이 논문은 이러한 모델들이 어떻게 관련되는지에 대한 세 가지 주요 규칙을 확립합니다:
- 동일한 기능, 다른 좌표: 별도로 훈련된 두 모델은 같은 일을 하지만 서로 다른 내부"지도"를 사용합니다.
- 디코더는 속입니다: "끝"의 특성들이 비슷해 보인다고 해서 모델들이 같은 방식으로 이해한다는 뜻은 아닙니다.
- 해결책은 저렴합니다: 모델을 다시 훈련시킬 필요 없이 단일하고 간단한 수학 계산 (하나의 행렬 곱셈) 으로 완전히 다른 두 모델을 정렬할 수 있습니다.
발견의 규모
연구자들은 두 가지 수준에서 이를 증명했습니다:
- "장난감"모델: 모든 벽돌을 하나씩 확인할 수 있는 104,000 개의 매개변수를 가진 작고 간단한 모델로 이론이 사실인지 확인했습니다.
- "실제"모델: 7 천만 개의 매개변수를 가진 훨씬 더 크고 현실적인 언어 모델 (Pythia-70m) 입니다. 여기서도 동일한"무작위 회전"규칙이 유효했습니다.
핵심 결론: AI 모델은 같은 언어를 말하지만 다른 억양과 방향을 가진 쌍둥이와 같습니다. 그들은 같은 일을 하지만, 서로를 이해하려면 시점을 회전시키기만 하면 됩니다. 그렇게 하면 그들의 내부 비밀이 읽을 수 있게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.