Transformers converge to invariant algorithmic cores
이 논문은 알고리즘 핵심 추출(Algorithmic Core Extraction, ACE)을 소개하여, 독립적으로 학습된 트랜스포머 모델들이 서로 다른 가중치 구성을 가짐에도 불구하고 그들의 동작을 지배하는 압축되고 불변하는 알고리즘 부공간(algorithmic subspaces)으로 수렴함을 입증하며, 이를 통해 겉으로 보이는 복잡성 아래에 존재하는 공유된 계산 구조를 드러내고 기계론적 이해와 제어를 위한 새로운 경로를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 다른 길, 같은 목적지
당신이 집에서 특정 커피숍으로 가려고 한다고 상상해 보세요.
- 운전자 A는 교외를 지나 고속도로를 거쳐 뒷골목으로 가는 경로를 택합니다.
- 운전자 B는 도심을 지나 공원을 거쳐 다리를 건너는 경로를 택합니다.
- 운전자 C는 페리와 기차를 이용하는 완전히 다른 경로를 택합니다.
만약 당신이 그들의 지도(그들이 운전한 구체적인 도로들)를 본다면, 서로 전혀 닮지 않았을 것입니다. 완전히 다릅니다. 하지만, 그들이 실제로 무엇을 하고 있는지(커피숍으로 운전해 가는 행위)를 본다면, 그들은 모두 정확히 똑같은 일을 하고 있습니다.
이 논문은 AI 모델(특히 "트랜스포머")도 이와 똑같이 작동한다고 주장합니다. 우리가 두 AI 모델에게 동일한 과제를 수행하도록 훈련할 때, 모델들은 완전히 다른 내부 "배선"(가중치와 파라미터)을 갖게 됩니다. 하지만 그 깊은 곳에서는, 그들 모두 작업을 완수하기 위해 동일한 숨겨진 "엔진"을 사용하고 있습니다.
저자들은 이 숨겨진 엔진을 **알고리즘 코어(Algorithmic Core)**라고 부릅니다.
문제점: 잘못된 것을 보고 있다
보통 과학자들이 AI가 어떻게 작동하는지 이해하려고 할 때, 단일 모델의 구체적인 배선을 연구하곤 합니다. 이 논문은 이것이 위험하다고 말합니다. 그것은 마치 운전자 A의 지도를 보고 "아, 커피를 마시러 가려면 반드시 뒷골목을 지나야 하는구나"라고 생각하는 것과 같습니다. 하지만 그것은 단지 운전자 A의 경로가 우연히 그랬던 것뿐입니다. 운전자 B는 그 골목을 지나지 않았습니다.
이 논문은 구체적인 도로(한 번의 훈련 과정에서 나타나는 무질서하고 고유한 세부 사항들)를 보는 것을 멈추고, 불변량(Invariant)(모든 운전자가 공유하는 변하지 않는 진실)을 찾는 데 집중해야 한다고 제안합니다.
해결책: "코어" 찾기
저자들은 ACE(Algorithmic Core Extraction)라는 도구를 만들었습니다. ACE를 특별한 X선 안경이라고 생각해 보세요.
- 노이즈를 걸러냅니다: ACE는 하나의 AI를 다른 AI와 다르게 만드는 수백만 개의 고유한 세부 사항들을 무시합니다.
- 엔진을 찾아냅니다: ACE는 작업을 수행하는 데 절대적으로 필요한, AI 내부의 작고 압축된 "코어"를 분리해 냅니다. 만약 이 코어를 제거하면 AI는 실패합니다. 반대로 이 코어만 남겨두어도 AI는 완벽하게 작동합니다.
- 동일함을 증명합니다: 겉모습은 서로 달라 보일지라도, ACE는 그들 모두가 내부에 동일한 수학적 "엔진"을 숨기고 있음을 보여줍니다.
세 가지 실험: 단순함에서 복잡함으로
논문은 이 아이디어를 세 가지 서로 다른 시나리오에서 테스트했습니다.
1. 단순한 퍼즐 (마르코프 체인)
그들은 세 개의 서로 다른 AI에게 시퀀스의 다음 단계를 예측하는 간단한 게임을 가르쳤습니다.
- 결과: 세 AI는 완전히 다른 내부 지도를 사용하여 학습했습니다. 그들의 "배선"은 거의 완전히 달랐습니다.
- 코어: 하지만 ACE가 내부를 들여다보았을 때, 세 AI 모두 동일한 수학을 수행하는 아주 작은 3차원 "코어"를 숨기고 있다는 것을 발견했습니다. 이는 마치 세 대의 서로 다른 자동차 엔진이 겉모습은 달라도 모두 정확히 똑같은 3기통 피스톤 배열을 사용하고 있다는 것을 발견한 것과 같습니다.
2. "그로킹(Grokking)"의 미스터리 (모듈로 덧셈)
"그로킹"은 AI가 단순히 답을 암기하는 단계를 지나, 오랫동안 지나온 후에 갑자기 수학 문제를 완벽하게 해결하게 되는 기이한 현상입니다.
- 발견: 저자들은 AI가 "그로킹"(갑자기 이해함)하는 바로 그 순간, 내부에서 작고 원형인 "코어"가 형성된다는 것을 발견했습니다. 이 코어는 숫자를 회전시켜 수학 문제를 푸는 시계처럼 작동합니다.
- 반전: AI가 학습을 마친 후에도 계속 훈련을 시키면, 이 코어는 "비대해집니다". 코어는 필요한 것보다 훨씬 더 많은 공간을 차지하며, 동일한 수학의 중복된 복사본들로 채워집니다.
- 교훈: 논문은 문제를 해결하는 데 있어 많은 중복된 방식들을 갖는 것이 AI가 더 빨리 학습하는 데 도움이 된다는 것을 발견했습니다. 이는 마치 팀원들이 모두 똑같은 정답을 외치고 있는 것과 같아서, 결국 정답이 더 빠르게 전달되는 것과 같습니다.
3. 현실 세계 (언어 모델)
마지막으로, 그들은 텍x 생성에 사용되는 GPT-2, LLaMA 등 6개의 거대한 실제 AI 모델들을 살펴보았습니다. 이 모델들은 매우 거대하며 서로 매우 다릅니다.
- 과제: 그들은 주어-동사 일치(문장에 'is'가 필요한지 'are'가 필요한지 아는 것)에 집중했습니다.
- 발견: 이 6개의 거대한 모델 모두에서, 단수 혹은 복수를 결정하는 단 하나의 보이지 않는 "선"(1차원 축)이 AI의 뇌 속에 존재함을 발견했습니다.
- 마법 같은 효과: 만약 이 단 하나의 선을 가져와서 "뒤집으면"(방향을 반대로 바꾸면), AI는 즉시 문법 실수를 하기 시작합니다. "The cat is"를 "The cat are"로 바꿉니다.
- 정렬(Alignment): 이 모델들은 서로 다른 회사에 의해 만들어졌고, 서로 다른 데이터로 훈련되었으며, 크기도 다르지만, 문법을 처리하기 위해 정확히 같은 선을 사용합니다. 이는 마치 모든 인간의 뇌가 문화나 언어와 상관없이, '나'와 '우리'를 결정하기 위해 동일한 신경 스위치를 사용하는 것과 같습니다.
이것이 왜 중요한가
이 논문은 복잡하고 무질서한 AI의 표면 아래에, 더 단순하고 공유된 구조가 존재한다고 결론짓습니다.
- 도색 상태를 보지 마세요: AI의 구체적인 색상과 모양(파라미터)은 어떻게 훈련되었는지에 따른 우연일 뿐입니다.
- 엔진을 보세요: "알고리즘 코어"가 진짜입니다. 그것은 누가 AI를 만들든, 어떻게 만들든 변하지 않는 부분입니다.
이러한 코어를 찾아냄으로써, 우리는 AI를 더 잘 이해하고 제어할 수 있습니다. 백만 개의 작은 전선을 고치려고 애쓰는 대신, 우리가 관심을 갖는 행동을 제어하는 단 하나의 "스위치"를 찾을 수 있기 때문입니다.
요약 비유
세 명의 서로 다른 건축가가 집을 짓는다고 상상해 보세요.
- 건축가 A는 나무를 사용합니다.
- 건축가 B는 벽돌을 사용합니다.
- 건축가 C는 강철을 사용합니다.
만약 당신이 재료를 본다면, 그것들은 완전히 다릅니다. 하지만 계단의 설계도를 본다면, 세 건축가 모두 위로 올라가는 가장 효율적인 방법으로서 정확히 똑같은 10단계 설계를 사용했다는 것을 발견할 수도 있습니다.
이 논문은 이렇게 말합니다: "나무, 벽돌, 강철에 대해 논쟁하지 마세요. 대신 계단을 연구합시다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.