All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs
본 논문은 여러 구조적으로 상이하고 충실한 회로가 공존할 수 있음을 입증함으로써 LLM 기능이 고유한 내부 메커니즘에 의존한다는 가정에 도전하고, 이러한 비정형적 설명을 규명하기 위해 중첩을 고려한 방법을 도입하며, 이러한 고유한 기능적 이방성을 설명하기 위해 고차원 중첩에 기반한 이론적 틀을 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"모든 회로는 로마로 통한다"는 논문에 대한 설명을 간단한 언어와 창의적인 비유를 사용하여 제시합니다.
핵심 아이디어: 문제를 해결하는 유일한 "올바른" 방법은 존재하지 않습니다
거대하고 초지능적인 로봇 (대형 언어 모델) 에게 퍼즐을 풀어달라고 요청한다고 상상해 보세요. 오랫동안 과학자들은 로봇의 뇌 내부에 정답을 만들어내는 단 하나의 특정하고 고유한 전선과 기어 경로가 있다고 믿었습니다. 만약 그 단일 경로를 찾으면 로봇이 사고하는 방식의 "비밀 재료"를 발견한 것이라고 생각했습니다.
이 논문은 그 믿음은 잘못되었다고 주장합니다.
단 하나의 비밀 경로 대신, 로봇은 정확히 같은 올바른 답으로 이어지는 수십 개의 완전히 다른 경로를 가지고 있습니다. 마치 "에마이어 스테이트 빌딩에 어떻게 갔나요?"라고 물었을 때 세 가지 다른 답변을 듣는 것과 같습니다:
- "지하철을 탔어요."
- "계단을 걸어 올랐어요."
- "헬리콥터를 탔어요."
세 가지 모두 사실입니다. 세 가지 모두 그 사람을 그곳에 데려갔습니다. 하지만 그 경로들은 공통점이 거의 없습니다. 이 논문은 과거의 믿음을 **"기능적 이방성 가설 (Functional Anisotropy Hypothesis)"**이라고 부릅니다 (기능이 한 특정 위치에 있다는 것을 fancy 하게 표현한 것). 저자들은 이것이 거짓임을 증명합니다.
실험: "숨겨진 도로" 찾기
이를 증명하기 위해 연구자들은 **회로 및 다발 발견 (Circuit and Sheaf Discovery, CSD)**이라는 방법을 사용했습니다. 이는 로봇의 뇌 일부를 끄고 실제로 어떤 부분이 일을 하고 있는지 확인하는 방법이라고 생각하면 됩니다.
보통 과학자들은 이 테스트를 한 번 실행하여 "회로" (활성화된 전선 그룹) 를 발견하면, "아하! 이것이 작동 방식이야!"라고 말합니다.
저자들은 다르게 접근했습니다. 그들은 동일한 작업에 대해 테스트를 20 번 실행했지만, 특별한 규칙을 추가했습니다: "지난번에 선택한 전선과 같은 전선을 선택하지 마라." 그들은 발견 과정을 강제로 문제 해결의 새로운 방법을 찾도록 했습니다.
결과:
- 그들은 작업을 완벽하게 해결한 20 개의 서로 다른 "회로" (전선 그룹) 를 발견했습니다.
- 이 회로들은 서로 전혀 닮지 않았습니다. 뇌의 서로 다른 층과 서로 다른 연결을 사용했습니다.
- 그들 사이의 겹침은 미미했습니다 (5% 미만). 마치 같은 목적지로 가는 완전히 다른 지도를 사용하는 것과 같았습니다.
"세 개의 엣지"라는 놀라움
연구자들은 한 걸음 더 나아가 가장 작은 가능한 회로를 찾아보았습니다. 그들은 단 **세 개의 엣지 (연결)**로 구성된 "다발 (functional circuit)"을 발견했습니다.
처음에는 이 세 개의 엣지가 절대적으로 필요한 "핵심"인 것처럼 보였습니다. 하지만 테스트를 해보니 깨달았습니다: 심지어 이 세 개의 엣지도 절대적으로 필수적인 것은 아닙니다.
세 개의 엣지 중 하나를 제거하면 로봇은 일을 수행할 수 있는 다른 세 개의 엣지 집합을 여전히 찾을 수 있습니다. 강을 건너는 유일한 길이라고 생각했던 특정 다리가 있다고 가정해 보세요. 하지만 그 다리를 폐쇄하면 교통 흐름이 즉시 완전히 다른 터널과 페리들을 통해 우회하고, 아무도 그 차이를 느끼지 못합니다.
왜 이런 일이 일어날까요? ("중첩" 비유)
이 논문은 이를 설명하는 이론으로 **분산 밀집 회로 가설 (Distributive Dense Circuit Hypothesis)**을 제시합니다.
로봇의 뇌가 한 번에 이야기하는 사람 (뉴런) 으로 가득 찬 거대하고 붐비는 방이라고 상상해 보세요. 이를 **중첩 (superposition)**이라고 합니다. 너무 많은 사람들과 그들의 목소리를 결합할 수 있는 너무 많은 방법들이 있기 때문에, 같은 문장을 말할 수 있는 수백만 가지의 서로 다른 "사람들의 조합"이 존재합니다.
- 과거의 관점: "안녕하세요"라고 말하려면 반드시 이야기해야 하는 특정 그룹의 사람들이 하나 있습니다.
- 새로운 관점: 같은 음량과 톤으로 "안녕하세요"라고 말할 수 있는 수천 개의 서로 다른 그룹이 있습니다. 한 그룹을 침묵시키면, 다른 그룹이 즉시 그 자리를 대신하여 이야기합니다.
로봇이 너무 크고 복잡하기 때문에 내재된 중복성을 가지고 있습니다. 이는 하나의 취약한 경로에 의존하는 것이 아니라, 경쟁하는 경로들의 밀집된 그물망에 의존합니다.
과학자들에게 이것이 의미하는 바
이 논문은 로봇이 고장 났거나 우리가 그것을 이해할 수 없다고 말하는 것이 아닙니다. 우리는 발견한 결과를 해석하는 방식을 바꿔야 한다고 말합니다.
- "그" 회로를 찾지 마세요: 과학자들이 회로를 발견했을 때, "이것이 모델이 작동하는 유일한 방법이다"라고 말해서는 안 됩니다.
- "하나의" 회로를 찾으세요: 그들은 "이것은 모델이 작동하는 유효한 여러 방법 중 하나입니다"라고 말해야 합니다.
요약
"모든 회로는 로마로 통한다"는 논문은 대형 언어 모델이 단일하고 고유한 엔진을 가진 기계가 아니라고 알려줍니다. 그들은 무한한 경로가 있는 거대하고 유연한 도시와 더 비슷합니다. 하나의 도로를 막으면 교통 흐름이 다른 길을 찾습니다. 모델이 사고하는 방식에 대한 단일한 "올바른" 지도는 없습니다. 유효한 지도는 여러 개이며, 모두 같은 목적지로 이어집니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.