Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching
이 논문은 토큰 위치 전반에 걸쳐 시간적으로 퍼진 효과를 추적하고 표적화된 절제를 통해 기능적 중요성을 검증함으로써, 거대 언어 모델의 사고 사슬(Chain-of-Thought) 추론을 인과적으로 지원하는 분산된 어텐션 헤드 서킷을 식별하기 위한 순차적 활성화 패칭 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델은 현대 인공지능 도구들의 엔진 역할을 하며, 인간과 유사한 텍스트를 생성하고, 문제를 해결하며, 질문에 답할 수 있습니다. 이러한 모델이 어려운 수학 문장제 문제와 같은 복합적인 과제에 직면했을 때, 최종 답변을 내놓기 전에 먼저 자신의 생각을 단계별로 적도록 요청하면 훨씬 더 나은 성능을 보이는 경우가 많습니다. '사고의 사슬(chain-of-thought)' 프롬프팅이라고 알려진 이 기술은, 마치 사람이 종이에 계산 과정을 적는 것처럼 모델이 문제를 더 작고 관리 가능한 조각들로 나누도록 유도합니다. 그러나 이러한 기록된 단계들이 실제로 모델의 사고를 돕는 것인지, 아니면 그저 그럴듯한 수행에 불과한 것인지에 대해서는 여전히 미스터리로 남아 있습니다. 모델이 중간 텍스트를 사용하여 내부 논리를 가이드하는 것인지, 아니면 단순히 그럴듯해 보이는 단어들을 생성하면서 실제로는 숨겨진 다른 프로세스에 은밀히 의존하여 답에 도달하는 것인지는 불분명했습니다. 이러한 구분을 이해하는 것은 매우 중요한데, 만약 모델이 진정으로 추론하는 것이 아니라면 그 설명은 오해의 소지가 있을 수 있고, 결정적인 상황에서의 신뢰성 또한 의심스러울 수 있기 때문입니다.
이 수수께끼를 풀기 위해 이즈미르 공과대학교(İz İzmir Institute of Technology)의 연구진은 모델이 작업하는 동안 모델의 '두뇌' 내부를 들여다보기로 했습니다. 그들은 정보가 거대한 상호 연결된 경로 네트워크를 통해 처리되는 트랜스포머(transformer)라는 특정 유형의 인공지능에 집중했습니다. 그들은 사고의 사슬 과정이 모델의 내부 활동을 정확히 어디서 어떻게 변화시키는지 알고 싶었습니다. 단순히 최종 출력을 관찰하는 대신, 그들은 '활성화 패칭(activation patching)'이라는 기술을 사용했습니다. 모델의 내부 상태를 건물 안의 서로 다른 방들을 통과하여 흐르는 데이터의 흐름이라고 상상해 보십시오. 표준 실행(standard run)에서 모델은 단계를 적지 않고 문제를 해결합니다. '클린(clean)' 실행에서는 모델이 단계를 적으면서 동일한 문제를 해결합니다. 연구진은 '클린' 실행 중에 특정 경로를 통해 흐르는 특정 데이터를 가져와 '표준' 실행에 교체하여 주입했습니다. 이렇게 함으로써, '생각하는' 데이터를 '생각하지 않는' 실행에 주입했을 때, 모델이 마치 누락된 단계들을 제공받은 것처럼 갑자기 문제를 올바르게 풀기 시작하는지를 확인할 수 있었습니다.
연구진은 모델의 추론 능력이 하나의 고립된 지점에 저장되어 있는 것이 아니라, 특정 순서로 활성화되는 분산된 경로 네트워크 전체에 퍼져 있다는 것을 발견했습니다. 연구진이 생각하지 않는 모델의 내부 신호를 생각하는 모델의 신호로 대체했을 때, 생각하지 않던 모델은 생각하는 모델처럼 행동하기 시작했습니다. 모델은 정답에 더 가까워졌고 동일한 논리적 경로를 따르기 시작했습니다. 이는 사고의 사슬 프롬프트가 단순히 화면에 텍스트를 추가하는 것을 넘어, 모델의 내부 연산을 능동적으로 재구성하여 모델을 추론 모드로 유도한다는 것을 시사합니다. 연구진은 이 효과가 동일한 특정 문제의 신호를 교체했을 때 가장 강력했지만, 완전히 다른 문제의 신호를 교체했을 때도 (비록 덜 강력하지만) 여전히 작동한다는 것을 발견했습니다. 이는 모델이 단지 하나의 특정 방정식을 푸는 법뿐만 아니라, 문제를 생각하며 풀어가는 일반적인 패턴을 학습했음을 나타냅니다.
이 경로들이 정말로 필수적인지 확인하기 위해, 연구진은 식별된 경로들을 아예 꺼버리는 두 번째 실험을 수행했습니다. 이렇게 했을 때 모델의 성능은 무너졌습니다. 단순히 최종 숫자를 틀리는 것에 그치지 않고, 예시 문제의 세부 사항과 새로운 질문을 혼동하거나 심지어 예상된 형식으로 최종 답변을 제시하지 못하는 등 맥락을 유지하는 능력마저 상실했습니다. 모델은 때때로 같은 문구를 반복하거나 말이 안 되는 숫자를 생성하기도 했습니다. 이러한 실패는 연구진이 식별한 경로들이 단순히 설명을 쓰기 위한 것이 아니라, 모델의 추론이 궤도를 벗어나지 않게 유지하고, 예시와 실제 과제를 분리하며, 올바른 숫자를 생성하도록 돕는 바로 그 회로임을 보여주었습니다.
연구진은 이러한 개선이 단순한 노이즈나 모델의 일부를 변경함으로써 발생하는 부작으로 인한 것인지에 대한 가능성도 배제했습니다. 연구진이 특정 '사고' 신호 대신 무작위의 의미 없는 데이터를 교체했을 때, 모델은 개선되지 않았습니다. 이는 이 경로들이 운반하는 특정 신호가 중요하다는 것을 확인시켜 주었습니다. 연구진은 이러한 핵심 경로들이 모델의 맨 앞이나 맨 끝이 아니라, 모델 레이어의 중간 및 후반부에 집중되어 있다는 것을 발견했습니다. 이 경로들은 모델이 사고의 흐름을 유지하고, 최종 답변을 올바른 숫자에 고정하며, 예시 문제가 새로운 문제에 오염을 일으키지 않도록 돕는 지원 시스템 역할을 합니다.
궁극적으로, 이 연구는 사고의 사슬 프롬프팅이 단계별 추론을 지원하도록 설계된 특정 분산형 내부 회로를 동원하기 때문에 작동한다는 점을 시사합니다. 이러한 회로는 모델의 나머지 부분과 떨어져 존재하는 별도의 '추론 모듈'이 아니라, 모델이 소리 내어 생각하도록 요청받을 때 동적으로 사용하는 중첩된 구성 요소들입니다. 모델이 생각하도록 프롬프트를 받지 않을 때 이러한 회로는 완전히 활성화되지 않으며, 모델은 복잡한 과제에 어려움을 겪습니다. 모델이 프롬프트를 받으면 이러한 회로가 활성화되어 모델이 해결책에 도달하기 위해 필요한 단계들을 안내합니다. 이 연구 결과는 이 강력한 도구들이 실제로 어떻게 작동하는지에 대한 더 명확한 그림을 제공하며, 모델이 자신의 추론을 설명하는 능력이 단순한 언어적 현상이 아니라, 정보를 처리하는 방식의 진정한 내부적 변화를 반영한다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.