← 최신 논문
💻 computer science

Mechanistic Circuit Tracking Causal Activation Patching and Formation Trajectories in Transformer Architectures

이 논문은 AI 안전 및 정렬을 강화하기 위해 직접 로짓 기여도(direct logit attribution), 인과적 활성화 패칭(causal activation patching), 그리고 절제(ablation) 기법을 결합하여 사전 학습 과정 중 어텐션 회로의 출현을 추적하고 새로운 회로 안정성 지수(Circuit Stability Index)를 통해 그 인과적 견고성을 정량화하는 모듈형 프레임워크인 메커니즘적 회로 추적(Mechanistic Circuit Tracking)을 소개한다.

원저자: Yash Prajapati

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yash Prajapati

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대적인 인공지능 시스템, 특히 인간과 유사한 텍스트를 생성하는 시스템은 종종 '블랙박스'라고 묘사되곤 한다. 우리는 무엇이 들어가고 무엇이 나오는지 알고 있지만, 단순한 프롬프트를 복잡한 답변으로 변환하는 내부 기제는 여전히 대체로 불투명하다. 이러한 투명성의 결여는 왜 이 시스템들이 때때로 실패하거나 예측 불가능하게 행동하는지를 이해하기 어렵게 만든다. 이를 해결하기 위해 '기계적 해석 가능성(mechanistic interpretability)'이라 불리는 연구 분야가 등장했다. 신경망을 하나의 거대하고 침투 불가능한 단위로 취급하는 대신, 이 분야의 연구자들은 시스템을 가장 작은 작동 단위로 분해하여 역설계하려고 시도한다. 그들은 특정 작업을 수행하는 컴퓨터의 회로와 같은 구체적이고 재사용 가능한 활동 패턴을 찾는다. 이러한 내부 경로를 매핑함으로써, 과학자들은 추측을 넘어 어떤 뇌 구조의 특정 부분이 특정 생각이나 단어를 담당하는지를 정확히 짚어내기를 희망하며, 이는 이 강력한 도구들이 인간의 가치와 정렬된 상태로 안전하게 유지되도록 하는 데 필수적인 능력이다.

새로운 연구에서, 인도 간디나가르 대학교의 야쉬 프라자파티(Yash Prajapati)라는 연구자는 이러한 내부 회로가 어떻게 형성되는지, 그리고 시스템의 일부가 방해받았을 때 어떻게 반응하는지를 추적하는 방법을 개발했다. 이 연구는 대규모 언어 모델 내에서의 특정 유형의 패턴 인식에 초점을 맞추고 있는데, 여기서 시스템은 이전에 보았던 패턴을 바탕으로 시퀀스의 다음 단어를 예측하는 법을 배운다. 연구자는 단순히 이러한 패턴이 존재한다는 사실뿐만 아니라, 훈련 과정 중 정확히 언제 이 패턴들이 나타나는지, 그리고 해당 패턴을 담당하는 주요 메커니즘이 손상될 경우 시스템이 어떻게 스스로를 보호하는지를 이해하고자 했다. 이를 위해 연구팀은 모델의 발전을 단계별로 조사할 수 있는 프레임워크를 사용하여 사전 훈련 체크포인트를 분석했으며, 내부 기제가 혼란스러운 상태에서 명확하고 구조화된 기능 상태로 전환되는 정확한 순간을 식별해 냈다.

연구진은 50,000회의 최적화 단계에 걸쳐 트랜스포머 체크포인트를 평가하며, 정기적인 간격으로 모델의 내부 상태를 관찰했다. 그들은 처음 수천 단계 동안 모델의 패턴 인식 능력이 약하고 시스템의 여러 부분에 흩어져 있다는 것을 발견했다. 그러나 5,000단계 지점 근처에서 극적인 변화가 일어났다. 모델은 급격한 상전이를 겪었으며, 패턴을 완성하는 능력이 즉각적으로 날카로워졌다. 이 지점 이전에는 모델의 주의력(attention)이 분산되어 넓게 퍼져 있었다. 이 지점 이후에는 초점이 몇 개의 특정하고 매우 효율적인 경로로 응축되었다. 이것은 느리고 점진적인 개선이 아니라 시스템의 내부 구조가 일어난 급격한 재편성이었으며, 이는 모델이 시간이 지남에 따라 단순히 조금씩 나아지는 것이 아니라, 새로운 능력을 습득하기 위해 근본적인 구조적 변화를 겪는다는 것을 시사한다.

이 새로운 회로들이 얼마나 견고한지 테스트하기 위해, 연구진은 패턴 완성을 담당하는 시스템의 주요 부분을 일시적으로 비활성화하는 일련의 실험을 수행했다. 그들은 실질적인 핵심 역할을 수행하는 특정 구성 요소들을 효과적으로 꺼버림으로써 어떤 일이 발생하는지 관찰했다. 회복력이 낮은 시스템이라면 주 엔진을 끄는 것이 전체 프로세스의 실패를 초축하겠지만, 훈련된 이 모델들에서는 시스템이 붕괴되지 않았다. 대신, 이전에 조용했던 다른 부분들이 즉시 투입되어 업무를 인계받았다. 연구진은 이러한 정보 재경로 지정 능력을 측정했으며, 모델이 더 오래 훈련될수록 손상에 대한 보상 능력이 강해진다는 것을 발견했다. 훈련이 끝날 무렵, 시스템은 매우 효과적인 백업 경로를 개발하여 주요 회로를 비활성화하더라도 최종 출력에 거의 영향을 미치지 않았다.

이 발견은 인공지능의 안전을 확보하는 방식에 중요한 시사점을 준다. 안전 연구의 흔한 희망 중 하나는, 만약 모델이 위험하거나 바람직하지 않은 것을 학습한다면, 그 행동을 담당하는 특정 부분만을 제거함으로써 효과적으로 '망각'시킬 수 있다는 것이다. 그러나 이번 연구 결과는 이러한 접근 방식이 불충분할 수 있음을 시사한다. 시스템이 매우 강력한 중복성(redundancy)을 구축하기 때문에, 한 부분을 제거한다고 해서 반드시 그 행동이 멈추는 것은 아니며, 모델은 단지 다른 구성 요소로 작업을 재경로 지정할 뿐이다. 연구진은 새로운 안정성 척도를 통해 이러한 회복력을 정량화했는데, 이는 고도로 훈련된 모델이 주요 회로가 제거되더라도 기능을 유지하는 데 매우 뛰어나다는 것을 보여주었다. 이는 안전 조치가 단일 구성 요소를 겨냥하는 것보다 훨씬 더 포괄적이어야 함을 의미하는데, 시스템이 내부 논리를 보존하도록 적응하도록 설계되어 있기 때문이다.

또한 연구는 이 중요한 회로들이 모델의 아키텍처 내 어디에 위치하는지를 매핑했다. 훈련 초기에는 작업의 책임이 분산되어 있었으나, 연구진은 모델이 성숙해지면서 그 작업이 네트워크의 중간에서 후반부 섹션에 위치한 특정 레이어들에 집중된다는 것을 발견했다. 이러한 집중은 모델이 정보를 전체 시스템을 떠돌게 하는 대신, 전용 채널을 통해 정보가 흐르는 정형화된 파이프라인으로 처리 과정을 조직하는 법을 배웠음을 나타낸다. 이러한 변화를 추적함으로써, 연구진은 머신러닝 모델이 혼란스러운 가중치의 집합체에서 복잡한 추론이 가능한 구조적이고 효율적인 엔진으로 어떻게 진화하는지에 대한 명확한 그림을 제공했다.

궁극적으로, 이 연구는 인공지능의 내부 작동 방식을 감사(audit)하는 새로운 방법을 제시한다. 정보의 흐름을 추적하는 기술과 시스템의 손상에 대한 반응을 테스트하는 방법을 결합함으로써, 연구진은 모델이 무엇을 하는지뿐만 아니라, 어떻게 하는지, 그리고 어떻게 자신의 기능을 보호하는지를 이해할 수 있는 도구 상자를 만들었다. 회로가 형성되는 정확한 순간을 포착하고, 부서진 부분을 우회하여 정보를 재경로 지정하는 능력을 측정하는 능력은 더 안전하고 투명한 AI를 구축하기 위한 구체적인 토대를 제공한다. 이는 추상적인 불투명성에 대한 우려를 넘어, 이러한 시스템을 구동하는 기계적 과정에 대한 정밀한 이해로 대화를 옮겨 놓으며, 모델이 더욱 강력해짐에 따라 그 내부 구조를 이해하고 통제할 수 있도록 보장하는 길을 제시한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →