← 최신 논문
💬 NLP

Correcting Gradient-Based Circuit Localization via Interaction-Aware Backpropagation

이 논문은 어텐션 자기 수복(attention self-repair)과 같은 구성 요소 간의 상호작용을 무시함으로써 발생하는 회로 국소화의 체계적 오측정을 교정하여, 대규모 언어 모델에서 특정 행동을 담당하는 모델 구성 요소를 식별하는 데 있어 최첨단 성능을 달성하는 새로운 기술인 기울기 상호작용 수정(Gradient Interaction Modifications, GIM)을 소개한다.

원저자: Joakim Edin, Casper L. Christensen, Róbert Csordás, Tuukka Ruotsalo, Zhengxuan Wu, Maria Maistro, Jing Huang, Lars Maaløe

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Joakim Edin, Casper L. Christensen, Róbert Csordás, Tuukka Ruotsalo, Zhengxuan Wu, Maria Maistro, Jing Huang, Lars Maaløe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 수천 명의 요리사(뉴런과 어텐션 헤드)가 하나의 요리(모델의 답변)를 만들기 위해 함께 협력하는 거대하고 북적이는 주방이라고 상상해 보십시오. 오랫동안 과학자들은 이 모델들이 어떻게 작동하는지 이해하기 위해 "회로 국소화(circuit localization)"라는 방법을 사용해 왔습니다. 그들의 목표는 어떤 요리사가 요리의 맛을 책임지는지를 알아내는 것이었습니다.

기존 방식: "한 번에 하나씩"의 실수
전통적으로 연구자들은 요리사를 한 명씩 해고함으로써 중요한 요리사를 식별하려고 시도했습니다. 그들은 이렇게 말하곤 했습니다. "요리사 A를 오늘 하루 쉬게 해보고 수프의 맛이 변하는지 봅시다." 만약 수프의 맛이 그대로라면, 그들은 요리사 A가 중요하지 않았다고 가정했습니다.

문제는 이 요리사들이 고립되어 일하는 것이 아니라, 서로 대화하며 서로의 빈자리를 채워준다는 점입니다. 만약 요리사 A가 양파를 써는 데 달인이지만, 바로 옆에 있는 요리사 B 역시 양파 써는 데 달인이라면, 요리사 A를 집으로 돌려보내도 수프에는 변화가 없을 것입니다. 요리사 B가 즉시 칼을 집어 들고 계속 양파를 썰 것이기 때문입니다. 연구자들은 변화를 감지하지 못하고, 요리사 A가 쓸모없었다고 잘못 결론 내립니다.

새로운 발견: "어텐션 자기 복구(Attention Self-Repair)"
저자들은 AI에서 이러한 "서로를 보완하는 방식"이 발생하는 구체적인 방식을 발견했으며, 이를 **어텐션 자기 복구(Attention Self-Repair)**라고 부릅니다.

AI의 어텐션 메커니즘을 극장의 스포트라이트 조명 기사라고 생각해 보십시오. 조명 기사(모델)는 어떤 배우(단어)에게 밝은 빛을 비출지 결정합니다. 때때로 두 명의 배우가 같은 자리에 서서 똑같은 말을 할 때가 있습니다. 이때 조명 기사는 빛을 50/50으로 나눕니다.

만약 당신이 배우 A에게 비추는 빛을 줄여서 그가 얼마나 중요한지 확인하려 한다면, 조명 기사는 즉시 그 남는 빛을 배우 B에게 옮깁니다. 배우 B가 똑같은 말을 하고 있기 때문에, 관객(모델)은 아무런 차이를 느끼지 못합니다. "그래디언트(gradient, 누가 중요한지 알려주는 신호)"가 사라져 버리는 것입니다. 이는 마치 두 배우 모두 중요하지 않았던 것처럼 보이게 만듭니다. 하지만 실제로는 둘 다 매우 중요했습니다. 단지 백업 플랜이 있었을 뿐입니다.

해결책: GIM (Gradient Interaction Modifications)
이 문제를 해결하기 위해 저자들은 팀워크를 고려하여 게임의 규칙을 바꾸는 새로운 도구인 GIM을 만들었습니다. GIM은 세 가지 영리한 기술을 사용합니다.

  1. "따뜻한 스포트라이트" (Temperature-adjusted Softmax):
    조명 기사가 보통 매우 엄격해서 상위 배우에게 90%의 빛을 주고 나머지에게 10%를 준다고 가정해 봅시다. GIM은 조명 기사에게 조금 더 여유를 갖도록(온도를 높이도록) 지시합니다. 이제 빛은 더 고르게 퍼집니다. 이렇게 하면 한 명의 빛을 줄이더라도 다른 이들이 즉각적으로 독점하지 못하게 됩니다(이미 빛이 넓게 공유되었기 때문입니다). 이를 통해 누군가가 도움을 받았더라도 실제로 누가 빛을 쥐고 있었는지를 드러낼 수 있습니다.

  2. "볼륨 조절 노브" 동결 (Layernorm Freeze):
    주방에는 방 전체의 소음 크기를 조절하는 마스터 볼륨 노브가 있습니다. 만약 한 명의 요리사가 일을 멈추면, 볼륨 노브가 자동으로 돌아가서 다른 이들의 소리를 키워 일정한 소음 수준을 유지합니다. 이는 요리사가 떠난 사실을 숨겨버립니다. GIM은 이 볼륨 노브를 "동결"시킵니다. 따라서 요리사가 떠났을 때 다른 이들이 인위적으로 더 크게 들리지 않도록 합니다. 이를 통해 연구자들은 요리사가 떠남으로써 발생하는 실제 소리의 감소를 관찰할 수 있습니다.

  3. "공유 도구" 보정 (Gradient Norm):
    때때로 두 명의 요리사가 같은 도구(예: 공유된 칼)를 사용하여 재료를 썹니다. 만약 칼이 얼마나 사용되었는지 측정한다면, 실수로 동일한 동작을 두 번 계산(두 요리사 각각에게 한 번씩)할 수 있습니다. GIM은 이 수학적 오류를 수정하여 공로를 정확하게 나누고, 동일한 행동에 대해 중복 계산되지 않도록 보장합니다.

결과
저자들이 다양한 AI 모델과 작업(수학 문제 풀기나 질문 답변 등)에 GIM을 테스트했을 때, GIM은 기존 방식보다 훨씬 더 뛰어난 성능을 보였습니다.

  • GIM은 기존 방식이 놓쳤던 모델의 "진짜" 중요한 부분들을 찾아냈습니다.
  • GIM은 기존 방식이 "자기 복구"라는 팀워크를 이해하지 못했기 때문에, 특정 부분의 중요성을 체계적으로 과소평가해 왔음을 증명했습니다.

요약
이 논문은 우리가 복잡한 AI 모델의 구성 요소를 개별적으로 관찰함으로써 이해할 수 없다고 주장합니다. 각 부분이 서로를 돕기 때문에, 하나를 제거한다고 해서 그 진정한 가치가 드러나지 않기 때문입니다. GIM은 이러한 팀워크를 고려하여 모델을 바라보는 새로운 방식이며, 이를 통해 우리는 디지털 두뇌가 실제로 어떻게 생각하는지에 대한 훨씬 더 정확한 지도를 얻을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →