← 최신 논문
💬 NLP

Architecture, Not Scale: Circuit Localization in Large Language Models

본 논문은 기계적 해석 가능성이 모델 규모가 커질수록 본질적으로 악화된다는 가정에 도전하여, 대신 그룹화 쿼리 어텐션과 같은 아키텍처 선택과 특정 스케일링 임계값이 대규모 언어 모델에서 더 집중적이고 안정적인 회로 국소화를 이끈다는 것을 보여줍니다.

원저자: Sohan Venkatesh

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sohan Venkatesh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 복잡한 기계가 어떻게 작동하는지 이해하려고 상상해 보세요. 오랫동안 연구자들은 이러한 기계들 (대형 언어 모델) 이 커지고 강력해질수록 분해하고 이해하는 것이 불가능해질 것이라고 믿었습니다. 그 생각은 다음과 같았습니다. "기계가 클수록 배선이 더 엉키고 지저분해진다."

이 논문은 그 아이디어에 도전합니다. 연구자들은 기계가 어떻게 만들어졌는지가 그 크기가 얼마나 큰지보다 훨씬 더 중요하다고 제안합니다.

다음은 일상적인 비유를 사용하여 연구자들이 발견한 내용을 간단히 정리한 것입니다:

1. 두 가지 유형의 기계

연구자들은 두 가지 다른 AI 모델 계열을 비교했습니다:

  • "표준" 팀 (Pythia): 이 모델들은 **멀티헤드 어텐션 (MHA)**이라는 설계를 사용합니다. 이는 각 직원 (헤드) 이 독립적인 전화선과 자신만의 특정 파일 캐비닛을 가진 큰 사무실과 같다고 상상해 보세요. 그들은 모두 함께 일하지만, 자원을 실제로 공유하지는 않습니다.
  • "그룹화" 팀 (Qwen2.5): 이 모델들은 **그룹화 쿼리 어텐션 (GQA)**이라는 설계를 사용합니다. 이는 직원이 작은 팀으로 조직된 현대적인 사무실과 같습니다. 여러 직원이 동일한 전화선과 동일한 파일 캐비닛을 공유합니다. 그들은 문자 그대로 동일한 도구를 공유하기 때문에 밀접하게 협력하도록 강요받습니다.

2. 실험: "비밀 스위치" 찾기

연구자들은 다음과 같은 특정 작업을 수행하게 만드는 모델 내부의 특정 "스위치"(회로) 를 찾을 수 있는지 확인하고자 했습니다:

  • 간접 목적어 식별: 문장에서 누가 물건을 받았는지 파악하기 (예: "존이 메리에게 망고를 주었다").
  • 유도: 패턴을 발견하기 (예: "A, B, A"를 보면 다음 글자가 "B"일 것이라고 예측하기).
  • 사실 회상: 사실을 기억하기 (예: "프랑스의 수도는...").

그들은 작고 매우 큰 다양한 크기의 모델을 테스트했습니다.

3. 큰 발견: 크기는 중요하지 않고 설계가 중요하다

일반적인 믿음은 더 큰 모델의 "스위치"가 수백 명의 직원에게 퍼져 있어 격리하는 것이 불가능할 것이라는 것이었습니다.

그들이 실제로 발견한 것:

  • 표준 팀 (MHA): 모델이 얼마나 커졌든 상관없이 "스위치"는 지저분하고 퍼져 있었습니다. 작업을 중단하려면 수십 개, 심지어 수백 개의 곳에서 전선을 잘라야 하는 경우가 많았습니다. 거대한 경기장에서 무작위로 스피커를 뽑아 노래를 멈추려는 것과 같았습니다. 거의 모든 스피커를 뽑아야 음악을 침묵시킬 수 있었습니다.
  • 그룹화 팀 (GQA): 이 모델들은 놀라울 정도로 깔끔했습니다. 수십억 개의 파라미터를 가진 거대한 모델조차 "스위치"가 단 한두 곳에만 집중되어 있었습니다.
    • 비유: GQA 모델에서는 직원들이 단일 파일 캐비닛 (KV 헤드) 을 공유하기 때문에, 그 하나의 파일 캐비닛을 뽑아내면 전체 팀이 작동을 멈춥니다. "스위치"는 단일한 치명적인 병목 지점입니다.

4. 안정성: "단단한 바위" 대 "요동치는"

연구자들은 또한 이러한 스위치의 신뢰성에서 차이를 발견했습니다:

  • 표준 팀: "스위치"는 작업의 난이도에 따라 움직였습니다. 문장이 쉬우면 한 세트의 직원이 작업을 수행했고, 어렵다면 다른 세트가 인계했습니다. 이는 모델이 무엇을 하고 있는지 모니터링하거나 예측하기 어렵게 만듭니다.
  • 그룹화 팀: "스위치"는 작업이 얼마나 어렵든 정확히 같은 위치에 머물렀습니다. 이는 "기계적으로 안정적"이었습니다. 파티를 위해 전등을 켜든 책을 읽기 위해 켜든 상관없이 전등을 제어하는 단일하고 움직이지 않는 마스터 스위치를 가진 것과 같습니다.

5. "상전이" 놀라움

그룹화 팀과 관련하여 한 가지 더 흥미로운 발견이 있었습니다. 연구자들은 다양한 크기의 모델을 살펴보다가 "전환점"을 발견했습니다.

  • 가장 작은 그룹화 모델은 표준 팀처럼 약간 지저분했습니다.
  • 그러나 모델이 약간 더 커지는 순간, 갑자기 초집중 상태로 snap 되었습니다. "스위치"는 단일한 특정 위치로 이동하여 그곳에 머물렀습니다. 이는 서서히 점진적으로 변하는 것이 아니라 전등 스위치를 튕기는 것과 같았습니다.

결론

이 논문은 아키텍처 (청사진) 가 규모 (크기) 보다 더 중요하다고 결론지었습니다.

모델이 거대하다고 해서 설명 불가능한 것은 아닙니다. "그룹화" 설계 (GQA) 로 구축된 경우, "표준" 설계 (MHA) 로 구축된 작은 모델보다 실제로 이해하고 분해하기가 더 쉽습니다. 연구자들은 현재 사용 중인 가장 크고 강력한 AI 모델 중 많은 수가 이미 이 "그룹화" 설계를 사용하고 있기 때문에, 우리가 previously 생각했던 것보다 훨씬 더 투명하고 연구하기 쉬울 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →