← 최신 논문
💬 NLP

Tracing Computation Density in LLMs

본 논문은 s-Trace 방법을 소개하여 대규모 언어 모델이 초기 계층의 희소 서브그래프가 얕은 통계에 기반한 대략적인 예측을 제공하고 이후 계층의 더 밀집된 연산이 이를 점진적으로 정제하는 모듈식 2 단계 방식으로 작동하며 필요한 연산량이 모델의 불확실성과 상관관계를 가진다는 것을 밝힌다.

원저자: Corentin Kervadec, Iuliia Lysova, Iuri Macocco, Marco Baroni, Gemma Boleda

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Corentin Kervadec, Iuliia Lysova, Iuri Macocco, Marco Baroni, Gemma Boleda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 백만 명 규모의 오케스트라 (대형 언어 모델) 가 교향곡을 연주한다고 상상해 보세요. 질문을 할 때마다 수십억 명의 음악가들이 동시에 연주를 시작해 답을 만들어냅니다. 모든 음악가가 똑같이 열심히 일하는 것처럼 보이죠, 그렇죠?

이 논문은 단순한 질문을 던집니다: 정말로 그럴까요? 아니면 실제로는 아주 작고 구체적인 음악가 그룹만이 무거운 일을 해내고, 나머지는 그냥 서 있는 것일까요?

저자들은 이를 알아내기 위해 s-Trace라는 새로운 도구를 개발했습니다. s-Trace 는 오케스트라의 일부를 끄고 음악이 여전히 같은지 확인하는 '스포트라이트'라고 생각하세요. 컴퓨터 그래프의 엣지 (edges) 에 해당하는 더 많은 음악가들을 점차적으로 끄면서, 작업을 수행하는 데 정확히 몇 명이 필요한지 파악했습니다.

여기서 그들이 발견한 내용을 간단한 개념으로 나누어 설명합니다:

1. 두 막으로 구성된 연극

저자들은 오케스트라가 직선적으로 작동하지 않는다는 것을 발견했습니다. 대신 음악은 두 가지 뚜렷한 단계로 구축됩니다:

  • 제 1 막: '핵심' 구성 (초안)
    앞줄에 있는 소수의 음악가들 (모델의 초기 레이어) 을 상상해 보세요. 스포트라이트가 매우 어두울 때, 오직 이들만 연주합니다. 놀랍게도, 이들은 이미 다음에 어떤 곡이 나올지 정확히 알 수 있을 정도로 주요 선율을 잘 연주할 수 있습니다.

    • 마법의 숫자: 사실 모델의 전체 구성 요소 중 아주 작은 비율인 **0.1%**만으로도 가장 가능성 높은 다음 단어를 예측할 수 있습니다. 이를 **'최소 핵심 (Minimal Core)'**이라고 부릅니다.
    • 핵심에는 누가 있을까요? 흥미롭게도 이 핵심은 한 가지 유형의 음악가가 아닙니다. 과정의 초기 단계에서 함께 작동하는 다양한 도구 (잔여 연결, MLP, 어텐션 헤드) 의 균형 잡힌 혼합물입니다.
  • 제 2 막: '정제' (마무리)
    주요 선율이 자리 잡으면, 오케스트라의 나머지 부분 (나중 레이어) 이 천천히 합류합니다. 그들은 곡을 바꾸지 않습니다. 대신 화려한 장식, 미묘한 감정, 완벽한 화음을 추가할 뿐입니다.

    • 비용: '충분히 좋은' 상태에서 '완벽한' 상태로 가기 위해서는 훨씬 더 많은 음악가를 켜야 합니다. 답변을 더 정교하게 만들고 싶을수록, 거대한 오케스트라의 더 많은 부분을 활성화해야 합니다. 이 단계에서 모델은 고품질이고 인간다운 응답에 필요한 뉘앙스를 추가합니다.

2. '난이도' 미터

논문은 또한 오케스트라가 항상 동일한 양의 에너지를 사용하지 않는다는 것을 발견했습니다. 작업의 난이도에 맞춰 적응합니다:

  • 쉬운 단어 (높은 빈도): 다음 단어가 "the"나 "and"처럼 매우 흔한 것이라면 오케스트라는 작게 유지됩니다. '최소 핵심'만으로도 충분합니다. 마치 음악가가 단순하고 반복적인 비트를 연주할 때, 전체 밴드가 필요하지 않은 것과 같습니다.
  • 어려운 단어 (낮은 빈도): 다음 단어가 드물거나 까다롭다면 모델은 '불확실해집니다'. 이를 처리하기 위해 모델은 특히 나중 레이어를 포함해 오케스트라의 더 많은 부분을 켜 복잡한 세부 사항을 파악합니다.
  • 연결고리: 모델이 답변에 대해 불확실할수록 더 많은 '음악가'를 모집합니다. 모델이 수행하는 작업의 양은 입력을 추측하는 데 얼마나 어려운지에 직접적으로 연결됩니다.

3. 이것이 중요한 이유 (논문에 따르면)

저자들은 대형 언어 모델이 단순히 거대하고 messy 한 수학의 덩어리가 아니라고 제안합니다. 그들은 모듈식 조직을 가지고 있습니다:

  • 기본 사항 (단순한 패턴 인식 등) 을 처리하는 희소하고 효율적인 핵심이 있습니다.
  • 복잡하고 미묘한 세부 사항을 처리하는 밀집되고 확장된 레이어가 있습니다.

이는 인간이 언어를 처리하는 방식과 유사합니다: 우리는 흔한 단어에 대해서는 빠르고 자동적인 반사를 사용하지만, 드물거나 복잡한 것을 마주치면 뇌의 모든 능력을 동원합니다.

요약 비유

모델을 요리를 하는 셰프라고 생각하세요:

  • 핵심 (0.1%): 이는 셰프가 기본 재료 (밀가루, 물, 소금) 를 집어 섞는 단계입니다. 즉시 그들이 빵을 만들고 있다는 것을 알 수 있습니다.
  • 정제 (나머지): 이는 셰프가 반죽하고, 구우며, 향신료를 넣고, 접시에 담는 단계입니다. 첫 단계 이후 빵은 이미 '빵'이지만, 맛있는 사워도우 빵을 만들기 위해서는 전체 주방과 모든 도구를 사용해야 합니다.

논문의 결론은 많은 작업에서 '셰프'가 무엇을 요리하는지 알기 위해서는 전체 주방이 필요하지 않지만, 그것을 맛있게 만들기 위해서는 전체 주방이 필요하다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →