← 최신 논문
🤖 machine learning

Task Structure Reverses Layerwise State Encoding in Sequence Models

이 논문은 시퀀스 모델에서 상태 인코딩의 계층별 분포가 고정된 구조적 특성이 아니라 작업의 계산 구조에 따라 역전된다는 점을 입증하며, 교환법칙과 같은 대수적 성질이 접두사 업데이트(prefix updates) 대 스택 연산(stack operations)과 같은 기저의 계산 요구 사항보다 메커니즘적 시그니처를 예측하는 데 있어 덜 유효하다는 것을 밝혀낸다.

원저자: Yuhang Jiang

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuhang Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 서로 다른 종류의 "생각하는 기계"(AI 모델)들이 이야기를 읽을 때 정보를 어떻게 추적하는지 이해하려고 노력하고 있다고 상상해 보세요. 오랫동안 연구자들은 기계의 "사고 방식"이 사람의 성격처럼 고정되어 있다고 믿었습니다. 그들은 다음과 같이 믿었습니다:

  • 트랜스포머(Transformers) (현재의 표준 AI)는 자신의 생각들을 전체 뇌 전체에 고르게 퍼뜨린다.
  • 순환 모델(Recurrent models) (과거의 루프 기반 AI)은 자신의 주요 생각들을 뇌의 아주 마지막 부분에 숨겨둔다.

이 논문은 이렇게 말합니다: "잠깐만요, 그렇지 않습니다."

저자들은 이 기계들이 고정된 성격을 가지고 있지 않다는 것을 발견했습니다. 대신, 그들은 어떤 일을 하고 있는지에 따라 생각을 조직하는 방식을 바꿉니다. 이것은 마치 채소를 다질 때와 생선을 손질할 때 서로 다른 칼을 사용하는 요리사와 같습니다. 도구는 요리사의 정체성이 아니라 작업에 따라 변합니다.

다음은 쉬운 비유를 사용한 이들의 발견에 대한 분석입니다:

1. 두 가지 유형의 작업

연구자들은 기계들에게 세 가지 서로 다른 퍼즐을 풀게 했습니다:

  • "누적 합계" 작업 (Parity & S3): 동전을 몇 번 던졌는지 세는 것과 같습니다. 당신은 현재의 개수(0 또는 1)를 기억하고 진행하면서 이를 업데이트하기만 하면 됩니다. 이것은 단순하고 선형적인 업데이트입니다.
  • "스택(Stack)" 작업 (Dyck): 문장에 괄호가 균형 있게 배치되었는지((( ))와 같이) 확인하는 것과 같습니다. 단순히 숫자를 세는 것이 아니라, 어떤 여는 괄호가 어떤 닫는 괄호와 짝이 맞는지 기억해야 합니다. 중첩 구조를 추적하기 위해 정신적인 "스택"(접시 더미와 같은 것)을 쌓아야 합니다.

2. 거대한 역전

논문은 기계들이 작업에 따라 전략을 뒤집는다는 것을 발견했습니다:

  • "누적 합계" 작업에서:

    • **순환 모델(Mamba와 같은 모델)**은 비밀 유지자처럼 행동합니다. 초반에 많은 작업을 수행하지만, 최종 답안은 뇌의 맨 마지막 층에서야 명확해집니다. 이는 마치 마술사가 그림자 속에서 모든 손기술을 부린 뒤, 마지막 순간에 트릭을 공개하는 것과 같습니다.
    • 트랜스포머는 **팀 회의(Team huddle)**처럼 행동합니다. 시작부터 끝까지 층(layer)을 거치며 점진적으로 답을 만들어 나갑니다. 모두가 과정 중에 조금씩 기여합니다.
  • "스택" 작업에서:

    • 역할이 뒤바뀝니다!
    • 트랜스포머는 갑자기 비밀 유지자가 됩니다. 초반 몇 개의 층에서 답을 거의 즉시 파악한 뒤, 그것을 계속 붙잡고 있습니다.
    • 순환 모델팀 회의가 됩니다. 답을 맞히기 위해 층을 거치며 천천히 해결책을 구축해야 합니다.

핵심 요점: "트랜스포머는 항상 정보를 퍼뜨린다"거나 "Mamba는 항상 정보를 숨긴다"라고 말할 수 없습니다. 전략은 작업이 단순한 업데이트인지 아니면 복 복잡한 스택인지에 따라 달라집니다.

3. "비가환성(Non-Commutative)" 테스트 (S3 퍼즐)

이것이 단순히 수학적 규칙(더하기에서 순서가 중요한지 여부 등) 때문이 아님을 증명하기 위해, 그들은 S3라고 불리는 더 까다로운 세 번째 퍼즐을 추가했습니다. 이것은 순서가 중요하게 작용하는(양말을 신기 전에 신발을 신는 것은 신발을 신기 전에 양말을 신는 것과 다르듯이) "누적 합계" 작업이었습니다.

  • 예측: 만약 차이점이 단순히 수학적 규칙(순서의 중요성) 때문이라면, 이 까다로운 작업은 "스택" 작업과 비슷하게 보여야 합니다.
  • 현실: 기계들은 이 까다로운 작업을 기존의 "누적 합계" 작업과 똑같이 취급했습니다. 즉, 동일한 "비밀 유지자" 또는 "팀 회의" 전략을 사용했습니다.
  • 결론: 기계들은 수학적 규칙에 반응하는 것이 아니라, 계산 구조(단순한 업데이트인가 아니면 복잡한 스택인가?)에 반응하고 있는 것입니다.

4. "읽을 수 있는(Readable)" 층 vs "중요한(Important)" 층의 함정

연구자들은 또한 정보가 어디에 저장되는지도 살펴보았습니다. 그들은 특히 규모가 큰 사전 학습된 모델에서 놀라운 불일치를 발견했습니다:

  • "읽을 수 있는" 층: 이것은 기계의 뇌에서 답을 쉽게 "읽어낼" 수 있는 곳입니다(마치 포스트잇에 답이 적혀 있는 것을 찾는 것과 같습니다).
  • "중요한" 층: 이것은 만약 이 부분을 망가뜨린다면 기계를 실패하게 만들 핵심적인 부분입니다.

발견된 사실:

  • 작고 단순한 모델에서는 "읽을 수 있는" 층과 "중요한" 층이 보통 일치합니다.
  • 규모가 큰 사전 학습된 모델에서는 이 둘이 일치하지 않는 경우가 많습니다.
    • 예시: "스택" 작업에서, 큰 모델은 뇌의 중간 부분(7번 층)에 답이 포스트잇처럼 명확하게 적혀 있을 수 있지만, 뇌의 끝부분(11번 층)을 망가뜨려도 모델은 여전히 잘 작동합니다. 그러나 중간 부분을 망가뜨리면 모델은 충돌합니다.
    • 예시: "누적 합계" 작업에서, 답이 맨 마지막에 명확히 보일 수 있지만, 그 특정 지점을 망가뜨린다고 해서 모델이 작동을 멈추지는 않습니다. 왜냐하면 정보가 다른 곳곳에 널리 퍼져 있기 때문입니다.

교훈: 특정 부분에서 답을 볼 수 있다고 해서, 그 부분이 기계를 유지하는 유일한 곳이라고 단정 지어서는 안 됩니다. 기계는 정보를 여러 곳에 동시에 담아두고 있을 수도 있습니다.

요약

이 논문은 AI 아키텍처가 경직되어 있지 않다는 것을 가르쳐 줍니다. 그것들은 유연합니다.

  1. 작업이 중요합니다: 기계의 내부 전략은 단순한 업데이트를 하는지 아니면 복잡한 스택을 다루는지에 따라 변합니다.
  2. 구조가 중요합니다: 문제의 "모양"(업데이트 vs 스택)이 수학적 규칙보다 전략을 결정합니다.
  3. 가시성 \neq 필수성: 모델의 어디에 답이 "적혀" 있는지 찾는 것이 반드시 그 모델이 가장 취약한 지점을 알려주는 것은 아닙니다.

저자들은 우리가 단순히 "이 AI는 어떻게 작동하는가?"라고 물어서는 안 된다고 결론짓습니다. 우리는 **"이 AI는 '이 특정 작업'에 대해 어떻게 작동하는가?"**라고 물어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →