← 최신 논문
💻 computer science

Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models

이 교차 아키텍처 기계론적 연구는 태스크 회로를 식별하기 위한 통일된 "스크린 앤 어블레이트(screen-and-ablate)" 프로토콜이 서로 다른 1B급 언어 모델들 사이에서 일관되지 않은 인과적 주장을 도출함을 입증하며, 이는 동일한 행동적 능력이 서로 다른 어텐션 패턴 구조를 통해 구현됨을 드러내고, MoE 모델이 복합적인 태스크를 위해 기초적인 이전 토큰 위치 기질에 구체적으로 의존한다는 점을 제안한다.

원저자: Yongzhong Xu

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yongzhong Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세 명의 서로 다른 셰프(AI 모델)가 모두 "간접 목적어 식별(Indirect Object Identification, IOI)"이라는 복잡한 레시피를 완벽하게 익혔다고 상상해 보세요. 여러분은 그들이 이 요리를 어떻게 만드는지 알고 싶습니다. 그들은 같은 도구를 사용하나요? 같은 단계를 따르나요?

이 논문은 세 개의 서로 다른 주방을 찾아가 조사하는 음식 평론가와 같습니다. 평리가는 표준적인 테스트 방법을 사용합니다. 특정 도구(예: 거품기나 칼)를 식별한 뒤, 그것을 제거했을 때 요리가 무너지는지 확인하는 방식입니다.

이 논문의 발견 내용을 쉽게 설명하면 다음과 같습니다.

1. 같은 요리, 다른 레시피

놀라운 사실은 세 셰프 모두 요리를 완벽하게 만들어내지만, 사용하는 도구는 완전히 다르다는 점입니다.

  • 셰프 A (Pythia): "이전 토큰(Previous Token)" 도구를 사용합니다. 이는 방금 집어 든 재료를 보고 다음에 무엇을 할지 결정하는 셰프와 같습니다.
  • 셰프 B (OLMo): "S-억제(S-Inhibition)" 도구를 사용합니다. 이는 메인 재료를 의도적으로 억제하여 부재료가 돋보이게 만드는 셰프와 같습니다.
  • 셰프 C (OLMoE): "이름-이동(Name-Mover)" 도구를 사용합니다. 이는 부재료의 이름을 물리적으로 잡아 앞쪽 접시로 옮기는 셰프와 같습니다.

교훈: 두 모델이 문제를 해결하는 방식(정답을 맞히는 것)이 같다고 해서, 내부적인 "회로"나 메커니즘까지 같다고 단정할 수는 없습니다. 한 AI에서 작동하는 방식이 다른 AI에서도 작동할 것이라고 가정해서는 안 됩니다.

2. "낚시질(Fishing Expedition)" 문제

연구자들은 만약 너무 많은 도구를 시도하다 보면, 우연히 작동하는 것처럼 보이는 도구를 하나 찾아낼 수도 있다는 점을 우려했습니다. 이를 증명하기 위해 그들은 "매칭된 랜덤(Matched Random)" 대조군을 사용했습니다.

이렇게 생각해 보세요: 만약 연구자가 실제 거품기를 제거했는데 케이크가 무너졌다면, 그것은 좋은 결과입니다. 하지만 서랍 속의 무작위 숟가락을 제거했는데도 케이크가 무너졌다면, 거품기가 특별했던 것이 아니라 주방 전체가 원래 취약했던 것입니다. 즉, 거품기가 특별한 역할을 한 게 아니라는 뜻이죠.

논문은 대부분의 작업에서 연구자가 찾아낸 특정 도구를 제거했을 때는 엄청난 붕괴가 일어났지만, 무작위 도구를 제거했을 때는 아무 일도 일어나지 않았음을 보여줍니다. 이는 연구자들이 각 모델의 진짜 "비법 소스"를 찾아냈음을 입증합니다.

3. 다섯 가지 유형의 "도구"

연구진은 도구를 제거했을 때 발생하는 현상을 분류하는 새로운 방법을 만들었습니다. 단순히 "작동한다" 또는 "작동하지 않는다"로 나누는 것이 아닙니다. 그들은 다섯 가지 뚜렷한 결과를 발견했습니다.

  1. 주요 원인 (The Primary Cause): 핵심 엔진입니다. 이것을 제거하면 자동차가 멈춥니다. (예: 셰프 A의 "이전 토큰" 도구)
  2. 보조 원인 (The Secondary Cause): 예비 엔진입니다. 이것을 제거해도 자동차는 계속 달리지만, 덜컹거리게 됩니다.
  3. 상관관계 (The Correlate): 화려한 장식입니다. 엔진실에 있는 것처럼 보이지만, 이것을 제거해도 자동차는 잘 달립니다. 그저 옆에 같이 있었을 뿐입니다.
  4. 방해꾼 (The Interferer): 사보타주를 하는 존재입니다. 이것을 제거하면 자동차가 오히려 더 잘 달립니다. 한 사례에서는 연구자들이 AI의 성능을 실제로 저해하는 도구를 발견했고, 그것을 제거하자 문제가 해결되었습니다.
  5. 무효 (The Null): 아무것도 하지 않는 도구입니다. 이것을 제거해도 변화가 없습니다.

4. "MoE"의 미스터리 (특별한 사례)

한 명의 셰프(OLMoE)는 "전문가 혼합(Mixture of Experts, MoE)" 모델입니다. 이 셰프에게 64명의 전문가 팀이 있지만, 한 번에 8명만 요리할 수 있다고 상상해 보세요.

연구진은 이 셰프에게서 이상한 패턴을 발견했습니다.

  • 네 가지 레시피 중 세 가지에서, 이 셰프는 기초로서 "이전 토큰" 도구에 크게 의존했습니다. 이는 마치 셰프의 주방 전체가 마지막 아이템을 앞으로 전달하는 컨베이어 벨트 위에 구축된 것과 같습니다.
  • 하지만 "간접 목적어" 레시피에 대해서는, 이 셰프는 "이름-이동" 도구로 전환했습니다.

가설: 논문은 이 특정 유형의 AI(MoE)에 대해, "이전 토큰" 도구가 모든 것을 지탱하는 기본 "골격" 또는 "백본(backbone)"이라고 제안합니다. AI는 이 단순한 백본 위에 복잡한 작업을 구축하지만, 특정 종류의 주의력(예: 마지막에 이름을 복사하는 것)이 필요한 경우에는 예외입니다.

5. "Top-1" 정확도만으로는 부족한 이유

논문은 또한 단순히 AI가 "정답을 맞혔는지"(Top-1 정확도)만 보는 것이 오해를 불러일으킬 수 있다고 경고합니다.

때때로, 도구를 제거해도 최종 정답은 바뀌지 않지만, AI의 확신(Confidence)이 떨어질 수 있습니다. 이는 마치 학생이 수학 문제를 여전히 맞히긴 하지만, 글씨체가 흔들리고 망설이는 것과 같습니다. 정답만 체크한다면, 학생이 어려움을 겪고 있다는 사실을 놓치게 됩니다. 연구진은 일부 모델의 경우, 정답은 유지되더라도 "마진(정답과 오답 사이의 격차)"이 줄어든다는 것을 발견했습니다.

요약

  • 레시피는 작동하지만, 도구는 다릅니다: 한 AI의 "메커니즘"을 다른 AI에 복사해서 붙여넣을 수 없습니다. 그들은 같은 문제를 해결하지만, 서로 다른 내부 기어를 사용합니다.
  • "사보타주"를 주의하세요: 때로는 도움이 된다고 생각한 부분이 오히려 해가 될 수도 있습니다.
  • MoE 모델은 독특합니다: "전문가"를 가진 모델(MoE)은 대부분의 작업에서 특정 "이전 토큰" 백본에 의존하는 것으로 보이며, 이는 새로운 발견입니다.
  • 더 깊이 들여다보세요: AI가 맞았는지 확인하는 데 그치지 말고, 얼마나 확신하는지도 확인해야 합니다. "확신" 속에 진짜 이야기가 있을 수 있기 때문입니다.

결론적으로, 이 논문은 우리가 이러한 "회로(레시피)"를 찾는 훌륭한 방법을 가지고 있지만, 그 회로가 서로 다른 모델 간에 동일하다고 가정해서는 안 된다고 결론짓습니다. 모든 모델은 고유한 내부 논리를 가진 독특한 기계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →