← 최신 논문
💬 NLP

Localizing Anchoring Pathways in Language Models

이 논문은 7B–8B 규모의 Qwen 및 Llama 모델에서 앵커링 효과의 내부 메커니즘을 조사하여, 엣지 수준의 기여도 산출 방식이 노드 수준의 방식보다 관련 결정 신호를 더 정확하게 국소화한다는 점과 이러한 경로가 모델 내의 앵커 방향에 따라서는 일관되지만 베이스 모델과 인스트럭션 튜닝된 변체 사이에서는 크게 변화한다는 점을 밝혀냈다.

원저자: Hillary N. Owusu, Sarah Wiegreffe, Naomi H. Feldman

게시일 2026-06-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hillary N. Owusu, Sarah Wiegreffe, Naomi H. Feldman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 아주 똑똑하지만 약간은 잘 속는 탐정이라고 상상해 보세요. 당신이 탐정에게 수수께끼를 내면서도, 대화 속에 무관하고 상관없는 숫자 하나를 슬쩍 끼워 넣습니다. 예를 들어, "그나저나 로또 번호가 15에서 멈췄어"라고 말한 뒤, "달이 지구를 한 바퀴 도는 데 며칠이 걸리지?"라고 묻는 식입니다.

비록 탐정은 정답이 27일이라는 것을 알고 있지만, 방금 언급된 무작위 숫자 '15' 때문에 정답이 15 쪽으로 기울어질 수 있습니다. 이것을 **앵커링(Anchoring, 닻 내리기)**이라고 합니다. 이는 무관한 숫자가 당신의 판단을 그 숫자 쪽으로 끌어당기는 인지적 편향을 의미합니다.

이 논문은 마치 기계 공학자 팀이 그 탐정을 분해하여, 그 "잘 속는 성질"이 정확히 뇌의 어느 부분에서 발생하는지 파헤치는 것과 같습니다. 그들은 컴퓨터 내부의 어떤 구체적인 전선과 스위치가 "이봐, 저 무작위 숫자가 중요해!"라고 말하는 신호를 전달하고 있는지 알고 싶어 합니다.

연구진이 어떻게 이 작업을 수행했는지, 그리고 무엇을 발견했는지 쉽게 설명해 드리겠습니다.

1. 설정: 통제된 게임

연구진은 모델에게 긴 에세이를 쓰게 하는 대신, 테스트를 객관식 게임으로 바꾸었습니다.

  • 질문: "달의 궤도 주기는 얼마인가요?" (정답: 27일).
  • 함정: 그들은 문장에 무작위 숫자가 포함된 문장을 추가했습니다. 이때 "낮은 앵커"(15) 또는 "높은 앵커"(49)를 사용했습니다.
  • 목표: 단지 그 숫자가 언급되었다는 이유만으로 모델의 확신이 잘못된 답(15 또는 49) 쪽으로 얼마나 이동하는지를 측정했습니다.

연구진은 모델이 인간처럼 실제로 속아 넘어간다는 것을 확인했습니다.

2. 방법: 전선을 추적하기

"잘 속는 회로"를 찾기 위해 연구진은 **회로 국소화(Circuit Localization)**라는 기술을 사용했습니다.

  • 비유: 모델을 노드(neighborhood, 구역)들을 연결하는 수백만 개의 도로(edges, 간선)로 이루어진 거대한 도시라고 상상해 보세요.
  • 기존 방식: 과거의 연구자들은 교통량이 많은 곳을 찾기 위해 전체 구역(노드)을 살펴보았습니다.
  • 새로운 방식: 이번 논문은 **개별 도로(간선)**를 살펴보는 것이 훨씬 더 낫다는 것을 발견했습니다. 이는 문제가 '다운타운'이라는 구역 전체에 있는 것이 아니라, 특정하게 '다운타운과 교외를 잇는 바로 그 다리 하나'에 있다는 것을 깨닫는 것과 같습니다.

그들은 **간선 수준의 방법(edge-level methods, 연결 관계를 보는 것)**이 노드 수준의 방법(구성 요소 자체를 보는 것)보다 편향을 찾는 데 훨씬 더 정확하다는 것을 발견했습니다. "잘 속는 성질"은 모델의 특정 부위에 박혀 있는 것이 아니라, 정보가 이동하는 **경로(pathway)**에 들어있었습니다.

3. 발견: 지도가 밝혀낸 것

A. "낮은" 앵커와 "높은" 앵커는 같은 도로를 사용합니다

모델이 낮은 숫자(15)에 속든 높은 숫자(49)에 속든, 교통량은 거의 동일한 도로를 통해 흘러갔습니다.

  • 비유: 이것은 강물과 같습니다. 물이 빠르게 흐르든(높은 앵커) 느리게 흐르든(낮은 앵커), 여전히 같은 강바닥을 이용합니다. 모델은 숫자의 크기와 상관없이 영향을 받기 쉬운 공유된 "취약성 경로(susceptibility pathway)"를 가지고 있습니다.

B. "베이스(Base)" 모델 vs "지시 미세 조정(Instruction-Tuned)" 모델

연구진은 동일한 모델의 두 가지 버전을 테스트했습니다:

  1. 베이스 모델: 훈련되지 않은 가공되지 않은 상태의 탐정.
  2. 지시 미세 조정 모델: 규칙을 따르고 예의 바르게 질문에 답하도록 훈련된 탐정.

놀라운 점: 두 모델 모두 동일한 일반적인 "강바닥"(동일한 네트워크 층)을 사용하지만, 가장 중요한 구체적인 도로는 훈련 후에 변했습니다.

  • 비유: 운전자에게 새로운 경로를 가르친다고 상상해 보세요. 그들은 여전히 같은 도시를 통과하여 운전하지만, 목적지에 도달하기 위해 타는 구체적인 거리들은 바뀌었습니다. "지시 미사 조정(instruction tuning)" 과정은 가장 중요한 연결 고리들을 재배선했습니다. 베이스 모델에서 완벽하게 작동했던 회로가 훈련된 모델에서는 항상 작동하는 것은 아니었습니다.

4. 큰 그림

이 논문은 앵커링이 단순히 모델 지식의 "결함"이 아님을 증명합니다. 그것은 무관한 숫자가 모델의 의사 결정 경로를 가로채는 구체적이고 기계적인 과정입니다.

  • 핵심 요점: 편향은 단순히 고립된 부분이 아니라 **연결(간선, edges)**을 통해 이동합니다.
  • 핵심 요점: 낮거나 높은 앵커는 동일한 "고속도로"를 공유하지만, 모델에게 새로운 규칙을 가르치는 것(지시 미세 조정)은 그 고속도로의 어떤 출구가 가장 중요한지를 변화시킵니다.

요약하자면, 연구진은 AI 내부의 "잘 속는 성질"을 지도화하여, 모델이 무작위 숫자에 의해 주의가 분산될 때 어떤 전선이 신호를 전달하는지 정확히 보여주었습니다. 이는 모델이 단순히 "틀린" 것이 아니라, 자신을 잘못된 길로 인도하는 특정한, 예측 가능한 경로를 따르고 있음을 이해하는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →