← 최신 논문
🤖 AI

Finding Interpretable Prompt-Specific Circuits in Language Models

본 논문은 단일 순전파에서 해석 가능하고 프롬프트별 주의 회로를 추출하여 언어 모델이 간접 목적어 식별과 같은 과제를 다양한 언어적 맥락에서 해결하기 위해 어떻게 고유하고 언어에 의존적인 신호를 활용하는지를 밝히는 개선된 회로 추적 방법인 ACC++를 소개한다.

원저자: Gabriel Franco, Lucas M. Tassis, Azalea Rohr, Mark Crovella

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gabriel Franco, Lucas M. Tassis, Azalea Rohr, Mark Crovella

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 언어 모델 (LLM) 을 상상해 보세요. 수백만 명의 작은 작업자 (뉴런) 들이 서로 쪽지를 주고받으며 질문에 답하는 활기찬 대도시입니다. 오랫동안 우리는 도시가 만들어낸 결과물 (답변) 은 볼 수 있었지만, 작업자들이 어떻게 그 쪽지들을 보내기로 결정했는지는 알 수 없었습니다. 마치 마술 쇼를 보면서도 그 비법을 모르는 것과 같았습니다.

이 논문은 이러한 모델들을 위한 고도의 "X 선 시력"과 같은 새로운 도구인 **ACC++**를 소개합니다. 이는 단순히 추측하는 것이 아니라, 특정 문제를 해결하기 위해 모델 내에서 정보가 흐르는 정확한 경로를 추적합니다.

다음은 이 논문이 무엇을 하고 무엇을 발견했는지에 대한 간단한 요약입니다:

1. 문제: "블랙박스" 도시

모델이 "메리와 존이 가게에 갔을 때, 존은 병을 ...에게 주었다"와 같은 프롬프트에 답할 때, 정답이 "메리"임을 파악해야 합니다.

  • 이전 방식: 연구자들은 작업자들을 하나씩 켜고 끄며 (집의 퓨즈를 뽑아 어떤 전등이 꺼지는지 확인하듯이) 어떤 작업자들이 관여했는지 파악하려 했습니다. 이는 느리고 번거로웠으며, 종종 너무 많은 "오경보"가 포함된 흐릿한 그림을 제공했습니다.
  • 새로운 도구 (ACC++): 퓨즈를 뽑는 대신, ACC++ 는 작업자들 사이의 "속삭임"을 듣습니다. 이는 의사결정에 필요한 핵심 정보를 운반하는 특정 저음역 채널 ( 신호라고 함) 을 식별합니다.

2. ACC++ 의 작동 원리: "신호 탐정"

모델의 어텐션 메커니즘 (무엇에 집중할지 결정하는 부분) 을 라디오 방송국으로 생각해 보세요.

  • 이전 방법: 방송을 하고 있는 전체 라디오 타워를 찾으려 했습니다.
  • ACC++: 그 라디오 타워에서 정확히 어떤 주파수 (특정 신호) 로, 그 주파수에서 정확히 어떤 마이크 (작업자) 가 말하고 있는지 확대하여 찾아냅니다.
  • 마법 같은 점: 이는 단 한 번의 통과로 즉시 수행됩니다. 노이즈를 제거하여 정확히 어떤 작업자가 누구와 무엇을 말했는지를 보여주는 깔끔하고 단순한 지도를 남깁니다.

3. 주요 발견: "프롬프트별" 청사진

가장 흥미로운 발견은 모델이 모든 질문에 대해 동일한 청사진을 사용하지 않는다는 것입니다. 질문하는 방식에 따라 전략을 변경합니다.

"이름 게임" 비유 (IOI 작업):
연구자들은 모델로 하여금 "[이름 A] 와 [이름 B] 가 가게에 갔을 때, [이름 B] 는 [이름 A] 에게 선물을 주었다"는 게임을 하도록 테스트했습니다. 모델은 이름 A 를 선택해야 합니다.

  • 시나리오 A: "메리이 가게에 갔을 때..." (메리가 먼저).
  • 시나리오 B: "메리가 가게에 갔을 때..." (존이 먼저).

논문에 따르면, 모델은 두 시나리오에서 완전히 다른 내부 회로를 사용하며, 비록 과제는 동일하더라도 그렇습니다.

  • 한 경우에는 모델이 "두 번째 항목" 탐지기를 사용합니다.
  • 다른 경우에는 "구조적 패턴" 탐지기를 사용합니다.
  • 교훈: 모델은 유연합니다. 다양한 전략이 담긴 도구 상자를 가지고 있으며, 프롬프트의 정확한 문구에 따라 올바른 것을 선택합니다.

4. 다국어 미스터리: 같은 작업자, 다른 언어

연구자들은 영어, 스페인어, 프랑스어, 포르투갈어 등 다양한 언어로 모델을 테스트했습니다.

  • 발견: 모델은 모든 언어에서 문제를 해결하기 위해 동일한 작업자 그룹 (동일한 내부 구성 요소) 을 사용합니다.
  • 반전: 그러나, 그 작업자들이 서로에게 전달하는 메시지 (신호) 는 언어별로 다릅니다.
  • 비유: 건설 팀이 집을 짓는다고 상상해 보세요. 뉴욕이든 파리든 같은 팀원들 (작업자) 을 사용합니다. 하지만 뉴욕에서는 영어로 말하며 영어로 된 설계도를 전달하고, 파리에서는 프랑스어로 말하며 프랑스어로 된 설계도를 전달합니다. 작업의 구조는 동일하지만, 의사소통의 언어는 변합니다.
  • 보너스 발견: 논문은 서로 다른 언어 간의 회로 "거리"가 언어들 간의 유사성과 일치한다는 것을 발견했습니다. 스페인어와 포르투갈어 회로는 영어와 프랑스어 회로보다 서로 더 비슷하게 보이며, 이는 언어 자체의 유사성과 같습니다.

5. 이것이 중요한 이유 (논문에 따르면)

  • 명확성: 복잡하고 혼란스러운 연결의 그물을 깔끔하고 읽기 쉬운 지도로 바꿉니다.
  • 해석 가능성: 이 도구는 내부 "속삭임"을 평범한 영어로 번역할 수도 있습니다. 예를 들어, "이 작업자는 목록의 두 번째 항목을 찾고 있다"거나 "이 작업자는 고유 명사를 인식하고 있다"고 알려줄 수 있습니다.
  • 효율성: 이전 방법들보다 훨씬 빠르고 "노이즈"가 적게 이러한 답을 찾아냅니다.

요약

이 논문은 AI 가 단어 단위로 어떻게 생각하는지 정확히 볼 수 있게 해주는 새로운 안경을 우리에게 제공합니다. 이는 AI 가 단순한 정적 기계가 아니라, 질문하는 방식과 사용하는 언어에 따라 내부 팀을 재배치하고 의사소통 스타일을 변경하는 역동적인 문제 해결사임을 보여줍니다. 우리는 이러한 모델을 분해할 필요 없이 그 "메커니즘"을 이해할 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →