← 최신 논문
💬 NLP

Automated Interpretability and Feature Discovery in Language Models with Agents

본 논문은 대규모 언어 모델 내에서 가설을 반복적으로 정제하고 내부 특징을 발견함으로써 기계적 해석 가능성을 자동화하는 자율적 다중 에이전트 프레임워크를 소개하며, 이는 더 명확하고 반증 가능하며 감사 가능한 설명을 생성하는 데 있어 원샷 방법보다 우수한 성능을 보여줍니다.

원저자: Arnau Marin-Llobet, Javier Ferrando

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arnau Marin-Llobet, Javier Ferrando

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 초정밀 기계 (대형 언어 모델) 가 이야기를 쓰고, 질문에 답하며, 문제를 해결한다고 상상해 보세요. 이 기계 안에는 수십억 개의 미세한 스위치와 기어 (뉴런과 특징) 가 함께 작동하고 있습니다. 문제는 우리가 사용 설명서를 가지고 있지 않다는 점입니다. 기계가 작동하는 모습은 볼 수 있지만, 각 개별 기어가 정확히 무엇을 하는지는 알 수 없습니다.

오랫동안 연구자들은 하나의 기어를 살펴보고 그것이 무엇을 하는지 추측한 뒤 "이 기어는 수학용이다"와 같은 라벨을 기록하는 방식으로 이를 파악하려 했습니다. 하지만 종종 그 추측이 틀리거나, 너무 모호하거나, 약간 다른 예를 시도하는 순간 무너졌습니다. 이는 마치 자동차 부품을 한 번만 보고 그 기능을 추측하려는 것과 같습니다.

이 논문은 InterpAgent라는 새로운 시스템을 소개합니다. 인간이 한 번 추측하는 대신, InterpAgent 는 기계의 기어가 실제로 무엇을 하는지 미스터리를 해결하기 위해 협력하는 로봇 탐정 팀과 같습니다.

간단한 비유를 통해 그들이 어떻게 하는지 살펴보겠습니다:

두 팀의 탐정

이 시스템은 서로 대화하는 두 가지 전문화된 로봇 에이전트를 사용합니다:

  1. 특징 찾기 (Scout, 정찰병):
    "스페인어"와 관련된 모든 기어를 찾고 싶다고 가정해 보세요. 정찰병은 어떤 기어가 그 역할을 하는지 모릅니다. 그래서 기어들이 어떻게 점등되는지 나타내는 "활성화 공간 (activation space)"이라는 지도 속으로 들어가 패턴을 찾습니다. 통계적 지도 (GPS 와 유사) 를 사용하여 스페인어 단어가 사용될 때 함께 점등되는 기어 군집을 찾습니다. 단순히 추측하는 것이 아니라, 수학적으로 스페인어 프롬프트와 영어 프롬프트를 신뢰성 있게 구분하는 기어들을 찾습니다.

    • 비유: 탐정이 프랑스 파티에만 등장하는 붉은 모자를 쓴 한 사람을 찾기 위해 군중을 훑어보는 것과 같습니다.
  2. 특징 설명 (Interrogator, 심문관):
    정찰병이 후보 기어를 찾으면 심문관이 역할을 맡습니다. 심문관의 임무는 단순히 기어에 이름을 붙이는 것이 아니라, 그 이름을 스트레스 테스트하는 것입니다.

    • 과거의 방식: 인간은 "이 기어는 '기술'용이다"라고 말할 수 있습니다.
    • InterpAgent 방식: 심문관은 "좋아, 네가 그것이 '기술'용이라고 생각한다면 테스트해 보자"라고 말합니다. 기어를 발동시켜야 하는 12 가지 예시 (예: "컴퓨터 고치기") 와 발동시켜서는 안 되는 12 가지 예시 (예: "파스타 요리하기") 를 생성합니다. 그런 다음 이를 기계에 통과시킵니다.
    • 반전: 만약 기어가 "파스타 요리하기"에 점등된다면, 심문관은 "기술"이라는 라벨이 틀렸음을 알게 됩니다. 그리고 가설을 다시 씁니다: "아마도 '무언가를 고치는 것'용일까?" 이 과정을 반복하여 새로운 테스트를 생성하고, 결과를 확인하며, 라벨을 정제하여 압력 하에서도 견딜 수 있는 설명을 찾을 때까지 계속합니다.

발견의 "루프"

이 논문은 이것이 일회성 사건이 아니라고 강조합니다. 이는 루프입니다.

  • 단계 1: 정찰병이 잠재적 기어를 찾습니다.
  • 단계 2: 심문관이 그것이 무엇을 하는지 추측합니다.
  • 단계 3: 심문병은 반례 (기어를 발동시켜야 하지만 하지 않는 것, 혹은 하지 않아야 하지만 발동되는 것) 를 찾아 자신의 추측을 깨뜨려 봅니다.
  • 단계 4: 심문관은 실패에 기반하여 추측을 업데이트합니다.
  • 단계 5: 추측이 확고해질 때까지 반복합니다.

이는 과학자가 실험을 반복하는 것과 같습니다. 만약 당신의 이론이 "이 버튼은 전등을 켭니다"이지만, 버튼을 누르자 라디오가 켜진다면 단순히 "아이고"라고 말하지 않습니다. 대신 "이 버튼은 전원을 제어합니다"라는 이론으로 바꾸고 다시 테스트합니다.

그들이 발견한 것

저자들은 이 시스템을 Gemma-2 계열 모델 (AI 의 한 종류) 에서 테스트했습니다. 결과는 다음과 같습니다:

  • 더 나은 라벨링: 로봇 팀은 과거의 "원회성 (one-shot)" 방법보다 특징을 라벨링하는 데 훨씬 뛰어났습니다. 과거 방법은 "지식"과 같은 모호한 답변을 자주 제공했지만, 로봇 팀은 "기술 문제 해결 맥락에서의 비공식적 프랑스어 표현"과 같이 구체적이고 좁은 답변을 찾았습니다.
  • 미지의 발견: 이 시스템은 연구자들이 이미 알고 있던 기어들만 설명한 것이 아닙니다. 정찰병은 인간이 주목하지 않았던 새로운 기어들을 발견했는데, 예를 들어 "유해한 콘텐츠" (예: 폭발물) 나 특정 코딩 패턴에 대해서만 발동되는 특정 뉴런들입니다.
  • 안전 점검: 한 사례 연구에서 그들은 위험한 요청을 거절하는 것과 관련된 기어를 발견했습니다. 그들은 그 기어의 작용을 줄여 기계를 "조종"할 수 있었고, 그 결과 기계는 요청을 거절하지 않게 되었습니다. 이는 그 기어가 단순히 안전 행동을 지켜보는 것이 아니라, 실제로 그 행동을 유발하고 있음을 증명했습니다.
  • 다의성 (Polysemanticity): 때로는 로봇들이 하나의 기어가 동시에 두 가지 매우 다른 일을 하고 있음을 발견했습니다 (예: "수학 공식"과 "의학적 용어"를 모두 처리하는 기어). 이 시스템은 단일하고 잘못된 라벨을 강요하기보다 "이 기어는 혼란스럽습니다; 두 가지 일을 하고 있습니다"라고 말할 만큼 똑똑합니다.

결론

이 논문은 AI 해석을 고정된 라벨 (보고, 추측하고, 기록하기) 이 아니라 반복적 실험 (추측, 테스트, 실패, 수정) 으로 취급할 때 훨씬 더 정확하고 신뢰할 수 있는 설명을 얻을 수 있다고 주장합니다.

이 시스템은 모든 추측, 모든 테스트, 모든 실패에 대한 "기록"을 생성하여 과정을 투명하게 만듭니다. AI 에이전트가 끊임없이 자신의 아이디어를 반증하려는 엄격한 과학자처럼 행동하게 하면 기계의 뇌가 실제로 어떻게 작동하는지에 대해 훨씬 더 명확한 그림을 얻을 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →