← 최신 논문
🤖 AI

Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

이 논문은 언어 모델 에이전트가 반복적인 가설-검증 루프를 통해 식별된 신경 회로에 대해 컴포넌트 수준 및 태스크 수준의 설명을 효과적으로 생성할 수 있음을 입증하기 위해 AgenticInterpBench와 HyVE 프레임워크를 소개하며, 다만 이들의 신뢰도는 현재 검증 단계의 과제로 인해 제한적이다.

원저자: Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 복잡한 기계(거대 언어 모델과 같은)를 상상해 보세요. 이 기계는 이야기를 쓰거나, 수학 문제를 풀거나, 질문에 답할 수 있습니다. 과학자들은 이 기계가 특정 작업을 수행하게 만드는 구체적인 "톱니바퀴와 레버"를 찾아내는 방법을 알아냈습니다. 이를 **회로 국소화(localizing the circuit)**라고 부릅니다.

하지만 단순히 톱니바퀴를 찾는 것만으로는 충분하지 않습니다. 우리는 여전히 각 톱니바퀴가 정확히 무엇을 하는지, 또는 어떻게 함께 작동하는지 알지 못합니다. 보통 인간 전문가가 기계를 뚫어지게 쳐다보며 부품의 역할을 추측하고, 그 추측을 테스트하고, 다시 시도하는 과정을 반복하며 수 시간을 보냅니다. 이는 느리고, 지루하며, 규모를 키우기 어렵습니다.

이 논문은 다음과 같이 질문합니다: 우리를 대신해 이 탐정 업무를 수행할 로봇 탐정(언어 모델 에이전트)을 고용할 수 있을까?

다음은 이 실험의 내용을 쉬운 비유를 사용하여 정리한 내용입니다:

1. 문제: "블랙박스" 미스터리

언어 모델을 거대한 잠긴 금고라고 생각해 보세요. 과학자들은 이미 금고를 여는 특정 핀들(회로)을 찾아내는 특수 도구들을 사용했습니다. 하지만 우리는 각 핀이 무엇을 하는지는 모릅로 합니다.

  • 기존 방식: 인간 탐정이 "아마 이 핀이 자물쇠를 돌리는 역할을 할 거야"라고 추측합니다. 그리고 테스트합니다. 만약 실패하면, 다시 추측합니다. 이 과정은 매우 오래 걸립니다.
  • 새로운 아이디어: AI 탐정에게 이 일을 맡겨서, 스스로의 이론을 테스트하기 위해 생각하고, 코드를 작성하고, 자신의 실수를 바로잡게 할 수 있을까요?

2. 훈련장: "장난감" 금고

연구진은 이 AI 탐정이 효과적인지 테스트하기 위해, 실제의 복잡한 금고(실제 세계의 언어 모델)를 사용할 수 없었습니다. 왜냐하면 정답을 확인할 기준이 없기 때문입니다.

대신 그들은 84개의 "장난감 금속 금고"(이를 AGENTICINTERPBENCH라 부름)를 만들었습니다.

  • 이것들은 처음부터 만들어진 작고 인공적인 기계들입니다.
  • 연구진은 간단한 지침(레시피와 같은)을 통해 이들이 어떻게 작동하는지 정확히 알고 있습니다.
  • 연구진은 모든 톱니바퀴가 무엇을 해야 하는지 정확히 알고 있습니다. 이를 통해 AI 탐정에게 "네 추측이 맞았니?"라고 채점할 수 있습니다.

3. 탐정: HYVE ("가설 설정, 검증, 설명" 루프)

연구진은 HYVE라는 이름의 AI 에이전트를 만들었습니다. HYVE는 단순히 추측만 하는 것이 아니라, 기계의 모든 톱니바퀴에 대해 엄격한 탐정 루틴을 따릅니다:

  1. 관찰(Observe): HYVE는 톱니바퀴를 관찰합니다. "음, 입력값이 'x'일 때 이 톱니바퀴는 밝은 빨간색으로 빛나네. 'y'일 때는 어둡게 유지되는군."
  2. 가설 설정(Hypothesize): HYVE는 추측을 합니다. "내 생각에 이 톱니바퀴는 'x'가 들어올 때만 켜지는 '빨간 불 감지기'인 것 같아."
  3. 검증(Validate - 테스트): 이 부분이 가장 중요합니다. HYVE는 자신의 추측을 테스트하기 위해 컴퓨터 프로그램을 작성합니다. 예를 들어, "입력이 'x'일 때조차 이 톱겨바퀴가 계속 꺼져 있도록 강제했을 때 기계가 고장 나는지 보자"라고 말할 수 있습니다.
    • 만약 기계가 예측한 대로 고장 난다면, 추측이 확인된 것입니다.
    • 만약 기계가 계속 작동한다면, 추측이 틀린 것입니다. HYVE는 다시 2단계로 돌아가 새로운 추측을 시도해야 합니다.
  4. 설명(Explain): 모든 톱니바퀴 테스트가 끝나면, HYVE는 요약본을 작성합니다: "이 기계는 문장에 'x'가 몇 번 나타나는지 세는 '분수 계산기'입니다."

4. 결과: 탐정은 유능하지만 완벽하지는 않다

연구진은 어떤 AI가 최고의 탐정이 될 수 있는지 확인하기 위해 네 가지 다른 "두뇌"(서로 다른 대규모 언어 모델)를 사용하여 HYVE를 테스트했습니다.

  • 성공: AI 에이전트들은 놀라울 정도로 뛰어났습니다! 이들은 약 79%의 확률로 톱니바퀴의 역할을 정확히 식별했고, 전체적인 작업에 대해 약 83%의 확률로 올바르게 설명했습니다.
  • 병목 현상: AI는 초기 추측(가설)을 하는 데는 매우 뛰어났습니다. 문제는 테스트 단계에서 발생했습니다.
    • 가끔 AI는 테스트 계획을 너무 모호하게 작성했습니다.
    • 가끔 AI는 테스트를 실행할 코드를 작성했지만, 코드에 버그가 있었습니다(마치 탐정이 테스트 계획을 썼지만 손전등을 챙기는 것을 잊어버린 것과 같습니다).
    • 비유: 이는 마치 범인이 누구인지에 대한 훌륭한 이론을 가진 탐정이, 막상 알리바이를 확인하러 범죄 현장에 갔을 때 길을 잃거나 건물에 잠겨 들어가지 못하는 상황과 같습니다.

누가 가장 뛰어났을까요?

  • Claude-Sonnet은 실제로 오류 없이 테스트를 실행하는 것(버그 없는 코드 작성)에 가장 뛰어났습니다.
  • Gemini는 최종적으로 이해하기 쉬운 설명을 작성하는 데 가장 뛰어났습니다.
  • GPT-5.4는 테스트 계획을 짜는 데는 훌륭했지만, 코드가 실행되지 않는 경우가 많았습니다.

5. 실제 세계 테스트: "Llama" 사례 연구

이 방법이 "장난감 금고" 외부에서도 작동하는지 확인하기 위해, 연구진은 자연적으로 학습된 실제 언어 모델(Llama-3-8B)에 HYVE를 적용했습니다.

  • 그들은 세 숫자를 더하는 데 도움을 주는 회로를 다른 인간들이 찾아낸 뒤 이를 제공했습니다.
  • 결과: AI 탐정은 일부 톱니바퀴가 "전달 헤드(transfer heads)"(숫자를 옮기는 역할)라는 것을 성공적으로 파악했고, 다른 톱니바퀴들은 단순히 "중복된 것"(중요해 보이지만 실제로는 필요하지 않은 것)임을 정확히 식별했습니다.
  • 이는 이 방법이 깨끗한 장난감뿐만 아니라, 지저도하고 실제적인 기계에서도 작동한다는 것을 증명했습니다.

결론

이 논문은 AI 에이전트가 AI가 어떻게 작동하는지 설명하는 데 있어 유망한 새로운 도구라고 결론짓습니다. 이들은 추측과 테스트라는 힘든 일을 대신 해줄 수 있습니다. 하지만 아직 완벽하지는 않습니다. 주요 과제는 신뢰성입니다: AI가 자신의 이론을 실제로 테스트하는 코드를 실수 없이 작성하는 능력이 더 좋아져야 합니다.

AI가 "실험을 수행하는 것"(검증 루프)에 더 능숙해지기 전까지는, 인간 전문가가 여전히 그 결과물을 재확인해야 할 것입니다. 그러나 이는 복잡한 AI의 두뇌를 자동화하여 이해하는 데 있어 중요한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →