← 최신 논문
🤖 machine learning

LLMs Can Annotate Attribution Graphs

이 논문은 대규모 언어 모델을 활용하여 회로 추적을 위해 피처들을 슈퍼노드로 자동 그룹화하는 파이프라인을 소개하며, 이러한 자동화가 인간 수준의 해석 가능성을 달성하고 멀티홉 작업에서 중간 추론 단계를 효과적으로 복구함을 입증한다.

원저자: Ameen Patel, Max Zhang, Nathan Hu

게시일 2026-08-05
📖 5 분 읽기🧠 심층 분석

원저자: Ameen Patel, Max Zhang, Nathan Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

AI의 비밀스러운 삶

당신에게 인간처럼 이야기를 쓰고, 수학 문제를 풀고, 질문에 답할 수 있는 아주 똑똑한 로봇이 있다고 상상해 보세요. 하지만 한 가지 문제가 있습니다. 이 로봇은 '블랙박스'라는 점입니다. 당신이 질문을 입력하면 로봇은 답변을 출력하지만, A에서 B로 가는 과정에서 그 내부의 뇌에서 어떤 일이 일어나는지는 전혀 알 수 없습니다. 이는 마치 마술사가 모자에서 토끼를 꺼내는 것을 보고 있지만, 그 안의 비밀 칸이나 숨겨진 줄은 볼 수 없는 것과 같습니다.

'기계론적 해석 가능성(mechanistic interpretability)'을 연구하는 과학자들은 이 커튼을 걷어내려 노력하고 있습니다. 그들은 AI 내부에서 톱니바퀴가 어떻게 돌아가는지 보고 싶어 합니다. 이를 위해 그들은 **회로 추적(circuit tracing)**이라는 기술을 사용합니다. AI를 수백만 명의 작은 일꾼들(뉴런 또는 특징이라고 불림)이 서로 노트를 전달하는 거대한 도시라고 생각해 보세요. AI가 질문에 답할 때, 이 일꾼들 중 오직 일부만이 실제로 핵심적인 역할을 수행합니다. 회로 추적은 마치 어떤 지도를 그려서 어떤 일꾼들이 활성화되었고, 최종 답변을 만들기 위해 어떻게 노트를 전달했는지를 강조하여 보여주는 것과 같습니다.

하지만 이 지도들은 매우 복잡합니다. 수천 명의 개별 일꾼들을 보여주기 때문에, 인간이 500개의 작은 노트 목록을 보고 전체적인 그림을 파악하기란 매우 어렵습니다. 보통 인간 연구자는 이 작은 일꾼들을 "수도(Capital Cities) 팀"이나 "덧셈(Math Adders) 팀"처럼 공통된 직무를 공유하는 "슈퍼노드(supernodes)"라는 팀으로 묶기 위해 수많은 시간을 보내야 합니다. 이 수동 작업은 느리고, 지루하며, 비용이 많이 듭니다. 여기서 큰 질문이 생깁니다. 컴퓨터에게 이 그룹화 작업을 대신하도록 가르칠 수 있을까요?

논문의 핵심 아이디어: AI가 스스로를 조직하게 하라

"LLM은 속성 그래프를 주석 달 수 있다(LLMs Can Annotate Attribution Graphs)"라는 제목의 이 논문은 영리하고 놀라울 정도로 단순한 해결책을 제안합니다. 바로 AI에게 자신의 뇌를 정리하라고 요청하는 것입니다.

연구진은 디지털 포렌식 팀처럼 작동하는 파이프라인을 구축했습니다. 연구자가 복잡한 뉴런의 지도를 멍하니 바라보는 대신, 강력한 언어 모델(AI)이 분류 작업을 수행하도록 만든 것입니다. 이 "로봇 사서"의 작동 방식은 다음과 같습니다.

  1. 설명(The Description): 먼저, 시스템은 특정 뉴런을 살펴보고 "이것이 무엇을 하는가?"라고 묻습니다. 시스템은 해당 뉴가 활성화되게 만든 텍스트를 살펴보고, "이 뉴런은 '수도'라는 단어를 볼 때 반응한다"와 같이 인간이 읽을 수 있는 짧은 설명을 생성합니다.
  2. 그룹화(The Grouping): 다음으로, 시스템은 이 설명들의 목록을 두 번째 AI(판사)에게 전달합니다. 판사는 목록을 읽고 이들을 논리적인 팀으로 묶으라는 요청을 받습니다. 판사는 "좋아, 이 다섯 개의 설명은 모두 미국 주(state)에 관한 것이니, '주 이름' 팀으로 묶자"라거나, "이 세 개는 'of'나 'the'에 관한 것이니 '문법 도우미' 팀으로 넣자"라고 말할 수 있습니다.
  3. 정리(The Cleanup): 마지막으로, AI는 중복된 팀을 병합하고 의미가 없는 팀을 버리는 빠른 검토 과정을 거칩니다.

그 결과는 어떨까요? 기계에 의해 완전히 생성된, 깔끔하고 체계적인 AI의 내부 사고 지도가 만들어집니다. 단 몇 초 만에 말이죠.

결과: 로봇 사서는 제 역할을 다하고 있다

연구팀은 이 방법이 실제로 전문가를 대체할 수 있는지 확인하기 위해 테스트를 진행했습니다. 그들은 "두 단계 수도(Two-Hop Capitals)" 챌린지라는 특정 과제를 사용했습니다. AI에게 이렇게 질문한다고 상상해 보세요. "달라스(Dallas)가 포함된 주의 수도는 어디인가?"

이를 답변하기 위해 AI는 머릿속에서 두 단계를 거쳐야 합니다.

  1. 1단계(Hop 1): 달라스가 **텍사스(Texas)**에 있다는 것을 파악합니다.
  2. 2단계(Hop 2): 텍사스의 수도가 **오스틴(Austin)**이라는 것을 파악합니다.

연구진은 이 테스트를 100번 실행했습니다. 그들의 자동화된 파이프라인은 100번 중 97번의 경우에서 "텍사스" 팀(중간 단계)을 성공적으로 찾아냈습니다. 즉, 97%의 성공률을 기록한 것입니다! 나머지 3가지 경우를 확인했을 때, 두 번은 "텍사스" 팀이 실제로 존재했지만 AI가 완벽하게 그룹화하지 못한 것이었고, 한 번은 팀 자체가 존재하지 않았습니다.

또한 그들은 AI가 생성한 그룹을 인간 연구자가 만든 그룹과 비교했습니다. 그룹이 얼마나 "해석 가능한지(이해하기 쉬운지)"를 측정하는 자동화된 테스트를 사용하여, AI의 그룹이 인간이 만든 것만큼 좋거나 때로는 약간 더 낫다는 것을 발견했습니다.

비용과 한계점

이 발견의 가장 멋진 부분 중 하나는 비용이 매우 저렴하다는 점입니다. 연구진은 하나의 중간 정도 복잡성을 가진 지도의 특징들을 그룹화하는 데 드는 비용이 작은 지도의 경우 약 3~6센트, 더 크고 밀도가 높은 지도의 경우 최대 61센트 정도라고 계산했습니다. 이는 인간이 동일한 작업을 수행하는 데 쓰는 시간과 비교하면 매우 적은 비용입니다.

하지만 논문은 이 방법이 완벽하고 마법 같은 해결책이라고 주장하지 않도록 주의를 기울였습니다. 연구진은 이 방법의 몇 가지 한계를 인정했습니다.

  • 특정 입력에 집중함: AI는 인간이 단서로 사용하는 것처럼 뉴런이 뇌의 어디에 있는지(예: 레이어나 위치)를 고려하지 않습니다.
  • 너무 모호할 수 있음: 수학 문제(예: 숫자 더하기)에 대해 테스트했을 때, AI는 뉴런들을 "숫자"나 "숫자 형태"와 같은 매우 광범위한 카테고리로 묶었습니다. 이는 AI가 수학을 수행하기 위해 사용하는 "받아올림"이나 "크기 추정"과 같은 구체적이고 정교한 기법들을 놓쳤음을 의미합니다. 이는 AI가 명백한 개념을 그룹화하는 데는 뛰어나지만, 여부전히 내부의 미묘하고 복잡한 메커니즘은 놓칠 수 있음을 시사합니다.
  • 개념 증명 단계임: 연구팀은 이 방법을 1,000개의 무작위 위키피디아 프롬프트에 적용하여 인간이 추가로 연구할 만한 가치가 있는 몇 가지 "흥미로운" 그래프들을 찾아냈습니다. 이는 이 방법이 "개방형 탐색"을 위한 준비가 되었음을 보여주며, 인간이 미처 알지 못했던 AI의 뇌 속의 기이하고 경이로운 것들을 찾는 데 도움을 줄 수 있음을 나타냅니다.

이것이 왜 중요한가

이 논문은 AI의 의식을 해결했다거나 존재하는 모든 뉴런을 지도화했다고 주장하는 것이 아닙니다. 대신, AI 연구의 주요 병목 현상을 제거하는 실용적이고 저비용의 도구를 제공합니다. 뉴런을 그룹화하는 지루하고 시간이 많이 걸리는 작업을 자동화함으로써, 인간 과학자들이 훨씬 더 흥สนใจ로운 질문, 즉 *"왜 AI는 이렇게 생각하는가? AI가 앞을 내다보며 계획하고 있는가? 아니가 사실을 지어내고 있는가?"*와 같은 질문에 집중할 수 있도록 자유를 줍니다.

저자들은 이러한 "단순한" 자동화조차도 의미 있는 결과를 낼 수 있으며, 이는 디지털 뇌가 실제로 어떻게 작동하는지에 대한 더 빠르고 폭넓은 탐색의 문을 열어준다고 제안합니다. 이는 블랙박스를 투명한 유리창으로 바꾸기 위한 작은 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →