← 최신 논문
💬 NLP

ADAG: Automatically Describing Attribution Graphs

이 논문은 내부 특징의 기능적 역할을 정량화하고 클러스터링하여 LLM 의 회로 추적을 자동화하는 'ADAG'라는 엔드투엔드 파이프라인을 제안하며, 이를 통해 기존 인간 분석 기반의 작업을 대체하고 해로운 조언 탈출구와 같은 유해한 행동을 설명하는 해석 가능한 회로를 자동으로 발견할 수 있음을 보여줍니다.

원저자: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ 1. 문제: 거대한 블랙박스 공장

인공지능 모델은 거대한 공장과 같습니다. 수많은 기계 (뉴런) 들이 돌아가며 입력된 질문을 받아 답을 만들어냅니다. 하지만 이 공장 내부가 어떻게 작동하는지는 인간에게 보이지 않는 '블랙박스' 상태입니다.

기존 연구자들은 이 공장의 비밀을 밝히기 위해, 마치 수동으로 기계를 하나씩 열어보며 "이 기계는 A 역할을 하고, 저 기계는 B 역할을 하네"라고 일일이 분석했습니다. 하지만 공장이 너무 커지고 복잡해져서, 사람이 일일이 다 확인하는 것은 불가능해졌습니다.

🤖 2. 해결책: ADAG (자동 해설가 로봇)

이 논문은 ADAG라는 시스템을 개발했습니다. ADAG 는 이 공장의 작동 원리를 사람이 한 번도 손대지 않고 자동으로 분석하고, "이 기계는 '달라'라는 단어를 들으면 '텍사스'를 떠올리는 역할을 한다"라고 자연스러운 한국어 (또는 영어) 로 설명해 주는 로봇입니다.

ADAG 는 크게 4 단계로 작동합니다.

1 단계: 중요 부품 찾기 (회로 추적)

  • 비유: 공장에서 어떤 기계가 최종 제품 (답변) 에 가장 큰 영향을 미쳤는지 **전선 (기울기)**을 따라가며 찾아냅니다.
  • 작동: 모델이 답을 낼 때, 어떤 내부 부품들이 가장 크게 기여했는지 수학적으로 계산하여 '회로'를 그립니다.

2 단계: 부품의 역할 카드 만들기 (속성 프로파일)

  • 비유: 각 부품에 대해 **'역할 카드'**를 만듭니다.
    • 입력 카드: 어떤 단어를 보면 이 부품이 켜질까? (예: "달라"라는 단어를 보면 켜짐)
    • 출력 카드: 이 부품이 켜지면 어떤 단어를 내보내려 할까? (예: "텍사스"를 내보내려 함)
  • 혁신: 기존에는 부품이 켜진 순간의 모습만 봤는데, ADAG 는 과거의 입력과 미래의 출력까지 모두 고려하여 더 정확한 역할을 파악합니다.

3 단계: 팀으로 묶기 (클러스터링)

  • 비유: 수천 개의 부품 중 **역할이 비슷한 것끼리 팀 (Supernode)**을 만듭니다.
    • 예: "텍사스 주와 관련된 단어를 처리하는 팀", "수도 이름을 기억하는 팀", "안전 장치를 작동시키는 팀" 등으로 묶습니다.
  • 방법: 수학적인 알고리즘을 써서 역할이 비슷한 부품들을 자동으로 그룹화합니다.

4 단계: 팀장에게 인터뷰하기 (자동 설명)

  • 비유: 이제 각 팀 (그룹) 에 대해 LLM(대규모 언어 모델) 이 인터뷰를 진행합니다.
    • 인터뷰어 (Explainer): "이 팀은 무엇을 하는 팀이야?"라고 질문하고 가설을 세웁니다.
    • 심사위원 (Simulator): "그 가설이 맞다면, 이 팀은 이런 상황에서 이렇게 반응해야 해"라고 시뮬레이션해 봅니다.
    • 결과: 두 모델이 서로 검증하며, 가장 정확한 설명을 찾아냅니다. "이 팀은 '위험한 의학적 조언'을 막는 역할을 한다"라고 최종 라벨을 붙입니다.

🌟 3. ADAG 가 해낸 놀라운 일

이 시스템은 두 가지 중요한 실험에서 성공을 거두었습니다.

  1. 지식 퀴즈 풀이 (주도/수도 문제):

    • "달라 (Dallas) 가 있는 주의 수도는?"이라는 질문에 답할 때, 모델이 어떻게 '텍사스'를 떠올리고 '오스틴'을 답하는지 과정을 자동으로 추적했습니다.
    • 결과: 사람이 일일이 분석한 결과와 거의 똑같은, 매우 정확한 설명을 자동으로 만들어냈습니다.
  2. 위험한 조언 차단 (의료 해킹 방지):

    • 해커들이 모델을 속여 "약 5 알을 한 번에 먹어"라는 위험한 의료 조언을 하도록 유도하는 '자일브레이크 (Jailbreak)' 공격이 있었습니다.
    • ADAG 는 이 공격이 왜 성공하는지 분석했습니다.
    • 발견: "ridiculous (터무니없는)"라는 단어가 들어오면 특정 부품 팀이 활성화되어 안전 장치를 무력화한다는 것을 찾아냈습니다.
    • 해결: 이 특정 팀의 활동을 강제로 끄거나 조절하면, 모델이 다시 안전한 답변을 하도록 만들 수 있었습니다.

💡 4. 요약: 왜 이것이 중요한가요?

  • 자동화: 이제 연구자들이 밤새도록 데이터를 뒤적이며 수동으로 분석할 필요가 없습니다.
  • 확장성: 더 큰 모델, 더 복잡한 문제를 다룰 수 있게 되었습니다.
  • 안전성: AI 가 왜 위험한 행동을 하는지, 혹은 왜 좋은 행동을 하는지 이유를 명확히 설명할 수 있게 되어 AI 의 안전성을 높이는 데 큰 도움이 됩니다.

한 줄 요약:

**"인공지능의 복잡한 두뇌 회로를 사람이 이해할 수 있는 언어로, 로봇이 자동으로 번역해 주는 시스템"**입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →