← 최신 논문
🤖 machine learning

The Attribution Contract: Feature Attribution for Generative Language Models

본 논문은 생성형 언어 모델의 특징 귀속에 대한 모호성을 해결하기 위해 출력, 유효한 특징, 생성 과정, 고정된 조건, 그리고 모델 점수를 명시적으로 정의하는 "귀속 계약"이라는 개념적 프레임워크를 제시함으로써, 귀속 논쟁을 알고리즘적 결함이 아닌 설명적 계약의 차이로 재정의한다.

원저자: Giang Nguyen

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Giang Nguyen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 요리사가 특정 요리를 만든 이유를 파악하려고 한다고 상상해 보세요. 최종 맛에 가장 중요한 재료는 무엇인지 알고 싶어 합니다.

과거에는(단순한 "분류기" 모델을 사용할 때) 이것이 쉬웠습니다. 요리사에게 재료 목록(입력)을 주면, 그들은 한 가지 요리(출력)를 만들고 소금이나 후추를 가리키며 "아, 소금이 짠맛을 냈구나"라고 말할 수 있었습니다. 재료는 정적이며 요리는 완성된 상태였습니다.

하지만 생성 언어 모델(이 텍스트를 작성한 AI 와 같은) 에서는 요리 과정이 훨씬 더 복잡합니다. 요리사는 한 가지 요리만 만드는 것이 아니라, 한 입씩 차례로 전체 연회 요리를 준비합니다. 그리고 여기에 함정이 있습니다: 요리사가 만든 첫 번째 입은 두 번째 입의 재료가 됩니다.

만약 요리사가 먼저 "Le"(프랑스어로 "The"라는 뜻) 를 만든다면, 그 "Le"는 이제 다음 단어인 "chien"(개) 을 위한 재료로 쓰이기를 기다리며 조리대 위에 놓이게 됩니다.

문제: "누가 무엇을 했는가?"에 대한 혼란

이 논문은 AI 가 특정 단어를 쓴 이유를 설명하려 할 때, 우리가 실제로 무엇을 묻고 있는지 명확하지 않기 때문에 종종 혼란에 빠진다고 주장합니다.

저자는 이러한 혼란을 **"자기 귀속 오류 (Self-Attribution Fallacy)"**라고 부릅니다.

간단한 비유를 들어보겠습니다:
계주 경기를 지켜보고 있다고 상상해 보세요.

  • 주자 A주자 B에게 계주봉을 건넵니다.
  • 주자 B가 빠르게 달려 경기를 이깁니다.

"주자 B 가 빠르게 달린 것에 누가 책임이 있는가?"라고 묻는다면:

  1. 질문 A: "지금 당장 주자 B 가 빠르게 달리는 데 무엇이 도움이 되었는가?"
    • 답변: 주자 A 가 건넨 계주봉입니다! (이전 단어가 가장 중요한 요인입니다.)
  2. 질문 B: "팀이 이기게 만든 원래 계획의 어떤 부분이 원인인가?"
    • 답변: 코치가 주자 A 에게 내린 지시입니다! (원래 프롬프트가 가장 중요한 요인입니다.)

이 논문은 많은 AI 연구자들이 두 가지 질문에 모두 같은 도구를 사용하고 있지만, 이를 혼동하고 있다고 말합니다. 그들은 "주자 A"(이전 단어) 가 "주자 B"의 속도에 책임이 있음을 보고, "코치의 지시는 중요하지 않았다!"라고 결론 내립니다. 하지만 이는 잘못되었습니다. 그들은 단순히 잘못된 질문을 한 것입니다.

해결책: "귀속 계약 (Attribution Contract)"

이를 해결하기 위해 저자는 AI 분석을 시작하기 전에 반드시 작성해야 하는 새로운 규칙집인 귀속 계약을 제안합니다. 이는 마치 AI 를 분석하기 전에 작성해야 하는 작업 지시서레시피 카드와 같습니다.

AI 에게 "왜 이 단어를 썼는가?"라고 묻기 전에, 다음 다섯 가지 사항을 정의하는 계약서에 서명해야 합니다 (SCOPE):

  1. S (Score, 점수): 무엇을 측정하는가? (다음 단어의 확률인가? 전체 문장인가?)
  2. C (Conditioning, 조건화): 무엇을 고정해 두는가? (AI 가 이미 쓴 단어들을 무시하는가, 아니면 재료로 취급하는가?)
  3. O (Output, 출력): 정확히 무엇을 설명하는가? (다음 단어 하나만? 전체 단락인가?)
  4. P (Process, 과정): AI 는 어떻게 만들었는가? (왼쪽에서 오른쪽으로 썼는가? 확산 모델처럼 지우고 다시 썼는가?)
  5. E (Eligible Features, 허용된 특징): 무엇을 비난하거나 칭찬할 수 있는가? (사용자의 원래 프롬프트만? 아니면 AI 의 이전 단어들도 포함하는가?)

이것이 중요한 이유: "마법의 안경" 비유

AI 가 마법의 안경을 쓰고 있다고 상상해 보세요.

  • 계약 A(로컬 다음 토큰)를 사용하여 AI 에게 단어를 설명하도록 요청하면, 안경은 이전 단어가 밝은 붉은색으로 빛나고 있음을 보여줍니다. 안경은 말합니다: "이 단어는 앞의 단어가 이를 확률적으로 만들었기 때문에 여기에 있는 것이다!"
  • 계약 B(프롬프트 조건부)를 사용하여 같은 단어를 설명하도록 요청하면, 안경은 이전 단어의 빛을 끄고 원래 프롬프트가 밝은 붉은색으로 빛나도록 합니다. 안경은 말합니다: "이 단어는 당신이 프롬프트에서 요청했기 때문에 여기에 있는 것이다!"

이 논문의 핵심 주장은 다음과 같습니다: 안경을 보고 AI 가 "틀렸다"거나 "옳다"고 말할 수는 없습니다. 계약 A 와 계약 B 는 서로 다른 두 가지 질문을 하고 있다는 사실을 인정해야 합니다.

만약 한 연구자가 "AI 가 소스 문서를 무시하고 있으므로 환각을 보고 있다"고 말하지만, 실제로는 이전 단어를 보는 계약 A 를 사용 중이라면, 그들은 결과를 오해하고 있는 것입니다. 소스 문서가 실제로 원인인지 확인하려면 이전 단어를 고정하고 소스만 보는 계약 B 로 전환해야 합니다.

결론

이 논문은 새로운 계산 방식을 발명하는 것이 아니라, 숫자에 대해 이야기하는 새로운 방식을 발명합니다.

이는 생성형 AI 의 세계에서는 어떤 입력이 가장 중요했는지에 대한 단일한 "진실"은 없으며, 오직 계약에 상대적인 진실만 존재한다고 알려줍니다.

  • AI 가 단계별로 어떻게 생각하는지 알고 싶다면 "로컬" 계약을 사용하세요.
  • 당신의 지시가 최종 이야기에 어떻게 영향을 미쳤는지 알고 싶다면 "프롬프트 조건부" 계약을 사용하세요.

우리가 이것들을 같은 것으로 취급하는 것을 멈추지 않는 한, 우리는 실제로는 서로 다른 질문을 하고 있음에도 불구하고 AI 설명에 대해 계속 논쟁하게 될 것입니다. "귀속 계약"은 답을 찾기 시작하기 전에 우리가 모두 같은 질문을 하고 있는지 확인하게 해주는 도구일 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →