← 최신 논문
🤖 machine learning

IG-Lens: Exact Additive Probability Attribution Across Transformer Layers via Telescoping Integrated Gradients

이 논문은 단일 경로를 따라 텔레스코핑 적분 기울기(telescoping Integrated Gradients)를 적용함으로써 트랜스포머 레이어 전반에 걸쳐 정확하고 가산적인 확률 기여도를 달성하는 새로운 방법인 IG-Lens를 소개하며, 이를 통해 기존의 로짓 기반 또는 비가산적 판독 도구들의 비선형성 및 편향 한계를 극복하고 이산화 오차 없이 완결성을 보장한다.

원저자: Duc Anh Nguyen

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Duc Anh Nguyen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(이 채팅을 구동하는 것과 같은)을 하나의 다층 공장이라고 상상해 보세요. 바닥에서 가공되지 않은 아이디어가 들어오면 꼭대기에서 완성된 제품(예측된 단어)이 나오는 구조입니다.

오랫동안 연구자들은 다음과 같은 단순한 질문에 답하기 위해 노력해 왔습니다. "정확히 공장의 몇 층에서 '하노이(Hanoi)'라고 말하기로 한 결정이 내려지는가?"

기존의 도구들은 이 질문에 답하려 했지만, 마치 실력이 형편없는 회계사 같았습니다.

  • 어떤 도구들은 각 층을 살펴보고 공장이 얼마나 "확신"하고 있는지를 추측하지만, 그들의 추측은 100%가 되지 않습니다. 이는 마치 1층은 40% 확신, 2층은 60% 확신, 3층은 80% 확신한다고 말하여 총합이 180%가 되는 것과 같습니다. 이는 말이 안 되는 일입니다.
  • 다른 도구들은 확률로 변환되기 전의 가공되지 않은 숫자(로짓, logits)를 살펴봅니다. 하지만 숫자를 확률로 바꾸는 과정은 케이크를 굽는 것과 같습니다. 밀가 가루와 달걀을 따로 더한다고 해서 완성된 케이크의 무게를 알 수는 없습니다. "굽는 과정"(수학적으로 *소프트맥스(softmax)*라고 불리는 과정)이 모든 것을 바꿔놓기 때문입니다.
  • 세 번째 그룹의 도구들은 각 층에서 수행된 작업량을 측정하려고 하지만, 각 층을 서로 다른 시작점과 비교하기 때문에 그 수치들을 합쳐서 전체 작업량을 알려주지 못합니다.

IG-Lens의 등장: 완벽한 회계사

이 논문은 이 공장을 위한 완벽한 회계사 역할을 하는 새로운 방법인 IG-Lens를 소개합니다. 이 방법은 "망원경 기법(telescoping trick)"(접었다 폈다 할 수 있는 망원경을 생각해보세요)을 사용하여 문제를 해결합니다.

작동 방식은 다음과 같습니다.

1. "단 한 번의 스냅샷" 규칙
단어가 모든 층을 통과하며 매 순간 다른 단어들과 뒤섞이게 두는 대신, IG-Lens는 특정 층에서의 단어 상태를 포착하는 "스냅샷"을 찍습니다. 그런 다음 다음과 같이 묻습니다. "만약 우리가 10층의 상태를 가져와서 마지막 '마무리' 기계(가공되지 않은 데이터를 확률로 바꾸는 부분)에 통과시킨다면, 결과가 어떻게 되겠는가?"

2. 망원경 합계 (Telescoping Sum)
IG-Lens는 여정을 여러 구간으로 나눕니다 (예: 10층에서 11층, 11층에서 12층 등).

  • 10층에서의 단어 확률을 계산합니다.
  • 11층에서의 확률을 계산합니다.
  • 두 값의 차이가 해당 구간에서 수행된 정확한 작업량입니다.
  • 모든 단계에서의 변화량을 측정하기 때문에, 바닥부터 꼭대기까지 모든 변화량을 더하면 최종 결과와 정확히 일치하게 됩니다. 누락된 수학도, "굽기 오류"도, 반올림 문제도 없습니다.

3. "예측 인지형" 필터
대부분의 방법은 중요도를 추측하기 위해 숫자가 얼마나 "흔들리는지(wiggle/gradient)"를 살펴봅니다. 하지만 때로는 숫자가 많이 흔들리더라도 실제 최종 결정에는 영향을 주지 않을 때가 있습니다.
IG-Lens는 더 똑똑합니다. IG-Lens는 실제 확률이 변했을 때만 해당 층에 작업 점수를 부여합니다. 만약 숫자는 요동치지만 예측은 변하지 않는다면, IG-Lens는 그 요동을 무시합니다. 이는 마치 관리자가 단순히 상자를 옮기며 바쁘게 움직인 날이 아니라, 실제로 업무를 완수한 날에 대해서만 노동자에게 임금을 지불하는 것과 같습니다.

이것이 왜 중요한가 (논문에 따르면)

  • 정확합니다: 기존의 도구들이 근사치를 제공하는 것과 달리, IG- lens는 모든 층의 기여도를 합산하면 정확히 최종 확률과 일치한다는 것을 보장합니다. 수학적으로 완벽합니다 (컴퓨터 연산의 한계 내에서).
  • "발생 시점(Onset)"을 찾아냅니다: 이 방법은 모델이 단어를 "결정"한 정확한 층을 알려줄 수 있습니다. 예를 들어, "수도(capital)"라는 단어에 대해서는 12층에서 결정이 주로 내려졌지만, "하노이(Hanoi)"의 경우에는 훨씬 나중인 15층이나 16층 즈음에 결정이 일어났음을 보여줄 수 있습니다.
  • 한계를 솔직하게 인정합니다: 논문은 트레이드오프(trade-off)를 인정합니다. IG-Lens는 특정 층에서의 단어 스냅샷을 보기 때문에, 그 층이 단어가 위로 올라가는 동안 나중에 할 수도 있는 작업까지 계산에 넣지는 않습니다. 이는 *"이 층이 전체 시스템에 미치는 총 효과는 무엇인가?"*가 아니라, *"우리가 시작한 지점을 기준으로 볼 때, 이 층이 최종 답변에 얼마나 기여했는가?"*를 측정하는 것입니다.

결론

IG-Lens는 AI 모델 내부를 들여다보는 새로운 방법으로, 100%가 되는 수학적으로 완벽한 "영수증"을 통해 "모델이 언제 결정했는가?"라는 질문에 마침내 답을 제시합니다. 이는 단순히 추측하는 것이 아니라, 노이즈를 걸러내어 결정이 어디서 일어났는지 정확히 보여주기 위해 층별로 확률의 변화를 계산합니다.

저자들은 IG-Lens가 식별한 층을 "고장 내어(breaking)" 모델이 실제로 그 지점에서 제대로 작동을 멈추는지 테스트함으로써, 이 방법이 실제 결정 지점을 찾아내고 있다는 것을 증명할 계획입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →