← 최신 논문
💻 computer science

Towards Explainability of SLMs by investigating Token Level Activation

본 논문은 BERT 에서 8 번째 계층의 은닉 상태 활성화 강도를 분석하여 토큰 수준의 중요도를 정량화하는 경량화 및 모델 독립적 프레임워크인 활성화 흐름 네트워크 (AFN) 를 제안하며, 의미론적으로 유의미한 토큰이 구조적 토큰보다 현저히 높은 활성화 크기를 보임을 입증함으로써 어텐션 중심 방법론에 대한 해석 가능한 대안을 제시한다.

원저자: Sayantani Ghosh, Rajashik Datta, Amit Kumar Das, Amlan Chakrabarti

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sayantani Ghosh, Rajashik Datta, Amit Kumar Das, Amlan Chakrabarti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. BERT라는 이름의 매우 똑똑하지만 비밀스러운 로봇 도서관 사서가 있다고 가정해 봅시다. 이 사서는 거의 모든 것이 쓰인 것을 읽었고, 문장 속의 질문을 답하거나 감정을 이해할 수 있습니다. 하지만 함정이 하나 있습니다. 아무도 이 사서가 실제로 어떻게 생각하는지 알지 못한다는 것이죠. 이는 마치 '블랙박스'와 같습니다. 문장을 넣으면 답이 나오지만, 그 안의 기어들은 숨겨져 있습니다.

오랫동안 연구자들은 사서의 '주의 (attention)'를 살펴봄으로써 그 안을 엿보려고 노력했습니다. 그들은 "만약 사서가 어떤 단어를 보고 있다면, 그 단어는 분명 중요할 것이다!"라고 생각했습니다. 하지만 그들은 하나의 트릭을 발견했습니다. 사서는 종종 쉼표, 마침표, 또는 'the'나 'is'와 같은 지루한 단어들을 빤히 응시하는 반면, 'beautiful', 'disaster', 'Canada'와 같은 실제 핵심 단어들은 무시한다는 것입니다. 이는 마치 문으로 걸어 들어가는 사람을 무시하고 문손잡이만 확대해서 보여주는 보안 카메라를 보는 것과 같습니다.

새로운 아이디어: '시선' 대신 '에너지' 측정하기

이 논문의 저자들은 다른 접근 방식을 취하기로 결정했습니다. "사서가 어디를 보고 있는가?"라고 묻는 대신, "사서가 각 단어를 생각할 때 얼마나 많은 에너지를 사용하고 있는가?"라고 질문했습니다.

그들은 사서의 뇌에 있는 특정 방인 8 층에 집중했습니다. 사서의 뇌를 12 층 건물의 한 층으로 생각해 보세요:

  • 1~5 층: 지상층입니다. 여기서 사서는 대문자나 단어가 명사인지 동사인지와 같은 기본적인 것들을 단순히 인지합니다.
  • 10~12 층: 펜트하우스입니다. 최종 답변이 결정되는 곳입니다.
  • 8 층 (최적의 지점): 이는 '통합 구역'입니다. 사서가 문법을 보는 것을 멈추고 이야기의 의미를 진정으로 이해하기 시작하는 곳입니다.

연구자들은 **활성화 흐름 네트워크 (Activation Flow Network, AFN)**라는 도구를 개발했습니다. 사서의 눈을 관찰하는 대신, 각 단어가 8 층을 통과할 때 흐르는 '전기' (수학적으로 L2 노름이라고 함) 를 측정했습니다.

그들이 발견한 것: '고전압' 단어들

이 에너지를 측정했을 때, 그들은 명확한 패턴을 발견했습니다:

  • '고전압' 단어들: 'prime', 'minister', 'Canada', 'beautiful', 'enjoying'과 같은 내용 풍부한 단어들은 밝은 네온 사인처럼 빛났습니다. 이들은 가장 높은 에너지를 가지고 있었습니다.
  • '저전압' 단어들: 'the', 'of'와 같은 구조적 단어나 '?'와 같은 문장 부호는 더 어두웠습니다. 그들은 존재했지만, 의미의 주요 무게를 지고 있지는 않았습니다.

비유: 집 정리를 하는 이주 팀을 상상해 보세요. '고전압' 단어는 무거운 소파와 피아노입니다. 이들을 옮기는 데는 가장 많은 노력이 필요합니다. '저전압' 단어는 빈 상자나 테이프입니다. 이들은 작업에 필요하지만, 많은 공간이나 에너지를 차지하지는 않습니다. 연구자들은 8 층에서 무거운 짐을 드는 작업이 이루어진다는 것을 발견했습니다.

'파동 효과' 실험

이를 증명하기 위해 연구자들은 '차이점 찾기' 게임을 했습니다. 그들은 사서에게 매우 유사한 두 문장을 주었습니다:

  1. "Enjoying a beautiful day at the park!"
  2. "Enjoying a beautiful walk at the beach!"

그들은 'day'를 'walk'로, 'park'를 'beach'로 바꿨을 때 '에너지'가 어떻게 변하는지 관찰했습니다.

  • 분명한 사실: 변경된 단어들 ('day'와 'park') 은 에너지가 급격히 증가했습니다.
  • 놀라운 사실: 변경되지 않은 단어들 (예: 'beautiful' 또는 'at') 도 상당한 에너지 변화를 보였습니다!

비유: 이는 연못에 돌을 던지는 것과 같습니다. 하나의 단어 (돌) 를 바꾸면, 파동 (에너지 변화) 이 퍼져나가 돌이 직접 맞지 않은 부분까지 물을 변화시킵니다. 이는 8 층이 깊이 연결되어 있음을 보여주었습니다. 이야기의 한 부분을 바꾸면 전체 문장이 그 의미를 다시 생각하게 만든다는 것입니다.

'통' 테스트

마지막으로, 그들은 간단한 규칙을 사용하여 '중요한' 단어와 '배경' 단어를 분리해 보았습니다. 그들은 선 (임계값) 을 그어 에너지가 높은 모든 단어를 HIGH 통에 넣고 나머지를 LOW 통에 넣었습니다.

그들은 다음과 같은 사실을 발견했습니다:

  • HIGH 통에는 단어의 약 25% 만 들어 있었습니다 (중요한 단어들).
  • 하지만, 이 소수의 단어들이 전체 의미 변화의 **76%**를 담당했습니다.

비유: 이는 25% 의 음악가 (솔로 연주자들) 가 모두가 기억하는 멜로디를 연주하고, 나머지 75% 는 배경 리듬을 연주하는 콘서트와 같습니다. 솔로 연주자를 음소거하면 노래는 영혼을 잃습니다. 배경을 음소거하면 노래는 여전히 들리지만, 조금 공허하게 느껴질 뿐입니다.

큰 교훈

이 논문은 단순히 "BERT 는 똑똑하다"고 말하는 것이 아닙니다. 이는 BERT 가 어떻게 생각하는지 볼 수 있는 새로운 방식을 제시합니다. 과정의 중간 (8 층) 에서 단어의 '에너지'를 측정함으로써, 그들은 '블랙박스'를 '글라스박스'로 바꾸었습니다.

그들은 BERT 가 단순히 문장 부시를 응시하는 것이 아니라, 실제 의미를 전달하는 단어들에 정신적 에너지를 집중하고 있음을 보여주었습니다. 이는 모델이 문장을 처리할 때, 세상을 이해하기 위해 '내용' 단어들에 많은 무거운 작업을 수행하는 반면, '구조' 단어들은 단순히 프레임을 함께 묶어준다는 것을 이해하는 데 도움이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →