← 최신 논문
💻 computer science

DMDIntel: Interpreting Large Language Models via Dynamic Mode Decomposition

이 논문은 동적 모드 분해(dynamic mode decomposition)를 활용하여 LLM의 은닉 상태를 주요 모드로 분해하고 입력 토큰의 순위를 매기는 새로운 해석 가능성 프레임워크인 DMDIntel을 소개하며, 여러 데이터셋과 모델 제품군에 걸쳐 PCA, Integrated Gradients, SHAP와 같은 최신 기여도 산출 방법들보다 우수한 성능을 입증한다.

원저자: Amogh Joshi, Animesh Mukherjee, Sergey Utyuzhnikov

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Amogh Joshi, Animesh Mukherjee, Sergey Utyuzhnikov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마술사가 모자에서 토끼를 꺼내는 장면을 보고 있다고 상상해 보십시오. 당신은 모자를 보고, 토끼를 봅니다. 하지만 마법은 그 두 가지 사이, 즉 마술사의 소매 안에서 일어나는 찰나의 순간에 발생합니다. 오랫동안 인공지면(AI)은 바로 그 마술사였습니다. 우리는 문장을 입력하고, AI는 답을 내놓지만, 정작 AI가 어떻게 그 답을 결정했는지는 아무도 알지 못합니다. AI는 '블랙박스'이며, 과학자들은 컴퓨터가 실제로 어떤 단어에 주목했는지 확인하기 위해 그 내부를 들여다보려고 필사적으로 노력하고 있습니다. 이 분야를 '해석 가능성(interpretability)'이라고 부릅니다. 이 새로운 논문을 이해하려면 먼저 두 가지를 알아야 합니다. AI가 텍스트를 읽는 방식과 우리가 보통 내부를 들여다보려고 시도하는 방법입니다.

LLM(Large Language Model)이라 불리는 AI 모델들은 우리처럼 단어를 읽지 않습니다. 대신, 모든 단어를 긴 숫자 리스트(벡터)로 변환한 뒤, 마치 계주 경기처럼 일련의 레이어(층)를 통과시킵니다. 각 레이어에서 숫자들은 미세하게 변하며, 현재 단어의 의미를 그 앞의 단어들과 혼합합니다. 경주가 끝날 때쯤, 모델은 최종적인 답변을 결정하는 최종 숫자 세트를 갖게 됩니다. 보통 어떤 단어가 중요했는지 알아내기 위해 과학자들은 모델의 '정적(static)' 상태를 살펴보는 도구들을 사용합니다. 이는 마치 계주 경기의 사진 한 장을 찍고 누가 가장 빨리 달리고 있는지 추측하는 것과 같습니다. 하지만 이 논문은 단 한 장의 사진을 보는 것이 전체 이야기를 놓칠 수 있다고 주장합니다. 대신, 숫자들이 다음 단계로 넘어갈 때 어떻게 진화하는지, 즉 '영화'를 보아야 한다고 주장합니다. 왜냐하면 AI 사고의 비밀은 바로 그 움직임 속에 있기 때문입니다.

여기서 Amogh Joshi와 IIT Kharagpur 및 맨체스터 대학교 연구팀이 도입한 새로운 방법인 DMDINTEL이 등장합니다. AI의 내부 처리를 단순한 숫자의 목록이 아니라, 흐르는 강물이라고 생각해 보십시오. AI가 문장을 읽을 때마다, '물'(숨겨진 정보)은 새로운 단어가 나올 때마다 물결치고 모양을 바꿉니다. 연구진은 유체 역학에서 물이 소용돌이치는 방식을 연구하기 위해 고안된 **동적 모드 분해(Dynamic Mode Decomposition, DMD)**라는 수학적 도구를 사용하여 이 물결을 지도화했습니다.

이 '강물' 비유가 실제로는 어떻게 작동하는지 살펴보겠습니다. AI가 문장을 읽을 때, 단어들의 숨겨진 상태는 복잡하게 소용돌이치는 패턴을 만들어냅니다. DMDINTEL은 이 패턴을 몇 가지 단순하고 반복적인 '모드(modes)' 또는 형태들로 분해합니다. 마치 바다의 복잡한 파도가 몇 가지 기본적인 파도의 형태들의 조합으로 설명될 수 있는 것과 같습니다. 연구진은 AI가 문장을 읽어 나감에 따라 이러한 형태들이 어떻게 커지고, 작아지고, 혹은 진동하는지를 관찰함으로써, 어떤 단어가 최종 결정의 '동력(driver)'이었는지 식별할 수 있다는 것을 발견했습니다. 그들은 AI를 하나의 **동적 시스템(dynamical system)**으로 취급했습니다. 즉, 단어 그 자체만을 보는 것이 아니라, 한 단어에서 다음 단어로 넘어가는 '변화'를 본 것입니다.

연구진은 이 아이디어를 세 가지 다른 AI 모델 계열(Llama, Qwen, Mistral)과 세 가지 다른 작업(리뷰가 긍정적인지 부정적인지 판단하기, 가짜 뉴스 탐지, 혐오 표현 탐지)에 대해 테스트했습니다. 그들은 자신들의 '강물 영화' 방식과 기존의 '정적 사진' 방식들을 비교했습니다. 기존 방식에는 Integrated Gradients, SHAP, 그리고 주성분 분석(PCA) 등이 포함됩니다.

결과는 DMDINTEL이 훨씬 더 뛰어난 탐정임을 시사합니다. 실험에서 이 새로운 방법은 다른 방법들보다 '그라운드 트루스(ground truth, 정답)'에 해당하는 가장 중요한 단어들을 일관되게 더 잘 찾아냈습니다. 예를 들어, AI가 리뷰가 부정적이라고 결정할 때, DMDINTEL은 'trash(쓰레기)', 'unable(불가능한)'과 같은 단어를 최우선 동력으로 정확히 순위를 매겼던 반면, 다른 방법들은 'scheduled(예정된)'나 'conference(컨퍼런스)'와 같이 덜 중요한 단어들에 의해 주의가 분산되기도 했습니다. 이 논문은 AI의 생각을 진화 과정을 관찰함으로써 DMDINTEL이 문장의 논리를 더 잘 포착한다는 것을 보여줍니다. 이는 AI의 추론이 단순히 멈춰 있는 단어들에 관한 것이 아니라, 문장이 구축됨에 따라 의미가 어떻게 흐르고 변형되는지에 관한 것임을 시사합니다.

하지만 저자들은 이것이 모든 AI 문제에 대한 만능 해결책은 아니라고 주의를 기울입니다. 그들의 방법은 AI가 문장을 읽고 단순한 답(예: 분류 작업)을 내놓을 때 가장 잘 작동합니다. 만약 AI가 긴 이야기를 쓰거나 책 한 권을 단어 단위로 번역하기 시작한다면, AI가 생성한 새로운 단어를 다시 시스템에 피드백하기 때문에 수학적으로 까다로워진다는 점을 인정합니다. 하지만 AI가 왜 특정 문장을 '혐오 표현'이나 '가짜 뉴스'로 분류했는지 설명하는 구체적인 작업에 있어서는, 숫자의 춤을 관찰하는 이 새로운 방식이 기계의 마음을 더 명확하고 정확하게 보여준다는 것을 이 논문은 보여주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →