LLM Explainability with Counterfactual Chains and Causal Graphs
이 논문은 인과 그래프와 MCMC에서 영감을 얻은 반사실적 증강을 활용하여 LLM의 추론을 내부적으로 모델링함으로써, 모델이 예측을 생성하기 위해 정보를 어떻게 인지하고 조직하는지에 대한 투명한 개념 수준의 설명을 생성하는 4단계 방법론을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 매우 똑똑하지만 신비로운 검은 상자(거대 언어 모델 또는 LLM)를 가지고 있다고 상상해 보세요. 당신이 이 상자에 이야기를 입력하면, 상자는 답을 내놓습니다. 하지만 당신은 왜 그 답을 선택했는지 전혀 알 수 없습니다. 이것은 마치 요리사에게 "왜 이 수프가 짜죠?"라고 물었을 때, 요리사가 소금을 넣었는지, 육수가 짠 것인지, 아니면 맛을 보는 것을 깜빡한 것인지 알려주지 않고 그저 "그냥 그래요"라고 대답하는 것과 같습니다.
이 논문은 인간이 이해하기에는 너무 복잡한 내부의 작은 기어들을 들여다보는 대신, 단순한 순서도를 사용하여 요리사의 사고 과정을 매핑함으로써 이 검은 상자를 여는 방법을 제안합니다.
다음은 일상적인 비유를 사용하여 설명한 이들의 방식입니다.
1. 목표: "사고 지도(Thought Map)" 그리기
모델 내부의 수백만 개의 작은 숫자들을 이해하려고 노력하는 대신, 저자들은 모델이 사용하는 핵심 아이디어(개념)를 찾고자 합니다.
- 비유: 모델이 범죄를 해결하는 탐정이라고 상상해 보세요. "개념"은 단서(예: "진흙 묻은 신발", "깨진 창문", "사라진 열쇠")입니다. 이 논문은 탐정이 사건을 해결하기 위해 이 단서들을 어떻게 연결하는지 보여주는 지도를 그리려 합니다.
- 지도: 그들은 **인과 그래프(Causal Graph)**를 만듭니다. 이는 화살표로 인과관계를 보여주는 도표입니다. 예를 들어: 진흙 묻은 신발 → 용의자가 외부에 있었음 → 유죄 판결. 이 지도는 모델이 결정을 내리기 위해 정보를 어떻게 조직하는지 설명합니다.
2. 문제점: "희소한 도서관(Sparse Library)"
정확한 지도를 그리려면 탐정이 가능한 모든 단서의 조합을 살펴보는 것을 목격해야 합니다. 하지만 현실 세계에서는 아주 적은 사건 파일만을 가질 수 있습니다. 당신은 100개의 이야기를 가지고 있을 수도 있지만, 그 이야기들은 모두 우연히 "진흙 묻한 신발"을 포함하고 있을 수 있습니다. "진흙 묻은 신발"은 있지만 "깨진 창문"은 없는 사례는 한 번도 보지 못할 수도 있습니다.
- 문제: 만약 당신이 가진 몇 안 되는 이야기들만 본다면, 당신의 지도는 불완전하고 흔들릴 것입니다. 당신은 "진흙 묻은 신발"이 항상 "유죄"로 이어진다고 생각할 수도 있지만, 실제로는 아직 보지 못한 다른 단서들에 따라 달라질 수 있습니다.
3. 해결책: "만약에(What-If)" 기계 (MCMC)
이것이 이 논문의 가장 큰 혁신입니다. 실제 사례가 일어나기를 기다릴 수 없기 때문에, 그들은 AI 자체를 사용하여 새로운 사례를 상상하게 합니다.
- 비유: "만약에" 기계를 생각해보세요. 당신은 AI에게 이렇게 말합니다: "비 오는 날에 대한 이 이야기를 가져오되, 만약 비가 오지 않았다면 어떻게 될까? 다른 모든 것은 그대로 둔 채로."
- 과정:
- AI는 실제 이야기를 가져옵니다.
- AI는 스스로 묻습니다: "'부드러움'이라는 개념을 '물렁한'에서 '단단한'으로 바꾸면 어떻게 될까?"
- AI는 그 변화에 맞춰 이야기를 다시 씁니다 (예: "오늘 나는 물렁한 파파야 대신 단단한 파파야를 먹었다").
- AI는 확인합니다: "내가 '색깔'이나 '냄ors(냄새)'를 실수로 바꾸지 않고 '부드러움'이라는 개념을 성공적으로 바꿨는가?"
- 만약 그렇다면, 이 새로운 이야기를 유지합니다. 만약 아니라면, 다시 시도합니다.
- 결과: 그들은 이러한 "만 if" 이야기들을 수천 개 만들어냅니다. 이는 그들의 도서관에 빈틈을 채워주어, 가능한 모든 단서의 조합에 대해 모델이 어떻게 반응하는지에 대한 완전한 관점을 제공합니다.
4. 발견: 최종 지도 그리기
이 거대한 실제 및 "만약에" 이야기 도서관이 준비되면, 그들은 특별한 수학 도구(-CG)를 사용하여 최종 지도를 그립니다.
- 결과: 지도는 모델이 어떤 개념에 관심을 가지며 그것들이 어떻게 연결되는지를 보여줍니다.
- 예시: 의료 진단 작업에서, 지도는 "발열"과 "피로"가 모두 "독감"을 가리키지만, "발열" 하나만으로는 부족하다는 것을 보여줄 수 있습니다.
- 놀라움: 그들은 서로 다른 AI 모델(예: Gemini vs. Qwen)이 서로 다른 지도를 사용한다는 것을 발견했습니다. 어떤 모델은 "어조"에 크게 의존하는 반면, 다른 모델은 같은 답을 내놓더라도 "구체적인 세부 사항"에 더 의존할 수 있습니다.
5. 효과가 있었는가? (증명)
정답인 지도가 존재하지 않기 때문에(왜냐하면 우리는 AI의 마음을 읽을 수 없기 때문입니다), 그들은 두 가지 방식으로 지도를 테스트했습니다.
- 예측력: 지도의 "부모" 단서들을 간단한 계산기에 입력했을 때, 무작위 추측보다 AI의 답을 더 잘 예측할 수 있는가? 네, 지도는 매우 잘 작동했습니다.
- 안정성: 만약 "만약에" 기계를 몇 번 더 실행한다면, 지도가 변하는가? 아니요, 지도는 변하지 않았습니다. 이는 지도가 단순히 우연이 아니라 견고하다는 것을 증证明합니다.
요약
이 논문은 다음과 같은 방법으로 AI를 설명 가능하게 만드는 방법을 소개합니다:
- AI에게 어떤 "핵심 아이디어"를 사용하는지 묻습니다.
- AI를 사용하여 빈틈을 채우기 위해 수천 개의 "만약에" 시나리오를 상상하게 합니다.
- 그 아이디어들의 인과관계 지도를 그립니다.
이것은 인간에게 AI의 최종 답변만을 보여주는 것이 아니라, AI가 어떻게 생각하는지에 대한 명확하고 높은 수준의 관점을 제공합니다. 이것은 요리사의 수프를 맛보는 대신, 요리사로부터 레시피 카드를 받는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.