← 최신 논문
🤖 machine learning

CQD-SHAP: Explainable Complex Query Answering via Shapley Values

본 논문은 협동 게임 이론의 샤플리 값(Shapley values)을 활용하여 불완전한 지식 그래프에 대한 설명 가능한 복합 쿼리 응답을 제공함으로써 각 쿼리 부분의 답변 순위 기여도를 정량화하고, 이를 통해 기존의 블랙박스 및 신경-기호(neurosymbolic) 모델의 해석 가능성 한계를 해결하는 새로운 프레임워크인 CQD-SHAP을 제안한다.

원저자: Parsa Abbasi, Stefan Heindorf

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Parsa Abbasi, Stefan Heindorf

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "블랙박스" 탐정

거대한 도서관(지식 그래프, Knowledge Graph)이 있다고 상상해 보세요. 이 도서관의 책들은 실로 서로 연결되어 있습니다. 때때로 이 도서관에는 페이지가 빠져 있거나 책 자체가 통째로 비어 있기도 합니다(불완전함).

"해리 포터는 누가 썼나요?"와 같은 단순한 질문을 던지면, 컴퓨터는 보통 그 실들을 따라 걸어가며 답을 찾을 수 있습니다. 하지만 만약 **"당뇨병을 치료하면서 동시에 신장 독성을 유발하는 약물은 무엇인가?"**와 같은 복잡한 질문을 던진다면 어떻게 될까요?

이 질문에 답하기 위해 컴퓨터는 두 가지 일을 해야 합니다.

  1. 실을 따라 걷기 (기호적 접근 방식): 기존 도서관에 명시적으로 적혀 있는, 당뇨병을 치료하고 신장 독성을 일으키는 약물을 찾습니다.
  2. 누락된 연결 고리 추측하기 (신경망 접근 방식): 도서관이 불완전하기 때문에, 컴퓨터는 아직 기록되지 않았지만 마땅히 존재해야 할 연결 관계를 추론하기 위해 "똑똑한 추측기(신경망)"를 사용합니다.

문제는 이 "똑똑한 추측기"가 블랙박스라는 점입니다. 이 모델은 답(예: "인슐린")을 제시하지만, 그 답을 골랐는지는 알려주지 않습니다. 도서관에 명시되어 있어서 고른 것일까요? 아니면 도서관에는 없지만 컴퓨터가 인슐린과 신장 독성 사이의 연관성을 추측했기 때문에 고른 것일까요?

CQD-SHAP은 이 블랙박스를 열어 각 질문의 구성 요소가 최종 답변에 얼마나 기여했는지를 정확하게 설명하기 위해 설계된 새로운 도구입니다.


핵심 아이디어: "팀 점수" 비유

저자들은 게임 이론의 개념인 **샤플리 값(Shapley Values)**을 사용합니다. 이것을 하나의 팀 프로젝트라고 생각해 보세요. 팀원들(질문의 원자/atoms)이 협력하여 성적(답변의 순위)을 받는 과정입니다.

우리의 예시 질문("당뇨병 및 신장 독성 약물")에는 두 명의 "학생"(원자)이 있습니다.

  1. 학생 A: "당뇨병을 위한 약물"
  2. 학생 B: "신장 독성을 위한 약물"

최종 성적(인슐린의 순위)은 두 학생이 얼마나 잘 수행했느냐에 따라 달라집니다. 그렇다면 학생 A와 학생 B에게 각각 얼마만큼의 공로를 돌려야 할까요?

CQD-SHAP은 공정한 심판 역할을 합니다. 이 도구는 점수를 산출하기 위해 수천 번의 미니 실험을 수행합니다.

  • 시나리오 1: 학생 A는 "도서관 걷기"(기호적)를 수행하고, 학생 B는 "똑똑한 추측기"(신경망)를 사용합니다.
  • 시나리오 2: 학생 A는 "똑똑한 추측기"를 사용하고, 학생 B는 "도서관 걷기"를 사용합니다.
  • 시나리오 3: 둘 다 "도서관 걷기"를 사용합니다.
  • 시나리오 4: 둘 다 "똑똑한 추측기"를 사용합니다.

이 시나리오들을 비교함으로써, CQD-SHAP은 "똑똑한 추측기"가 각 학생의 최종 성적을 얼마나 향상시켰는지 정확히 계산해 냅니다.

"아하!" 모먼트: 이것이 왜 중요한가

이 논문은 이 방법이 놀라운 사실을 밝혀낸다고 주장합니다. 때로는 "똑똑한 추측기"가 모든 힘을 쓰고 있기도 하고, 때로는 오히려 결과를 해치기도 한다는 것입니다.

"시끄러운 이웃"의 비유:
당신이 특정 집(정답)을 찾으려고 한다고 가정해 봅시다.

  • 도서관 걷기는 공식 주소록을 읽는 것과 같습니다. 정확하지만, 주소록이 오래되었다면 그 집이 목록에 없을 수도 있습니다.
  • 똑똑한 추측기는 주변을 잘 아는 이웃에게 물어보는 것과 같습니다. 이웃은 주소록에 집이 없더라도 그 집이 존재한다는 것을 알 수도 있습니다.

CQD-SHAP은 다음과 같이 말해줄 수 있습니다.

"'인슐린'이라는 답변에 대해, 질문의 '신장 독성' 부분은 똑똑한 추측기가 연결 고리를 추측해 냈기 때문에 엄청난 보너스(+450점)를 받았습니다. 반면, '당뇨병' 부분은 똑똑한 추측기가 혼란을 느껴 잘못된 이웃을 제안했기 때문에 약간의 감점(-10점)을 받았습니다."

CQD-SHAP이 없다면, 당신은 그저 리스트 상단에 있는 "인슐린"을 보고 컴퓨터가 100% 확신한다고 믿게 될 것입니다. 하지만 CQD-SHAP이 있다면 이렇게 깨닫게 됩니다. "잠깐, 컴퓨터가 신장 부분에 대해서는 대부분 추측에 의존하고 있구나. 이 사실은 직접 다시 확인해 봐야겠어."

테스트 방법 (스트레스 테스트)

저자들은 실제 데이터셋(Freebase 및 NELL 등)을 사용하여 다양한 유형의 복잡한 질문(AND 또는 OR 포함)을 대상으로 테스트를 진행했습니다.

그들은 어떤 부분이 중요한지를 추측하는 다른 방식들(예: 첫 번째 부분을 선택하거나, 마지막 부분을 선택하거나, 점수가 가장 낮은 부분을 선택하는 방식 등)과 이 방법을 비교했습니다.

결과:

  • 필수적 설명 (Necessary Explanations): 가장 중요한 부분에서 "똑똑한 추측기"를 제거했을 때, 답변의 순위가 크게 떨어져야 합니다. CQD-SHAP은 다른 방법들보다 이 결정적인 부분을 훨씬 더 잘 찾아냈습니다.
  • 충분한 설명 (Sufficient Explanations): 가장 중요한 부분에만 "똑똑한 추측기"를 적용했을 때, 답변의 순위가 크게 올라가야 합니다. 이 역시 CQD-SHAP이 승리했습니다.

간단히 말해, CQD-SHAP은 왜 특정 답변이 높거나 낮은 순위를 갖게 되었는지 설명하기 위해 질문의 어느 부분을 지목해야 하는지 일관되게 찾아내는 유일한 방법입니다.

핵심 요약

  1. 답변뿐만 아니라 "이유"가 중요합니다: 이 도구는 각 논리적 단계의 기여도를 분해함으로써, 복잡한 질의가 왜 특정 결과를 반환했는지 설명합니다.
  2. "추측 능력"을 측정합니다: 신경망의 기능(누락된 사실을 추측하는 능력)이 최종 순위에 얼마나 도움을 주었는지(혹은 방해가 되었는지)를 구체적으로 수량화합니다.
  3. 수학적으로 공정합니다: 샤플리 값(Shapley Values)이라는 엄격한 수학적 공식을 사용하여 질문의 각 부분에 "공로"가 공정하게 배분되도록 합니다.
  4. 오류를 잡아냅니다: 높은 순위의 답변이 사실은 약하거나 노이즈가 섞인 추측에 기반하고 있다는 것을 드러낼 수 있어, 사용자가 시스템을 맹목적으로 신뢰하지 않도록 도와줍니다.

이것이 아닌 것 (논문에 근거함)

  • 이 모델은 질병을 치료하거나 환자를 진단한다고 주장하지 않습니다. "약물" 예시는 작동 방식을 보여주기 위한 은유일 뿐입니다.
  • 이 모델이 의사나 변호사를 대체할 것이라고 말하지 않습니다. 이는 AI 모델이 어떻게 생각하는지 이해하도록 돕는 도구입니다.
  • 모든 AI의 "블랙박스" 문제를 해결한다고 주장하는 것이 아니라, 이 특정 유형의 복잡한 질의 응답 시스템에 국한된 도구입니다.

요약하자면, CQD-SHAP은 AI 탐정의 "성적표" 역할을 하는 투명성 도구입니다. 어떤 단서(질의 부분)가 실제 사실이고 어떤 것이 똑똑한 추측인지 보여줌으로써, 사용자가 무엇을 믿어야 할지 알 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →