← 최신 논문
🤖 machine learning

Local Causal Attribution of Chain-of-Thought Reasoning

이 논문은 사고의 사슬(chain-of-thought) 추론의 개별 구성 요소에 대해 국소적 인과적 기여도를 수행하기 위해 구조적 인과 모델을 구축하는 블랙박스 알고리즘인 AttriCoT을 소개하며, 이는 모델 행동에 대한 우수한 충실성을 입증하고 서로 다른 모델 및 도메인 전반에 걸친 뚜렷한 사고 구조를 밝혀낸다.

원저자: Dennis Wei, Yannis Belkhiter, Erik Miehling, Radu Marinescu

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dennis Wei, Yannis Belkhiter, Erik Miehling, Radu Marinescu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(super-smart AI와 같은)이 어려운 수학 문제나 논리 퍼즐을 풀고 있다고 상상해 보세요. 단순히 정답만 알려주는 대신, 단계별로 긴 "사고 과정(thought process)"을 먼저 작성합니다. 이것을 **연쇄 사고(Chain-of-Thought, CoT)**라고 부릅니다.

이 연쇄 사고를 탐정의 수첩이라고 생각해보세요. 탐정은 사건을 해결하기 전에 단서, 이론, 그리고 계산 과정을 적어 내려갑니다. 하지만 여기서 문제가 발생합니다. 탐정이 적어 내려간 내용 중 어떤 것은 논리적으로 들리긴 하지만, 실제로는 사건 해결에 전혀 도움이 되지 않을 수도 있습니다. 예를 들어, 엉뚱한 단서(red herring)에 대해 긴 이야기를 늘어놓거나, 결정적인 단서를 무시했을 수도 있습니다. 우리는 **도대체 수첩의 어떤 특정 기록이 최종 해답을 만들어낸 것인가?**라는 질문에 답하고 싶습니다.

이 논문은 이 질문에 답하기 위해 AttriCoT라는 새로운 도구를 소개합니다.

문제점: "가짜" 추론

현재로서는 AI가 작성한 텍스트가 정답을 맞히는 데 있어 '진짜' 이유인지 우리가 정말로 알지 못합니다. 때때로 AI는 운 좋게 정답을 맞힌 뒤, 이를 정당화하기 위해 길고 정교한 가짜 이야기를 지어내기도 합니다. 또 다른 경우에는 머릿속으로는 단계를 건너뛰면서 겉으로는 적어 내려놓기만 할 수도 있습니다.

과학자들은 다음과 같은 방법으로 이를 파악하려 노력해 왔습니다:

  1. AI에게 직접 물어보기: "헤이, 네 사고 과정 중에서 어떤 부분이 가장 중요했니?" (이는 학생에게 자기 숙제를 스스로 채점하게 하는 것과 같습니다. 학생은 거짓말을 하거나 혼란스러워할 수 있습니다.)
  2. 부분을 삭제하고 결과 관찰하기: 만약 사고 과정에서 문장 하나를 지웠을 때, AI가 오답을 내놓게 될까요? 이는 좋은 아이디어이지만, 모든 문장에 대해 이 작업을 수행하는 것은 엄청난 컴퓨터 자원을 소모합니다. 마치 지붕을 받치고 있는 벽돌이 무엇인지 알아내기 위해 집을 벽돌 한 장씩 다시 짓는 것과 같습니다.

해결책: AttriCoT (The "Causal Detective")

저자들은 AI의 생각에 대한 포렌식 회계사 역할을 하는 AttriCoT라는 방법을 만들었습니다.

비유: 레시피 테스트
복잡한 케이크 레시피에서 어떤 재료가 실제로 케이크 맛을 좋게 만드는지 알아내려고 한다고 가정해 봅시다.

  • 기존 방식: 재료 하나를 테스트할 때마다 케이크를 새로 굽습니다. 레시피에 재료가 50개라면, 케이트를 50번 굽습니다. 이는 느리고 비용이 많이 듭니다.
  • AttriCoT의 방식: 케이크를 한 번 굽습니다. 그 다음, 실제로 케이크를 매번 다시 굽지 않고도 설탕을 빼거나, 밀가루를 빼거나, 달걀을 뺐을 때 어떤 일이 벌어질지 시뮬레이션하는 특별한 수학적 기법을 사용합니다. 우리는 재료가 빠졌다고 가정했을 때 "맛 점수"(AI의 확신도)가 얼마나 떨어지는지를 측정합니다.

AttriCoT의 작동 원리 (3단계):

  1. "만약에" 게임: 특정 연쇄 사고(AI의 수첩)를 가져와서 이를 "단위(unit)"(문장 또는 구절)라고 불리는 작은 조각들로 나눕니다. 그런 다음 다음과 같은 "만약에" 시나리오 목록을 만듭니다: "단위 1을 제거한다면?", "단위 2를 제거한다면?"
  2. 빠른 확인: 전체를 다시 굽는(AI를 처음부터 다시 실행하는) 대신, 특정 단위가 빠졌을 때 다음 단계에 대한 AI의 확신도가 얼마나 떨어지는지 확인하는 매우 빠르고 가벼운 체크를 수행합니다.
  3. 수학적 지도: 점들을 연결하기 위해 간단한 수학 공식(선형 모델)을 사용합니다. 예를 들어, "단계 3은 단계 7에 대해 80%의 책임을 가졌지만, 단계 2는 단계 7에 거의 아무런 영향을 주지 않았다"라고 말할 수 있습니다.

연구 결과

연구진은 5가지 유형의 퍼즐(수학, 논리, 과학)과 4가지 종류의 AI 모델을 대상으로 테스트를 진행했습니다.

  1. 더 높은 정확도: AttriCoT는 다른 방법들보다 진짜 중요한 단계를 찾는 데 훨씬 뛰어났습니다. "핵심" 단계를 제거했을 때 실제로 AI의 답이 틀리는지를 확인했을 때, AttriCoT의 예측이 가장 신뢰할 수 있었습니다.
  2. 효율성: AI를 수천 번 실행할 필요가 없었습니다. 단지 사고 과정의 단계 수만큼만 실행하면 되었습니다. 덕분에 길고 복잡한 추론 체인에도 사용할 수 있을 만큼 빠릅니다.
  3. 새로운 통찰: AttriCoT가 생성한 "점수"를 통해 흥el로운 패턴을 발견했습니다:
    • 시작과 끝이 가장 중요하다: 맨 처음 생각(AI가 질문을 읽는 부분)과 마지막 생각(AI가 답을 재확인하는 부분)이 가장 큰 영향을 미치는 경향이 있습니다.
    • 되돌아보기: 어려운 문제를 푸는 중간에, AI는 세부 사항을 잊지 않기 위해 원래의 질문을 다시 읽는 과정을 거치곤 합니다.
    • 모델마다 다른 습관: 어떤 모델은 과정 내내 원래의 질문에 크게 의존하는 반면, 어떤 모델은 자신의 이전 단계들에 더 많이 의존합니다.

결론

이 논문은 AI를 고치거나 더 똑똑하게 만들겠다고 주장하는 것이 아닙니다. 대신, AI의 "블랙박스" 내부의 추론을 들여다볼 수 있는 손전등을 제공합니다. 이를 통해 우리는 AI의 사고 과정 중 어떤 부분이 실제로 정답으로 이어졌고, 어떤 부분이 단순한 노이즈였는지를 단계별로 확인할 수 있습니다. 이는 AI가 진정으로 추론을 하고 있는지, 아니면 그냥 진행하면서 말을 지어내고 있는 것인지를 이해하는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →