← 최신 논문
💬 NLP

How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

이 논문은 언어 모델에서 나타나는 두 가지 뚜렷한 토큰 수준의 추론 실패 모드인, 조기 경로 고착을 특징으로 하는 확정적 실패(committed failure)와 의구심의 누적을 특징으로 하는 지속적 불확실성(persistent uncertainty)을 식별하고 규명하며, 이러한 시그니처가 다양한 구성에 걸쳐 재현 가능하다는 점과 자기 일관성(self-consistency)과 같은 실패 탐지 전략의 최적화를 가이드할 수 있음을 입증한다.

원저자: Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 한 형사가 미스터리를 해결하는 과정을 지켜보고 있다고 상상해 보세요. 때때로 형사는 초기에 실수를 저지릅니다. 잘못된 용의자를 지목하고는, 그 용의자가 무죄임에도 불구하고 왜 그가 범인인지에 대해 확신을 가지고 끝까지 논쟁하며 남은 영화를 보냅니다. 또 다른 경우에는, 형사가 내내 진심으로 혼란스러워하며 단서를 뒤적거리며 정답을 알지 못하다가 마지막 순간에야 답을 찾아내기도 합니다.

이 논문은 거대 언어 모델(LLM)이 답변을 작성할 때 그 "사고 과정"(chain of thought)을 관찰함으로써, 모델이 어떤 종류의 실수를 하고 있는지 파악하는 방법에 관한 것입니다. 연구진은 모델이 단순히 한 가지 방식으로 실패하는 것이 아니라, 두 가지 뚜렷한 패턴으로 실패한다는 것을 발견했습니다. 그리고 이 패턴을 인식하는 것은 우리가 오류를 잡아내는 방법을 바꾸어 놓습니다.

연구 결과는 다음과 같은 쉬운 비유를 사용하여 설명합니다.

1. 두 가지 유형의 실수

연구진은 모델이 답을 틀렸을 때, 대개 다음 두 가지 방식 중 하나로 발생한다는 것을 발견했습니다.

유형 A: "조기 확정" (고집 센 형사)

  • 현상: 모델이 사고 과정의 매우 초기에 잘못된 경로를 선택합니다. 일단 그 경로를 선택하면, 모델은 그 데에 "갇혀 버립니다." 더 이상 다른 가능성을 탐색하지 않고, 그 잘못된 생각을 뒷받침하기 위해 계속해서 문장을 써 내려갑니다.
  • 징후: 모델이 글을 쓰는 동안 "불확실성"(얼마나 확신하지 못하는지)을 살펴보면, 초기에 스파이크(급증)가 나타난 후 다시 떨어지는 것을 볼 수 있습니다. 모델이 너무 빨리 지나치게 확신을 가져버리는 것입니다.
  • 교훈: 모델이 틀렸다는 것을 알기 위해 이야기 전체가 끝나기를 기다릴 필요가 없습니다. 사실, 이야기의 을 읽는 것은 오히려 당신을 혼란스럽게 할 수 있습니다. 모델이 잘못된 답에 대해 너무 확신하고 있어서 마치 그것이 좋은 답처럼 보이기 때문입니다. 이 오류를 포착하기 가장 좋은 시점은 모델이 첫 번째 큰 실수를 저지른 직후입니다.

유형 B: "지속적인 불확실성" (혼란스러운 형사)

  • 현상: 모델은 결코 어느 한 쪽을 확실히 선택하지 못합니다. 모델은 답을 모르는 상태로 방황하며, 마지막 단어까지 계속해서 마음을 바꾸거나 망설입니다.
  • 징후: 모델의 불확실성은 높은 상태를 유지하거나 처음부터 끝까지 서서히 높아집니다. 모델은 단 하나의 경로에 고착되지 않습니다.
  • 교훈: 오류를 알기 위해서는 반드시 이야기를 끝까지 읽어야 합니다. 중간에 멈춘다면, 모델이 그저 신중하게 행동하고 있다고 생각할 수도 있습니다. 오류는 전체의 엉망진창인 사고 과정을 다 보고 나서야 명확해집니다.

2. 이를 어떻게 찾아냈는가 ( "불확실성 측정기")

연구진은 많은 인기 있는 AI 모델의 내부를 들여다볼 필요가 없었습니다(많은 경우 이는 불가능합니다). 대신, 그들은 로그 확률(log probabilities), 즉 기술적으로 말해 "모델이 타이핑하는 모든 단어에 대해 얼마나 확신했는가"를 살펴보았습니다.

그들은 모델의 추론 과정을 하나의 영화처럼 다루었습니다. 모델이 단어를 하나씩 입력할 때마다 "불확실성 측정기"가 어떻게 올라가고 내려가는지를 관찰했습니다.

  • 유형 A의 경우, 측정기는 초기에 명확한 정점을 찍은 후 평탄해졌습니다.
  • 유형 B의 경우, 측정기는 끝까지 계속 상승하거나 높은 상태를 유지했습니다.

연구진은 23가지의 서로 다른 AI 모델과 작업(수학, 코딩, 과학 등)의 조합을 대상으로 테스트했습니다. 23가지 중 20가지 사례에서 그들의 이론은 완벽하게 들어맞았습니다. 그들은 이러한 패턴을 살펴봄으로써 "고집스러운" 실수와 "혼란스러운" 실다를 구분할 수 있었습니다.

3. 이것이 중요한 이유: "제2의 의견" 전략

이 논문은 **자기 일관성(Self-Consistency)**이라고 불리는 흔한 기법도 살펴보았습니다. 이는 AI에게 같은 질문을 10번 던지고 가장 많이 등장하는 답변을 선택하는 방식입니다.

  • "고집 센" 모델 (유형 A)의 경우: 같은 질문을 10번 던지는 것은 무의미합니다. 모델이 고집스럽다면, 모델은 10번 연속으로 똑같은 오답을 내놓을 것입니다. "다수결"은 그저 잘못된 답을 확인해 줄 뿐입니다. 이 경우에는 여러 번 질문하는 것보다 단일 답변의 불확실성을 살펴보는 것이 실제로 더 낫습니다.
  • "혼란스러운" 모델 (유형 B)의 경우: 질문을 10번 던지는 것은 매우 도움이 됩니다. 모델이 진심으로 확신이 없다면, 매번 다른 답변을 내놓을 것이기 때문입니다. 모델이 스스로의 의견에 합의하지 못한다는 사실은 커다란 경고 신호가 됩니다.

핵심 요약

이 논문은 AI 오류를 잡아내기 위해 "하나의 크기로 모두에게 적용되는(one-size-fits-all)" 접근 방식을 사용해서는 안 된다고 주장합니다.

  • 만약 AI가 초기에 잘못된 생각에 고착된다면, 우리는 모델의 초기 확신 수준을 살펴봄으로써 빠르게 이를 잡아내야 하며, 두 번째 의견을 구하는 데 시간을 낭비해서는 안 됩니다(왜냐하면 모델이 똑같은 실수를 반복할 것이기 때문입니다).
  • 만 만약 AI가 진심으로 혼란스러워한다면, 우리는 모델이 사고 과정을 마칠 때까지 기다린 다음, 모델이 스스로의 의견에 합의할 수 있는지 확인하기 위해 여러 번의 의견을 물어봐야 합니다.

AI가 어떻게 실패하는지를 이해함으로써, 우리는 실수를 잡아내기 위한 적절한 도구를 선택할 수 있으며, 이를 통해 시간과 신뢰성을 높일 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →