← 최신 논문
🤖 AI

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

이 논문은 LLM의 수학적 추론에서 실패를 유발하는 정밀한 단일 토큰 트리거로서 "클리프 토큰(cliff tokens)"을 소개하며, 이러한 토큰들의 분류 체계를 제안하고 Cliff-DPO를 통해 이들을 최적화하는 것이 다양한 벤치마크에서 모델 정확도를 유의미하게 향상시킨다는 것을 입증한다.

원저자: Jaeyong Ko, Pilsung Kang, Yukyung Lee

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jaeyong Ko, Pilsung Kang, Yukyung Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델(LLM)이 수학 문제를 풀려고 노력하는 것은 등산객이 산 정상에 도달하려는 것과 같습니다. 대부분의 경우, 등산객은 정상으로 향하는 명확하고 안전한 경로를 따라갑니다. 하지만 때때로, 같은 지도와 같은 산에서도 등산객은 길을 잘못 들어 골짜기에 빠지게 되고, 결국 정상을 정복하지 못합니다.

오랫동안 연구자들은 이러한 "잘못된 길"이 발생한다는 사실은 알고 있었지만, 등산객이 정확히 어디에서 경로를 이탈했는지는 알지 못했습니다. 그것이 잘못된 사고가 담긴 문단 전체였을까요? 문장 하나였을까요? 아니면 모든 것을 바꿔버린 단 하나의 특정 단어였을까요?

이 논문은 **"클리프 토큰(Cliff Token, 절벽 토큰)"**이라는 새로운 개념을 소개합니다.

절벽 비유

등산객의 여정을 절벽 옆을 따라가는 경로라고 생각해 보십시오. 여정의 대부분 동안 지면은 단단합니다. 하지만 어느 순간, 지면이 갑자기 깊은 구렁텅이로 떨어지는 특정한 발걸음이 존재합니다. 일단 등산객이 그 한 걸음을 내딛고 나면, 정상으로 가는 길은 사라집니다. 그 지점에서 아무리 열심히 다시 올라가려 노력해도, 정상을 향해 올라갈 수 없습니다.

저자들은 이 단 한 번의 치명적인 발걸음을 클리프 토큰이라고 부릅니다.

그들은 어떻게 절벽을 찾아냈는가

이전에는 연구자들이 여정의 큰 덩어리(예: 문장 전체)를 살펴보거나, 등산객이 이미 길을 잃은 후에 무엇이 잘못되었는지 확인하곤 했습니다. 이 논문은 더 정밀한 도구인 통계적 **"다이빙 보드(diving board)"**를 사용합니다.

그들은 매 단어마다 등산객이 경로를 64번 다르게 시뮬레이션하도록 합니다. 만약 특정 단어 이후에 정상에 도달할 확률이 급격히 떨어진다면(마치 절벽 아래로 떨어지는 것처럼), 그 단어를 "클리프 토큰"으로 표시합니다. 그들은 이것이 단순한 무작위한 흔들림이 아니라 실제적인 하락임을 확인하기 위해 특별한 수학적 테스트(z-검정)를 사용합니다.

핵심 발견: 단 한 단어가 모든 것을 망칠 수 있다

연구진은 이 방법을 7개의 서로 다른 AI 모델과 3개의 수학 벤치마크에 테스트했습니다. 그들은 놀라운 사실을 발견했습니다:

  • 트리거(Trigger): 많은 실패 사례에서, 모델이 길을 잃게 만든 것은 정확히 단 하나의 단어였습니다.
  • 해결책: 그 "클리프 토큰"을 삭제하고 모델에게 그 단어 직전의 단어부터 다시 시작하도록 요청하면, 모델은 거의 항상(테스트에서 100% 회복) 올바른 답을 찾아냅니다.
  • 함정: 만약 모델에게 그 나쁜 단어를 강제로 유지하게 한다면, 설령 64번의 재시도를 허용하더라도 모델은 대개 여전히 실패합니다. 그 단 하나의 단어가 모델을 막다른 길로 가두어 버립니다.

세 가지 유형의 "절벽"

연구진은 이 잘못된 단어들을 서로 다른 위험한 지형처럼 세 가지 범주로 분류했습니다:

  1. 확신에 찬 절벽 (결정론적 - Deterministic): 모델은 이 단어가 맞다고 100% 확신하지만, 실제로는 틀렸습니다. 이는 마치 등산객이 다리라고 생각해서 자신 있게 발을 내디뎠지만 실제로는 낭떠러지인 상황과 같습니다. 이는 모델의 깊게 자리 잡은 습관이나 편향 때문에 발생합니다. 더 크고 똑똑한 모델으로 교체하더라도 똑같은 실수를 저지릅니다.
  2. 불확실한 절벽 (불확실성 - Uncertain): 모델이 혼란스러워하는 상태입니다. 갈림길 앞에 서서 어느 방향으로 갈지 결정하지 못하고 잘못된 경로를 선택합니다. 이는 모델이 특정 지식이 부족하기 때문에 발생합니다. 더 큰 모델은 지식이 더 많기 때문에 이 실수를 하지 않을 수 있습니다.
  3. 운 좋은 추측의 절벽 (샘플링 오류 - Sampled-off): 모델은 올바른 경로를 알고 있지만, 뇌 속의 무작위한 노이즈에 의해 주의가 분산되어 엉뚱하고 확률이 낮은 단어를 우연히 선택합니다. 이는 마치 등산객이 느슨한 돌에 걸려 넘어지는 것과 같습니다. 이것은 순전한 불운입니다.

등산객을 고치기 (Cliff-DPO)

저자들은 단순히 절벽을 찾는 데 그치지 않고, 이를 해결하려고 노력했습니다. 그들은 AI 모델이 이러한 "클리프 토큰"을 피하는 법을 구체적으로 학습시켰습니다.

  • 효과가 있었던 것: 모델에게 불확실한(Uncertain) 절벽과 운 좋은 추측(Lucky Guess) 절벽을 피하도록 가르치는 것은 모델의 수학 능력을 크게 향상시켰습니다. 이는 마치 등산객에게 혼란스러울 때 더 주의 깊게 살피거나 무작위한 방해 요소를 무시하도록 가르치는 것과 같습니다.
  • 효과가 없었던 것: 모델에게 확신에 찬(Confident) 절벽을 피하도록 가르치는 것은 도움이 되지 않았습니다. 이것들은 깊게 뿌리 박힌 습관이기 때문에, 단순히 모델에게 "그렇게 하지 마"라고 말하는 것만으로는 그 근본적인 본성을 바꾸기에 충분하지 않았습니다.

결론

이 논문은 AI의 수학적 추론 실패가 항상 모델이 전반적으로 "멍청해서" 발생하는 것이 아님을 보여줍니다. 종종, 그것은 함정 역할을 하는 단 하나의 단어 때문입니다. 이 단 하나의 단어를 식별하고 제거하거나, 그러한 유형의 함정을 피하도록 모델을 훈련함으로써, 우리는 이러한 AI 시스템이 문제를 해결하는 능력을 상당히 개선할 수 있습니다.

이 연구는 수학 문제로 제한되어 있으며, 이러한 "절벽"을 찾는 데 많은 컴퓨터 연산 능력을 필요로 하지만, AI가 왜 가끔 막다른 길에 갇히는지 이해하고 수정할 수 있는 매우 구체적이고 새로운 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →