← 최신 논문
🤖 AI

The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary

이 논문은 디코더 전용 거대언어모델(LLM)이 정보 이론적 어텐션 병목 현상으로 인해 연쇄 사고(chain-of-thought) 추론이 실패하는 아키텍처적 "결정론적 지평선"(약 19~31단계)에 직면하며, 결정론적 상태 추적 작업에서 높은 정확도를 달기 위해 도구 위임형 하이브리드 접근 방식으로의 전환이 필요함을 입증한다.

원저자: Dongxin Guo, Jikun Wu, Siu Ming Yiu

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dongxin Guo, Jikun Wu, Siu Ming Yiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "정신적 칠판"의 한계

복잡한 퍼즐, 예를 들어 슬라이딩 타일 게임이나 여러 단계의 수학 문제를 풀고 있다고 상상해 보세요. 당신에게는 매 움직임마다 퍼즐의 현재 상태를 적어 넣는 "정신적 칠판(mental blackboard)"이 있습니다.

이 논문은 거대 언어 모델(LLM)이 고장 난 칠판을 가지고 있다고 주장합니다.

오랫동안 우리는 AI 모델에게 더 많이 "생각하라"고 하고 더 많은 "단계"를 밟게 하면(이를 '생각의 사슬(Chain-of-Thought)'이라고 부릅니다), 어려운 문제를 더 잘 풀 수 있을 것이라고 생각했습니다. 하지만 이 논문은 다음과 같이 말합니다: 아닙니다.

만약 어떤 작업이 많은 단계에 걸쳐 정확한 세부 사항을 추적해야 한다면(컴퓨터 프로그램이나 엄격한 논리 퍼즐처럼), AI의 뇌는 생각을 오래 할수록 실제로 안개가 끼듯 흐릿해지기 시작합니다. 특정 지점을 넘어서면, 생각을 더 많이 하는 것은 도움이 되지 않습니다. 오히려 AI가 환각(hallucination)을 일으키고 오답을 내게 만듭니다.

"결정론적 지평선 (The Deterministic Horizon)"

저자들은 이 한계를 결정론적 지평선이라고 부릅니다. 이것을 고속도로 위의 "안개선"이라고 생각하세요.

  • 안개선 이전 (1~20단계): AI가 명확하게 볼 수 있습니다. 퍼즐의 상태를 완벽하게 추적할 수 있습니다.
  • 안개선 지점 (20~30단계): AI가 혼란스러워지기 시작합니다. 숫자 두 개를 바꾸거나 규칙 하나를 잊어버릴 수 있습니다.
  • 안개선 너머 (30단계 이상): AI는 눈을 가리고 운전하는 것과 같습니다. 더 이상 퍼즐을 추적하는 것이 아니라, 그저 추측하고 있는 것입니다. 더 길게 "생각"하려고 노력할수록, 진실로부터 완전히 벗어날 가능성이 높아집니다.

논문에 따르면 대부분의 모델에서 이 지평선은 19단계에서 31단계 사이에서 발생합니다. 만약 문제가 이보다 더 많은 단계를 필요로 한다면, AI의 내부 "사고" 과정은 무너집니다.

왜 이런 일이 발생하는가? (주의력 병목 현상)

왜 AI의 뇌에 안개가 끼는 걸까요? 논문은 **주의력 엔트로피(Attention Entropy)**라는 개념을 사용합니다.

AI를 거대한 도서관에서 특정 책을 찾으려는 사서라고 상상해 보세요.

  • 짧은 탐색: 도서관이 작다면, 사서는 그 책이 어디에 있는지 쉽게 기억할 수 있습니다.
  • 긴 탐색: 도서관이 거대해지고 사서가 지금까지 찾아본 모든 책의 위치를 기억해야 한다면, 사서의 기억력은 한계에 다다릅니다.

AI 용어로 설명하자면, 모델은 올바른 단어에 집중하기 위해 "주의력(attention)"을 사용합니다. 추론 과정이 길어질수록, 모델은 이전 단계들을 점점 더 많이 기억해야 합니다. 논문은 수학적으로 모델의 "주의력 메커니즘"이 그 모든 정보를 한꺼번에 보유할 수 없음을 증명합니다. 이는 마치 50개의 공을 공중에 계속 띄우려고 하는 것과 같습니다. 결국 공 하나를 떨어뜨리게 될 것입니다. 일단 공 하나를 떨어뜨리면(작은 오류를 범하면), 전체 논리의 사슬이 무너집니다.

"단순성 편향" vs "탈동조화 (Decoherence)"

AI가 긴 작업을 수행할 때 실패하는 이유가 AI가 "게을러서"(짧은 답변을 선호해서) 그렇다는 경쟁 이론이 있었습니다. 저자들은 이를 **단순성 편향(Simplicity Bias)**이라고 부릅니다.

이 논문은 그 이론이 틀렸음을 증명합니다. 저자들은 다음을 수행하더라도 AI가 여전히 실패한다는 것을 보여주었습니다:

  1. AI에게 더 길게 생각하도록 강제함.
  2. 길고 정확한 예시를 바탕으로 AI를 특별히 학습시킴.

...그럼에도 불구하고 AI는 "안개선"을 지나면 여전히 실패합니다.

비유: AI가 게으른 것이 아니라, 정보를 보유하는 것이 물리적으로 불가능한 것입니다. 이는 10자리 전화번호를 외우는 기억력을 가진 사람에게 100자리 숫자를 기억하라고 요구하는 것과 같습니다. 아무리 "더 열심히 노력"해도 하드웨어의 한계를 극복할 수는 없습니다.

해결책: 계산기에 펜을 넘겨주기

AI의 뇌가 30단계 이후에 무너진다면, 어떻게 해야 할까요?

논문은 **도구 위임(Tool Delegation)**을 제안합니다. AI에게 모든 계산을 머릿속으로 직접 하라고 시키는 대신, AI가 '관리자' 역할을 하도록 하는 것입니다.

  • AI의 역할: 문제를 이해하고 어떤 도구를 사용할지 결정합니다.
  • 도구의 역할: 실제 힘든 작업(계산기, 코드 인터로프리터, 또는 검색 엔진과 같은)을 수행합니다.

결과:

  • AI 단독 사고: 어려운 다단계 작업에서 정답을 맞히는 비율이 **24~42%**에 불과합니다.
  • AI + 도구 사용: 정답을 맞히는 비율이 **86~94%**에 달합니다.

이는 사람이 머릿속으로 12자리 숫자를 곱하려고 애쓰는 것(오류가 발생하기 쉬움)과 계산기를 사용하는 것(완벽하게 정확함)의 차이와 같습니다.

일상생활을 위한 핵심 요약

  1. 더 많은 생각 ≠ 더 나은 답변: 엄격한 논리적 작업(코딩, 수학, 레시피 따르기 등)의 경우, AI가 더 오래 "생각"하게 만드는 것은 종종 결과물을 더 나쁘게 만듭니다.
  2. 한계는 실재한다: AI의 내부 메모리가 실패하는 명확한 천장(약 20~30단계)이 존재합니다.
  3. 하이브리드가 최선이다: AI를 사용하는 가장 똑똑한 방법은 AI를 전략을 결정하는 "두뇌"로 활용하되, 정밀하고 단계적인 작업을 수행하기 위해 외부 "도구"(코드나 계산기 등)를 사용하게 하는 것입니다.

요약하자면: AI에게 계산기가 되라고 요구하지 마세요. 어떤 계산기를 사용해야 할지 아는 '사람'이 되라고 요구하세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →