← 최신 논문
🤖 machine learning

Conformal Thinking: Risk Control for Reasoning on a Compute Budget

본 논문은 사용자가 지정한 오류율을 엄격히 준수하면서 컴퓨팅 비용을 최소화하기 위해 새로운 상한 및 하한 임계값을 사용하여 적응형 토큰 예산을 최적화하는 추론용 LLM 을 위한 분포 비의존적 위험 제어 프레임워크를 제안합니다.

원저자: Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 무리의 미스터리를 해결하기 위해 천재적이지만 비싼 탐정을 고용한다고 상상해 보세요. 어떤 미스터리는 쉬워 5 분 안에 해결될 수 있지만, 다른 것들은 너무 복잡해서 5 시간 동안 고민해도 탐정이 여전히 막혀 있습니다.

인공지능 (AI) 세계에서는 이러한 '탐정'들이 추론 문제를 해결하는 대규모 언어 모델 (LLM) 입니다. 이들을 고용하는 '비용'은 그들이 생성하는 텍스트 조각인 토큰으로 측정됩니다. 그들이 더 많이 생각할수록 비용은 더 많이 듭니다.

문제는 이러한 AI 탐정들이 종종 과도하게 생각한다는 점입니다. 그들은 쉬운 퍼즐을 10 초 안에 해결할 수 있지만, 확실히 하기 위해 추가로 10 분 동안 계속 떠들며 시간을 보낼 수 있습니다. 반대로 퍼즐이 불가능한 경우, 그들은 시간 제한이 끝날 때까지 계속 제자리걸음을 하며 결코 해결할 수 없는 사건에 돈을 낭비할 수 있습니다.

'Conformal Thinking'이라는 제목의 이 논문은 AI 에게 언제 생각을 멈춰야 하는지 알려주는 새로운 방식을 제안합니다. 이는 탐정에게 두 가지 특정 규칙을 따르도록 하는 엄격한 관리자를 부여하는 것과 같아, 최소한의 비용으로 최고의 답변을 얻으면서도 잘못된 답변을 너무 자주 받지 않도록 보장합니다.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다:

1. 구식 방식: '신뢰도' 규칙

과거에는 연구자들이 AI 가 '신뢰할만해' 보일 때 멈추려고 시도했습니다.

  • 유추: 탐정이 "이것이 정답일 확률이 90% 입니다!"라고 말한다고 상상해 보세요. 관리자는 시계를 멈춥니다.
  • 결함: 이는 쉽거나 해결 가능한 경우에만 작동합니다. 사건이 불가능하다면 탐정은 결코 90% 신뢰도에 도달하지 못할 수 있습니다. 그들은 관리자가 시간 (또는 돈) 을 다 쓸 때까지 계속 생각하며 희망 없는 일에 자원을 낭비합니다. 또한 그 '90%'라는 숫자를 설정하는 것은 까다롭습니다. 너무 높으면 시간을 낭비하고, 너무 낮으면 잘못된 답변을 얻게 됩니다.

2. 신식 방식: '이중 임계값' 관리자

저자들은 하나의 정지 신호가 아닌 두 개의 정지 신호를 사용하는 더 똑똑한 관리자를 도입했습니다. 이를 **위험 통제 (Risk Control)**라고 부릅니다.

상부 임계값 ('확신' 정지)

이는 구식 규칙입니다. 탐정의 신뢰도가 충분히 높아지면 (예: 95%), 즉시 멈추고 답변을 제시합니다.

  • 목표: 일찍 멈춤으로써 쉬운 문제에서 돈을 절약합니다.

하부 임계값 ('포기' 정지)

이것이 새로운, 교묘한 부분입니다. 탐정이 사건을 처리하고 있지만 신뢰도가 오르지 않고 실제로는 떨어지거나 평평하게 유지된다고 상상해 보세요.

  • 유추: 관리자가 말합니다. "한 시간 동안 일했는데 해결책에 더 가까워지지 않고 있군요. 곧 진전이 없다면 예산을 낭비하는 것입니다. 지금 멈추세요."
  • 목표: 조기 손실 절단을 통해 불가능한 문제에서 돈을 절약합니다.

3. '위험 예산' (안전망)

이 논문의 가장 중요한 부분은 이 두 정지 신호를 어디에 설정할지 결정하는 방법입니다.

추측하는 대신 (예: "85% 신뢰도에서 멈추자"), 사용자는 **위험 예산 (Risk Budget)**을 설정합니다.

  • 유추: 당신은 관리자에게 말합니다. "우리가 너무 일찍 멈춰서 잘못된 답변을 얻을 가능성이 **5%**인 경우를 감수할 용의가 있습니다. 하지만 그 오류율을 5% 이하로 유지하면서 가능한 한 많은 돈을 절약하고 싶습니다."
  • 작동 원리: 시스템은 연습 문제 세트 (검증 세트) 를 살펴보고 오류율이 5% 제한 아래에 유지되도록 '신뢰도' 정지와 '포기' 정지를 정확히 어디에 배치할지 수학적으로 계산합니다. 이는 테스트 문제가 연습 문제와 약간 다르더라도 오류율이 갑자기 급증하지 않도록 보장하는 통계적 안전망 (분포-무관 위험 통제라고 함) 을 사용합니다.

4. 결과: 더 똑똑한 지출

이 논문은 어려운 수학 및 과학 문제에서 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  • '희망 없는' 사건 해결: '하부 임계값' (포기 규칙) 은 AI 가 해결할 수 없는 문제에서 막대한 금액을 절약했습니다. 이는 AI 가 불가능한 작업에서 제자리걸음을 하는 것을 막았습니다.
  • '쉬운' 사건 해결: '상부 임계값' (신뢰도 규칙) 은 AI 가 과도하게 생각하기 전에 멈춤으로써 쉬운 작업에서 돈을 절약했습니다.
  • 조합: 두 규칙을 함께 사용하는 것이 가장 효율적이었습니다. 이는 AI 가 정답을 얻기에 충분한 시간만 쓰고 그 이상은 쓰지 않도록 허용했습니다.

요약

Conformal Thinking을 AI 사고를 위한 스마트한 예산 관리자로 생각하세요.

  1. 위험을 설정합니다: "나는 5% 오류율을 감수할 수 있다."
  2. 시스템이 규칙을 설정합니다: "훌륭한 일이야, 멈춰!"라고 언제 말하고 "이건 작동하지 않아, 멈춰!"라고 언제 말할지 자동으로 파악합니다.
  3. 결과: 동일한 품질의 답변을 얻지만, AI 가 쉬운 문제와 불가능한 문제 모두에서 시간을 낭비하지 않기 때문에 비용 (컴퓨팅) 을 훨씬 더 적게 지출합니다.

이 논문은 이 방법이 다양한 유형의 AI 모델과 수학 및 과학과 같은 어려운 작업 전반에 걸쳐 작동하며, 안전 보장을 깨뜨리지 않으면서 AI 가 효율적이도록 보장한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →