← 최신 논문
🤖 AI

Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

본 논문은 직접 선호 최적화를 통해 토큰 수준의 신뢰도를 논리적 정확성과 정렬시키고, 신뢰도 인지 사고 (CaT) 메커니즘을 통해 불확실한 추론 분기를 동적으로 가지치기함으로써 대규모 추론 모델의 신뢰성과 효율성을 향상시키는 CASPO 라는 프레임워크를 소개합니다.

원저자: Kejia Chen, Jiawen Zhang, Yihong Wu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kejia Chen, Jiawen Zhang, Yihong Wu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 천재적이지만 지나치게 자신감 넘치는 학생에게 복잡한 수학 문제를 풀도록 가르치고 있습니다. 이 학생, 그를 '추론 봇 (Reasoning Bot)'이라고 부르겠습니다. 그는 최종 정답을 맞히는 데는 뛰어나지만, 종종 잘못된 방향으로 갔다가 깨닫고는 자신이 혼란스러웠음을 인정하지 않은 채 마법처럼 스스로를 교정합니다. 더 나쁘게는, 자신이 옳다고 확신하며 막다른 길로 confidently 걸어갔다가, 우연히 정답에 도달하기도 합니다.

문제는 그가 정답을 맞히거나 틀리는 것만이 아닙니다. 그는 자신이 언제 불확실한지 알지 못합니다. 그는 실제로는 터무니없는 단계에 대해 99% 확신을 가질 수도 있고, 논리적으로 완벽하게 타당한 단계에 대해서는 10% 만의 확신을 가질 수도 있습니다. 이는 그가 신뢰할 수 없게 만듭니다. 특히 의학이나 금융과 같이 여행의 목적지뿐만 아니라 여정의 모든 단계를 신뢰해야 하는 고위험 상황에서는 더욱 그렇습니다.

이 논문은 CASPO(Confidence-Aware Step-wise Preference Optimization, 신뢰도 인지 단계별 선호도 최적화) 라는 새로운 학습 방법과 CaT(Confidence-aware Thought, 신뢰도 인지 사고) 라는 새로운 사고 방식을 소개합니다. 간단한 비유를 통해 이들이 어떻게 작동하는지 살펴보겠습니다.

문제: "가짜 자신감"의 함정

현재 이러한 AI 모델들은 대본을 외운 배우와 같습니다. 대사가 매끄럽고 흐름이 좋으면, 그 대사가 논리적으로 전혀 말이 없더라도 배우는 높은 자신감으로 그 대사를 말합니다.

  • 결함: 모델은 "매끄럽게 들리는 것"과 "옳은 것"을 혼동합니다.
  • 결과: 실제로는 논리적 허점이 가득한, 길고 설득력 있는 추론 체인을 생성합니다.

해결책: CASPO(“정직 코치”)

저자들은 모델이 자신의 불확실성에 대해 정직하도록 가르치고 싶어 했습니다. 그들은 단순히 최종 시험 점수를 매기는 것이 아니라, 학생이 취하는 모든 움직임을 지켜보는 엄격한 코치처럼 작동하는 학습 시스템을 만들었습니다.

작동 원리:

  1. “정직” 지표: 외부 전문가에게 매 단계를 확인하게 하는 것 (느리고 비용이 많이 듦) 대신, 시스템은 모델의 내부 "목소리"를 듣습니다. 모델이 얼마나 "주저하는지" (엔트로피라는 개념을 사용하여) 측정합니다.
    • 비유: 모델이 문장을 생성할 때 다음 단어를 매우 확신한다면, 내부 "주저함"은 낮습니다. 여러 단어 사이에서 추측하고 있다면 주저함은 높습니다.
  2. 학습 게임: 시스템은 두 가지 경로를 비교하는 게임을 만듭니다.
    • 경로 A: 모델이 놀랍게도 불확신했던 (높은 주저함) 올바른 단계.
    • 경로 B: 모델이 자신감 있게 확신했던 (낮은 주저함) 잘못된 단계.
    • 교훈: 모델은 불확신했더라도 올바른 단계를 선택하면 보상을 받고, 과신했을 때 잘못된 단계를 선택하면 처벌받습니다.
  3. 목표: 시간이 지남에 따라 모델은 자신을 보정 (calibrate) 하는 법을 배웁니다. 논리가 실제로 타당할 때만 "높은 자신감"을 가져야 하고, 논리가 흔들릴 때는 "낮은 자신감"을 가져야 한다는 것을 배웁니다.

결과: CaT(“스마트 내비게이터”)

모델이 자신감에 대해 정직하도록 훈련된 후, 저자들은 문제 해결 과정에서 이를 활용하는 새로운 방식을 CaT라고 소개합니다.

보물 (정답) 을 찾기 위해 빽빽한 숲 (추론 과정) 을 하이킹한다고 상상해 보세요.

  • 옛 방식 (자기 일관성): 100 명의 하이커를 무작위 경로로 보냅니다. 모두 도착할 때까지 기다린 후, 가장 많은 사람이 찾은 정답을 선택합니다. 이는 느리고 비용이 많이 듭니다.
  • CaT 방식: 몇 명의 하이커를 보냅니다. 그들이 걷는 동안 내부 나침반 (보정된 신뢰도) 을 확인합니다.
    • 하이커가 갈림길에 도달하고 나침반이 미친 듯이 돌아다니기 시작하면 (낮은 신뢰도), CaT 는 즉시 그들에게 멈추고 되돌아가라고 지시합니다.
    • 하이커가 나침반이 안정적으로 움직이며 부드럽게 이동하면 (높은 신뢰도), CaT 는 그들이 계속 나아가도록 허용합니다.

이것이 중요한 이유:

  • 속도: 막다른 길을 탐색하는 시간을 낭비하지 않습니다. 나쁜 경로를 일찍 차단합니다.
  • 효율성: 수천 개의 정답을 생성하려는 방법보다 더 나은 결과를 달성하지만, 거의 추가 컴퓨팅 파워 없이 이를 달성합니다.
  • 신뢰성: 모델이 옳을 때만 자신감을 갖도록 훈련되었기 때문에, 모델이 선택한 경로는 논리적으로 타당할 가능성이 훨씬 높습니다.

증거

연구자들은 AIME 와 같은 어려운 수학 경시대회와 논리 퍼즐을 포함한 10 가지 다른 벤치마크에서 이를 테스트했습니다.

  • 결과: CASPO 로 훈련된 모델들은 다른 최상위 방법들보다 일관되게 더 높은 점수를 받았습니다.
  • 놀라운 점: 외부 "보상 모델"(비싼 인간 채점자와 같은) 을 사용하지 않음에도 불구하고, 모델은 자신의 내부 신뢰도 신호를 신뢰하는 법을 배웠습니다.
  • 확장성: 이 방법은 작은 모델과 Qwen3 와 같은 매우 크고 강력한 모델 모두에서 잘 작동하여, 미래의 견고한 도구임을 입증했습니다.

요약하자면

이 논문은 AI 추론을 신뢰할 수 있게 만들기 위해 단순히 정답을 맞추는 법을 가르쳐서는 안 된다고 주장합니다. 우리는 AI 에게 알고 있을 때를 알고, 모를 때를 알도록 가르쳐야 합니다. 모델의 내부 신뢰도를 논리적 진실과 일치하도록 훈련함으로써, 우리는 정답에 도달하기 위해 단순히 추측하는 것이 아니라, 안정적이고 정직한 나침반을 들고 길을 걷는 AI 를 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →