← 최신 논문
💬 NLP

Consilience for Verifier-Free Test-Time Scaling

이 논문은 탐색을 위한 낮은 초기 신뢰도와 수렴을 위한 높은 최종 신뢰도로 특징지어지는 특정 시간적 비대칭성에 기반하여 추론 궤적을 선택함으로써, 기존의 신뢰도 기반 방식의 한계를 극복하고 복잡한 수학 및 코딩 작업에서 성능을 크게 향상시키는 새로운 검증기 프리(verifier-free) 테스트 타임 스케일링 프레임워크인 "consilience"를 소개한다.

원저자: Lecheng Kong, Like Hui, Haitao Mao, Jun Huan

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lecheng Kong, Like Hui, Haitao Mao, Jun Huan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 정말 어려운 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 인공지능의 세계에서 이 로봇들은 거대 언어 모델(LLM)이라고 불립니다. 이들은 코드를 작성하고, 수학 문제를 풀며, 까다로운 질문에 답할 수 있는 디지털 두뇌와 같습니다. 보통 우리가 로봇이 특정 문제를 더 잘 풀게 하고 싶을 때, 우리는 그들이 여러 가지 다른 경로를 시도하게 한 다음, 어떤 답이 맞는지 확인하는 '심판'을 사용합니다. 이 심판은 코드의 컴파일러나 정답지를 가진 선생님과 같습니다. 하지만 심판이 없는 상황이라면 어떨까요? 만약 당신이 이야기를 쓰고 있거나, 새로운 유형의 소프트웨어를 만들고 있거나, 아직 아무도 정답을 모르는 문제를 풀고 있다면 어떨까요? 바로 여기서 '검증기 없는(Verifier-Free)' 스케일링이 등장합니다. 이것은 외부의 판사 없이 로봇이 스스로 최선의 경로를 찾아내도록 돕는 도전 과제입니다. 오랫동안 과학자들은 가장 좋은 방법이 로봇이 가장 '확신'하는 답을 고르는 것이라고 생각했습니다. 아이디어는 간단했습니다. 로봇이 자신이 맞다고 확신한다면, 아마도 맞을 것이라는 것이죠. 하지만 이 논문은 정말 어려운 문제에서는 너무 빨리 확신을 갖는 것이 오히려 함정이 될 수 있다고 제안합니다.

AWS AI Labs에서 연구하는 이 연구진은 왜 이 "확신 트릭"이 문제가 어려워질 때 실패하는지 조사하기로 했습니다. 그들은 매혹적인 결함을 발견했습니다. 로봇이 어려운 문제에 직면했을 때, 정답을 맞히는 로봇들은 종종 처음에 확신이 없는 듯한 모습을 보이며 다양한 가능성을 탐색하다가, 마지막에 이르러서야 확신을 갖게 된다는 것입니다. 반면에 오답을 내는 로봇들은 처음에 매우 확신에 찬 목소리로 시작하여, 즉시 하나의 (하지만 틀린) 아이디어에 고착되는 경향이 있습니다. 저자들은 이 현상을 "컨실리언스(Consilience, 수렴적 일치)"라고 부릅니다. 이는 "함께 뛰어오름"을 뜻하는 멋진 단어입니다. 과학에서 이 단어는 서로 다른 여러 증거가 모두 동일한 답을 가리키기 때문에 결론이 신뢰할 수 있는 상황을 설명합니다. 논문은 로봇이 진정으로 정답을 "알기" 위해서는 단순히 하나의 경로로 빠르게 수렴하는 것이 아니라, 먼저 많은 경로를 탐색하고(낮은 확신을 보임), 그 후에 그 경로들이 모두 하나의 해결책으로 모여야 한다(마지막에 높은 확신을 보임)고 주장합니다.

이를 테스트하기 위해 팀은 "컨실리언스 점수(Consilience Score)"라는 새로운 채점 시스템을 만들었습니다. 전체 답변의 평균 확신도를 보는 대신, 이 새로운 방식은 확신의 '이야기'를 살펴봅니다. 즉, 약간의 망설임(탐색)으로 시작하여 강력하고 확실한 결론으로 끝나는 답변에 보상을 주는 것입니다. 그들은 이를 대학원 수준의 수학 문제와 자유 형식의 코드 생성 등 사용 가능한 가장 어려운 과제들에 적용해 테스트했습니다. 결과는 놀라웠습니다. 쉬운 문제에서는 기존의 "가장 확신 있는 것을 선택하라"는 방식이 잘 작동했습니다. 하지만 어려운 문제에서는 기존 방식이 "확신에 찬 오답"을 내놓았기 때문에 종종 틀린 답을 골랐습니다. 그러나 새로운 컨실리언스 방식은 이러한 과잉 확신된 실수들을 성공적으로 걸러냈습니다. 예를 들어, LiveCodeBench라는 어려운 코딩 벤치마크에서 이 새로운 방식을 사용했을 때, GPT-OSS-120B라는 모델의 성공률이 65.7%에서 69.7%로 뛰어올랐습니다. 이는 결론을 내리는 속도보다 탐색의 '과정'을 가치 있게 여기도록 로봇을 가르침으로써, 채점해 줄 선생님이 없는 상황에서도 가장 중요한 문제를 해결하는 데 훨씬 더 똑똑하게 만들 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →