← 최신 논문
🤖 AI

Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning

이 논문은 어휘적 망설임 표식(lexical hesitation markers)을 기반으로 비생산적인 추론 궤적을 조기에 제거함으로써 대규모 추론 모델의 계산 비용과 지연 시간을 크게 줄이는 동시에, 전체 다중 샘플 투표의 정확도는 유지하는 학습이 필요 없는 추론 방법인 Funnel of Thoughts (FoT)를 소개한다.

원저자: Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능은 가장 강력한 추론 모델들이 단순히 어려운 질문에 하나의 답을 내놓는 수준을 넘어선 단계에 도달했습니다. 대신, 이 모델들은 최종 결론에 도달하기 전 여러 경로를 탐색하며 길고 구불구불한 사고의 사슬을 생성합니다. 이 과정은 인간의 숙고 과정을 모방하지만, 독특한 과제를 안겨줍니다. 즉, 동일한 문제를 반복해서 물었을 때, 이 모델들은 종종 서로 다르고 때로는 모순되는 답변을 생성한다는 점입니다. 신뢰성을 확보하기 위해 엔지니어들은 모델에게 수많은 서로 다른 시도, 즉 '롤아웃(rollout)'을 생성하도록 요청한 뒤 그중 가장 흔한 답을 선택하는 전략을 채택했습니다. '다수결 투표(majority voting)'로 알려진 이 방법은 고급 수학과 같은 복잡한 작업에서 정확도를 크게 향상시킵니다. 그러나 여기에는 막대한 대가가 따릅니다. 이러한 추론 사슬은 수천 단어에 달할 수 있기 때문에, 수십 개의 사슬을 동시에 실행하는 것은 엄청난 양의 컴퓨팅 파워를 소비합니다. 비용은 사슬이 길어질수록 급격히 증가하며, 이는 모델이 불필요한 자기 수정이나 망설임의 루프에 빠져 있는 경우가 많은 바로 그 마지막 단계에서 가장 비싸게 치러진다는 것을 의미합니다.

고려대학교의 한 연구팀은 정확도를 희생하지 않으면서 이러한 비효요율성을 해결하기 위해 '생각의 깔때기(Funnel of Thoughts)'라고 불리는 새로운 방법을 개발했습니다. 이들의 연구는 특정 문제를 다룹니다. 서른두 개의 서로 다른 추론 시도 중 몇몇은 종종 생산적이지 못하다는 점입니다. 이러한 특정 시도들은 자신의 논리를 끊임없이 의심하거나 '답 없음' 상태에 갇혀 끝없이 반복적인 루프를 돌며 소비되는 컴퓨팅 자원의 대부분을 차지하곤 합니다. 연구진은 이러한 실패하는 시도들이 생성하는 텍스트에서 단순하고 관찰 가능한 패턴을 통해 스스로를 드러낸다는 사실을 발견했습니다. 이들은 "잠깐(Wait)", "사실(Actually)", "아마도(perhaps)", 또는 "다시 생각해보자(Let me reconsider)"와 같은 특정 망설임 표지어를 빈번하게 사용합니다. 이러한 표지어가 얼마나 자주 나타나는지를 계산함으로써, 시스템은 해당 추론 경로가 완료되기도 훨씬 전에 그것이 실패할 가능성이 높음을 식출할 수 있습니다.

이 새로운 방법은 이전과 마찬가지로 서른두 개의 시도를 병렬로 실행하지만, 분야를 점진적으로 좁혀가는 '깔때기'를 도입합니다. 특정 체크포인트를 따라 시스템은 두 가지를 확인합니다. 첫째, 만약 어떤 시도가 이미 명확하고 최종적인 답을 생성했다면, 해당 시도는 즉시 안전한 저장소에 저장되며 시스템은 해당 시도에 대한 텍스트 생성을 중단합니다. 이는 추가적인 에너지를 낭비하지 않으면서 성공적인 경로의 투표권을 보존합니다. 둘째, 여전히 실행 중인 시도들에 대해 시스템은 해당 망설임 표지어의 밀도를 계산합니다. 만약 어떤 시도가 불확실성의 징후로 가득 차 있다면, 그것은 조기에 가지치기(pruning)되거나 차단됩니다. 이를 통해 시스템은 생산적인 경로를 유지하면서도 낭비적이고 소용없는 경로를 버릴 수 있으며, 이는 올바른 해결책으로 이어질 가능성이 높은 경로를 보존하는 방식입니다.

이 접근 방식의 결과는 상당합니다. 연구진은 이 방법을 사용하여 모델에 필요한 어텐션 연산(attention operations)으로 측정된 총 컴퓨팅 비용을 거의 절반 가까이 줄일 수 있었습니다. 단일 고성능 그래픽 카드에서의 실질적인 테스트 결과, 이는 처리 시간을 37% 이상 단축하는 것으로 나타났습니다. 결정적으로, 이러한 효율성은 정확도를 희생하며 이루어진 것이 아닙니다. 이 방법은 서른두 개의 시도를 모두 끝까지 실행하는 전통적인 방식과 동일한 높은 수준의 정답률을 유지했습니다. 실제로 일부 어려운 문제에서는 새로운 방법이 최종 결과를 오히려 개선하기도 했습니다. 이는 전통적인 방식이 때때로 생산적이지 않고 반복적인 시도들이 단지 그것들이 유일하게 완료되었기 때문에 최종 투표를 지배하도록 허용하는 반면, 새로운 방식은 이러한 방해 요소들을 조기에 제거하여 올바른 답이 더 명확하게 드러나도록 했기 때문입니다.

연구진은 이 기술을 여섯 가지 서로 다른 대규모 추론 모델과 다양한 도전적인 수학 벤치마크에 걸쳐 테스트했습니다. 그들은 망설임 표지어의 신호가 모델의 내부 구조나 크기에 관계없이 모든 모델에서 일관되게 나타난다는 것을 발견했습니다. 또한 이 방법은 시스템이 최종 답변에 도달했음을 식별할 수 있다면, 복잡한 과학 질문에 답하거나 코드를 생성하는 것과 같은 수학 외의 작업에도 견고하게 적용될 수 있음을 입증했습니다. 핵심 통찰은 시스템이 추론의 내용을 이해할 필요 없이, 단지 망설임의 패턴을 인식하는 것만으로도 멈출 시점을 알 수 있다는 것입니다. 이를 통해 시스템은 추가적인 학습이나 복잡한 외부 도구 없이, 모델이 이미 생성하고 있는 텍스트에만 의존하여 작동할 수 있습니다.

이 연구는 인공지능 추론에서 가장 비용이 많이 드는 부분이 종종 가장 생산성이 낮은 부분임을 시사합니다. 모델이 막히기 시작하는 초기 징후를 인식하는 법을 배움으로써, 우리는 아무 데도 도달하지 못할 경로에 자원을 낭비하는 것을 막을 수 있습니다. '생각의 깔때기'는 이러한 강력한 시스템을 똑같이 똑똑하게 유지하면서도 훨씬 더 빠르고 저렴하게 실행하는 것이 가능하다는 것을 보여줍니다. 이는 속도와 비용이 중요한 실제 응용 분야에서 고급 추론 모델의 사용을 확장할 수 있는 실질적인 방법을 제공합니다. 이 연구 결과는 효율적인 AI의 미래가 더 큰 모델을 만드는 데 있는 것이 아니라, 우리가 이미 가지고 있는 모델을 더 스마트하게 관리하는 방법에 달려 있음을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →