← 최신 논문
💬 NLP

Short Chains, Deep Thoughts: Balancing Reasoning Efficiency and Intra-Segment Capability via Split-Merge Optimization

이 논문은 구조적 중복성을 제거하여 정확도를 크게 향상시키고 계산 오버헤드를 줄이기 위해 일관성 기반 분할-병합 알고리즘과 구조 정렬 강화 학습을 활용하여 대규모 추론 모델을 개선하는 CoSMo라는 프레임워크를 소개합니다.

원저자: Runquan Gui, Jie Wang, Zhihai Wang, Chi Ma, Jianye Hao, Feng Wu

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Runquan Gui, Jie Wang, Zhihai Wang, Chi Ma, Jianye Hao, Feng Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 퍼즐을 풀고 있다고 상상해 보세요. 줄무늬 셔츠 대신 사실로 구성된 '월도 찾기' 같은 퍼즐입니다. 여러분은 정답을 찾으려는 탐정들 (AI) 팀을 가지고 있습니다.

과거에는 이 탐정들에게 "단계별로 생각하라"고 지시했습니다. 그들은 그렇게 했지만, 종종 지나치게 생각했습니다. 그들은 이미 알고 있는 내용을 반복하거나 불필요하게 확인해야 하는 것들을 점검하는 생각까지 포함해 모든 생각을 적어냈습니다. 그 결과 중복된 기록으로 가득 찬 방대하고 messy 한 노트가 만들어졌습니다. 이를 읽는 데는 시간이 많이 걸렸고, 많은 종이 (컴퓨팅 파워) 가 낭비되었으며, 때로는 노트의 압도적인 양 자체가 탐정을 혼란스럽게 만들어 명백한 정답을 놓치게 하기도 했습니다.

이 논문은 이러한 문제를 해결하기 위해 CoSMo(일관성 기반 분할 - 병합 최적화) 라는 새로운 방법을 소개합니다. CoSMo 는 중요한 줄거리를 잃지 않으면서 간결하고 완벽한 이야기를 쓰는 법을 탐정에게 가르치는 스마트 편집자로 생각할 수 있습니다.

간단한 비유를 들어 CoSMo 가 어떻게 작동하는지 설명해 보겠습니다:

1. 문제: 지나친 수다

이 논문은 현재의 AI 모델들이 지나치게 많은 말을 하는 사람들과 같다고 주장합니다. 그들은 단순히 "정답은 X 입니다"라고 말하지 않고, "나는 X 에 대해 생각하고 있고, 다시 X 에 대해 생각하고 있으며, 아마도 X 가 사실인지 확인해 봐야 할 것 같고, 오, 보라니 X 가 다시 사실로군요"라고 말합니다.

  • 문제점: 이러한 "수다"는 구조적 중복을 만듭니다. 단어가 너무 긴 것이 아니라, 서로 다른 단계 (세그먼트) 의 수가 너무 많다는 것입니다.
  • 비유: 집에서 가게까지 걸어가는 상황을 상상해 보세요. 정상적인 사람은 곧장 그곳으로 갑니다. 하지만 과도하게 생각하는 AI 는 공원에 가서 시간을 확인하고, 다시 돌아와서 도서관으로 가서 시간을 다시 확인한 뒤, 그제야 가게로 갑니다. 거리 (토큰 수) 는 비슷할지라도, 정거장 (세그먼트) 의 수는 엄청나게 많고 비효율적입니다.

2. 해결책: "분할 - 병합" 알고리즘

CoSMo 는 AI 의 추론 체인을 편집이 필요한 문장처럼 취급합니다. 이를 정리하기 위해 두 단계의 과정을 사용합니다:

  • 병합 (불필요한 것 제거): AI 가 같은 내용을 말하거나 서로의 사소한 변형에 불과한 두 단계를 작성하면, CoSMo 는 "이건 같은 생각이야!"라고 말합니다. 그런 다음 이를 하나의 강력하고 명확한 문장으로 병합합니다.
    • 비유: "나는 배가 고파. 내 위장에서 꾸르륵 소리가 나."라고 말하는 대신, 편집자가 이를 "나는 배가 고파."로 통합합니다.
  • 분할 (빈칸 채우기): 때로는 AI 가 너무 효율적이 되려고 단계를 건너뛰어 "A"에서 "C"로 점프하고 "B"를 설명하지 않습니다. CoSMo 는 이러한 "논리적 도약"을 발견하고 "잠깐, 단계를 건너뛰었어!"라고 말합니다. 그런 다음 그 큰 점프를 두 개의 작고 논리적인 단계로 분할합니다.
    • 비유: AI 가 "나는 개를 봤으니 산책줄을 샀다"고 말하면, CoSMo 는 이를 분할합니다: "1. 나는 개를 봤다. 2. 나는 그 개를 위한 산책줄이 필요하다."

3. 훈련: "적당히" 되는 법 배우기

이 논문은 AI 에게 이 새로운 사고방식을 가르치기 위한 두 단계 훈련 과정을 설명합니다:

  • 1 단계: 편집자 (지도 미세 조정): 연구자들은 AI 의 messy 하고 지나치게 긴 답변들을 가져와 분할 - 병합 알고리즘을 사용하여 완벽하고 간결한 버전으로 다시 씁니다. 그런 다음 AI 가 이러한 완벽한 버전을 모방하도록 가르칩니다. 이는 학생이 명확하게 쓰는 법을 배우기 위해 모범 답안을 공부하는 것과 같습니다.
  • 2 단계: 코치 (강화 학습): 이제 AI 는 스스로 문제를 해결해 봅니다. "코치" (보상 시스템) 는 AI 가 사용하는 단어 수를 단순히 세지 않습니다. 대신 AI 가 취하는 서로 다른 단계의 수를 셉니다.
    • 반전: 코치는 말합니다. "매우 상세하고 정확하게 설명하기 위해 단계 내에서는 원하는 만큼 많은 단어를 써도 돼. 하지만 너무 많은 단계를 취해서는 안 돼."
    • 이것이 중요한 이유: 이전 방법들은 단어의 총 수를 제한하려고 했습니다. CoSMo 는 복잡한 아이디어를 설명하기 위해 때로는 긴 문장이 필요할 수 있음을 깨닫습니다. 따라서 긴 문장을 작성한 것에 대해 AI 를 처벌하는 것이 아니라, 너무 많은 정거장(세그먼트) 을 취한 것에 대해 처벌합니다.

4. 결과: 더 짧은 체인, 더 깊은 사고

이 논문은 다양한 어려운 질문들 (다단계 퀴즈나 독해 등) 에서 이를 테스트했습니다.

  • 결과: CoSMo 는 다른 방법들보다 더 정확한 답변을 생성했고, 더 적은 단계를 사용했습니다.
  • 비유: 경주를 상상해 보세요. 다른 달리기 선수들은 원을 그리며 뛰거나 (중복된 단계), 거칠고 어색한 거대한 점프를 취했습니다 (논리 생략). CoSMo 의 선수는 가장 직접적인 경로를 택했고, 지도를 확인하기 위해 딱 필요한 횟수만큼만 멈췄지, 신발 끈을 두 번 묶기 위해 멈추지는 않았습니다.
  • 통계: 논문은 CoSMo 가 정확도를 약 3.3 포인트 향상시키면서 추론 단계의 수를 거의 29% 줄였다고 주장합니다.

요약

간단히 말해, 이 논문은 이렇게 말합니다: AI 가 덜 말하게 만드는 것이 아니라, 더 효율적으로 생각하게 하십시오.

AI 에게 반복적인 생각을 병합하고 건너뜀을 분할하는 법을 가르침으로써, CoSMo 는 "골디락스" 스타일의 추론을 만들어냅니다. 너무 짧아 (상세함을 놓치는) 것도, 너무 길어 (시간을 낭비하는) 것도 아닌, 문제의 복잡성에 딱 맞는 적절한 스타일입니다. 이는 AI 가 필요한 곳에서는 깊고 상세하게 존재할 수 있게 하면서, 속도를 늦추는 구조적 잡음을 제거합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →