← 최신 논문
🤖 AI

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

본 논문은 압축된 사고 연쇄 추론 (명시적, 구성적, 암시적) 의 분류 체계를 제시하고, 통제된 실험을 통해 더 거친 추론은 더 많은 데이터를 필요로 하며 고유한 확장 및 암기 행동을 보이지만, 검증 가능한 보상을 통한 이후의 강화 학습이 지도 미세 조정 중에 학습된 이러한 압축된 단계를 효과적으로 분해할 수 있음을 입증한다.

원저자: Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 매우 문자 그대로 해석하는 로봇에게 복잡한 수학 퍼즐을 푸는 법을 가르친다고 상상해 보세요. 이 퍼즐은 긴 단계의 연쇄를 포함합니다: "이 숫자를 가져와서, 이를 곱하고, 저것을 더하고, 이를 나누고..."

로봇에게 가르치기 위해 해결책을 세 가지 다른 방식으로 보여줄 수 있습니다. 이 논문은 어떤 방식이 가장 효과적인지, 얼마나 많은 데이터가 필요한지, 그리고 단계를 건너뛰어 로봇을 "더 빠르게 생각하게" 하려 할 때 어떤 일이 발생하는지 탐구합니다.

다음은 그들의 발견을 간단한 비유로 정리한 내용입니다:

1. 가르치는 세 가지 방법 (분류 체계)

연구자들은 로봇에게 해결책을 보여주는 방식을 다음과 같이 분류했습니다:

  • 명시적 CoT (천천히 그리고 꾸준히 하는 투어): 로봇에게 모든 단일 단계를 보여줍니다. "2 를 곱하세요. 이제 5 를 더하세요. 이제 3 으로 나누세요." 이는 길지만, 로봇이 정답이 어떻게 만들어졌는지 정확히 볼 수 있습니다.
  • 구성된 CoT (그룹화된 단계): 두 단계를 묶어서 보여줍니다. "2 를 곱한 다음 5 를 더한다"를 보여주는 대신, "2 를 곱하고 5 를 더한다"라고 말합니다. 로봇은 연산은 보지만 중간 숫자는 숨겨집니다.
  • 암시적 CoT (마술 트릭): 중간 부분을 완전히 생략합니다. 시작 숫자와 덩어리의 최종 결과만 보여주고, 어떻게 그곳에 도달했는지는 보여주지 않습니다. 마치 "3 으로 시작해서 15 로 끝내라"라고 말하는 것처럼, 로봇은 그 사이의 수학을 추측해야 합니다.

2. "압축"의 비용 (더 많은 데이터 필요)

이 논문은 다음과 같은 트레이드오프를 발견했습니다: 지시를 더 많이 압축할수록 로봇에게 가르치기 위해 더 많은 예시가 필요합니다.

  • 비유: 누군가에게 케이크 굽는 법을 가르치는 상황을 상상해 보세요.
    • 모든 단일 단계를 포함한 레시피 (명시적) 를 주면, 10 번 정도 보면 배울 수 있습니다.
    • 혼합 과정을 보여주지 않고 "건조 재료와 젖은 재료를 섞으세요"라고만 하는 "압축된" 레시피 (구성됨/암시적) 를 주면 혼란을 겪습니다. 이를 배우려면 그 압축된 레시피를 수백 번 (더 많은 데이터) 보여줘야 마침내 패턴을 이해합니다.
  • 발견: 더 거칠고 압축된 추론은 동일한 수준의 기술을 달성하기 위해 훨씬 더 많은 학습 데이터가 필요합니다.

3. 반복 대 다양성 ("연습" 효과)

압축된 데이터를 사용하기로 결정했다면, 어떻게 제시해야 할까요? 로봇에게 같은 10 개의 문제를 반복해서 보여줄지 (반복), 아니면 10,000 개의 서로 다른 문제를 보여줄지 (확대) 입니다.

  • 구성된 CoT (그룹화된 단계): 이 유형은 반복을 좋아합니다. 로봇에게 같은 그룹화된 단계를 반복해서 보여주면, 그 특정 패턴에 매우 능숙해집니다. 스포츠에서 특정 동작을 연습하는 것과 같습니다. 반복은 이를 근육 기억으로 만듭니다.
  • 암시적 CoT (마술 트릭): 이 유형은 반복을 싫어합니다. 로봇에게 같은 "마술 트릭"을 반복해서 보여주면, 그 특정 트릭에 대한 답만 외웁니다. 새로운 퍼즐을 주면 실패합니다. 실제로 근본적인 논리를 배우려면 다양성 (서로 다른 데이터) 이 필요하며, 그렇지 않으면 암기로 속이는 것입니다.

4. "재학습" 단계 (SFT 대 RL)

이 부분이 가장 놀랍습니다. 연구자들은 먼저 압축된 데이터로 로봇을 가르친 후 (SFT), 보상을 통해 스스로 연습하게 했습니다 (RL).

  • 문제: 압축된 데이터로 가르치면 로봇이 고착됩니다. "반 단계" (압축된 그룹에 맞지 않는 단계) 가 필요한 퍼즐을 풀라고 하면 완전히 실패합니다. 마치 짝수 걸음으로만 걷도록 훈련된 로봇처럼, 한 걸음만 걸으라고 하면 넘어집니다.
  • 해결책: 강화 학습 (RL) 으로 전환하자 로봇이 다시 "생각"하기 시작했습니다. "잠깐, 이 큰 덩어리를 다시 작은 조각으로 쪼갤 수 있구나!"라고 깨달은 것입니다.
  • 비유: 수학 공식을 하나의 블록으로 외운 학생을 상상해 보세요. 공식을 분할해야 하는 문제를 풀 수 없습니다. 하지만 스스로 문제를 풀게 하면 (RL), 결국 "아! 이 큰 블록을 다시 이전에 배운 작은 단계로 쪼갤 수 있구나!"라고 깨닫습니다. RL 단계는 압축된 지식을 압축 해제합니다.

5. 순서가 중요합니다 (일방통행)

마지막으로, 그들은 사고의 방향을 살펴보았습니다.

  • 전진/후진 (일방통행): 처음부터 끝까지, 또는 끝에서 처음까지 생각하는 것은 매우 잘 작동합니다. 로봇은 더 길고 어려운 퍼즐에도 잘 일반화됩니다.
  • 계층적 (나무 구조): 작은 덩어리를 풀고 이를 결합하는 방식입니다 (나무를 만드는 것처럼). 이 논문은 퍼즐이 길어지면 이것이 실패한다고 발견했습니다. 로봇은 머릿속에 너무 많은 중간 "가지"를 동시에 유지하려고 하다가 길을 잃습니다.
  • 교훈: 긴 추론 연쇄의 경우, 복잡한 나무 구조보다는 직선 (한 방향) 이 훨씬 더 좋습니다.

요약

지능을 잃지 않으면서 효율적인 (짧은 사고) 똑똑한 AI 를 만들기 위해:

  1. 막대한 양의 데이터가 있지 않는 한 과도하게 압축하지 마세요.
  2. 압축을 사용한다면, 연산을 보여주는 구성된 단계를 사용하고 자주 반복하세요. 거대하고 다양한 데이터가 있지 않는 한 연산을 숨기는 암시적 단계는 피하세요.
  3. SFT (지도 미세 조정) 는 로봇에게 압축된 단축법을 가르치지만, 문제가 이상해지거나 길어질 때 로봇이 그 단축법을 다시 쪼개는 법을 가르치려면 RL (강화 학습) 이 필요합니다.
  4. 최상의 결과를 위해 사고 과정을 복잡한 나무가 아닌 직선으로 유지하세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →