← 최신 논문
🤖 machine learning

Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression

본 논문은 의미 보존 압축기, 혼합 비율 지도 미세 조정, 그리고 제약 및 계층적 비율 정책 최적화 (CHRPO) 전략을 결합하여 대규모 언어 모델에서 효율적이고 고충실도의 추론을 가능하게 함으로써 최소한의 정확도 손실로 극한의 체인 오브 씽킹 (Chain-of-Thought) 압축을 달성하는 새로운 프레임워크인 Extra-CoT 를 소개합니다.

원저자: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 한 명의 천재적이지만 지나치게 열정적인 학생 (AI) 이 수학 문제를 풀려고 노력하고 있습니다. "2+2 는 얼마인가?"라는 간단한 질문을 받으면, 그들은 단순히 "4"라고 말하지 않습니다. 대신 숫자의 역사, 덧셈의 개념, 그리고 숫자 2 가 왜 특별한지에 대한 50 페이지 분량의 에세이를 작성한 뒤, 마침내 답인 "4"를 동그라미로 표시합니다.

이를 생각의 사슬 (Chain-of-Thought, CoT) 추론이라고 합니다. 이는 AI 가 정답을 얻는 데 도움이 되지만, AI 가 "과도하게 생각"하고 너무 많은 단어 (토큰) 를 생성하기 때문에 매우 느리고 비용이 많이 듭니다.

이 논문은 이를 해결하기 위해 Extra-CoT라는 새로운 시스템을 소개합니다. 이는 이 지나치게 열정적인 학생에게 지능을 잃지 않으면서 간결해지는 법을 가르치는 3 단계 훈련 프로그램으로 생각할 수 있습니다.

기존 "편집자"의 문제점

이 논문 이전까지 연구자들은 학생의 긴 에세이를 줄이기 위해 "편집자"를 사용하려고 시도했습니다. 이러한 편집자들은 단순히 무작위로 단어를 잘라내거나 간단한 규칙에 따라 잘라냈습니다.

  • 유추: "109 의 제곱근은 약 10.44 입니다"라는 문장을 편집자가 반으로 잘라낸다고 상상해 보세요. 그러면 "109 의 제곱근은 약 10..."이라는 말도 안 되는 문장만 남게 됩니다.
  • 결과: 이러한 편집자들이 에세이를 원래 크기의 20% 같은 극도로 작은 크기로 줄이려고 시도했을 때, 학생의 답은 쓰레기가 되었습니다. "중요한 단계"들이 잘려나갔기 때문에 논리가 무너졌습니다.

Extra-CoT 해결책: 3 단계 훈련 캠프

저자들은 학생과 편집자를 다르게 취급하는 새로운 방법을 제안합니다.

1 단계: "수학에 능통한" 편집자 (압축기)

먼저, 누구보다 수학 공식을 더 잘 이해하는 특수 편집자를 훈련시킵니다.

  • 작동 방식: 이 편집자는 단순히 단어만 보는 것이 아니라, x2+12x=73x^2 + 12x = 73과 같은 전체 수학 공식을 단일하고 끊을 수 없는 "블록"으로 취급합니다. 공식을 반으로 자르면 전체가 무너진다는 것을 알고 있습니다.
  • 유추: 특정 책 장이 미스터리의 "단서"임을 아는 사서라고 상상해 보세요. 도서관을 축소해야 할 때, 그들은 그 장에서 페이지를 찢어내지 않습니다. 대신 그 장 전체를 온전하게 유지하고 그 주변의 지루한 설명들을 잘라냅니다.
  • 목표: 이는 논리적으로 완벽하게 유지된 간결한 답변의 "황금 표준"을 만들어냅니다.

2 단계: "혼합 모드" 교실 (SFT)

다음으로, 주요 AI 학생에게 이 새로운 편집자의 지시를 따르도록 가르칩니다.

  • 작동 방식: 편집자가 "텍스트의 80% 를 유지하라", 그다음 "60% 를 유지하라", 그리고 "20% 를 유지하라"라고 말하는 예시들을 학생에게 보여줍니다.
  • 유추: 이는 코치가 운동선수가 다양한 거리를 뛰도록 훈련시키는 것과 같습니다. 운동선수는 코치가 "단거리 질주!"라고 외칠 때 단순히 뛰는 것을 멈추지 않고, 그 특정 거리에 맞춰 효율적으로 달리는 법을 배웁니다. 이는 AI 가 다양한 "단어 예산"에 순종하도록 가르칩니다.

3 단계: "위험 감수" 코치 (CHRPO)

마지막으로, 학생이 더 효율적이 되도록 밀어붙이기 위해 특수 보상 시스템 (강화 학습) 을 사용합니다.

  • 문제: 학생은 답을 틀릴까 봐 너무 짧게 작성하는 것을 두려워합니다.
  • 해결책: 코치 (CHRPO) 는 학생이 정답을 맞히고 매우 적은 단어를 사용했을 때 거대한 보너스를 줍니다. 하지만, 학생이 너무 짧게 작성하려다 틀렸다면 막대한 페널티를 부과합니다.
  • 유추: 10 초 안에 퍼즐을 풀면 상을 받는 게임쇼를 상상해 보세요. 5 초 안에 풀면 이중 상을 받습니다. 하지만 서두르다 틀리면 모든 것을 잃습니다. 이는 AI 가 정확하면서도 매우 빠른 "최적점"을 찾도록 장려합니다.

결과

이 논문은 고등학교 경시대회에서 볼 수 있는 어려운 수학 문제들로 이 시스템을 테스트했습니다.

  • 승리: 새로운 시스템 (Extra-CoT) 은 AI 가 생성한 단어 수를 73% 줄여 (원래 길이의 27% 로 감소) 오히려 이전보다 더 많은 문제를 정확히 풀었습니다.
  • 비교: 기존 방법들 (예: "TokenSkip") 은 이렇게 짧게 하라는 요청을 받으면 붕괴되었습니다. 그들은 명령을 따르기를 거부하거나 잘못된 답을 주었습니다. 반면 Extra-CoT 는 극한의 한계에서도 침착하고 정확하게 유지되었습니다.
  • 속도: AI 가 훨씬 적게 작성하기 때문에, 실시간으로 문제를 해결하는 속도가 3 배 빨라졌습니다.

요약

간단히 말해, Extra-CoT는 AI 가 "과도하게 생각"하는 것을 멈추게 하는 시스템입니다. 이는 수학 공식을 존중하는 지능적인 편집자를 사용하고, AI 가 엄격한 단어 제한을 따르도록 훈련시키며, 빠르고 정확할 때 보상함으로써 AI 가 과거에 필요로 했던 컴퓨팅 파워와 시간의 일부만으로 복잡한 논리 퍼즐을 풀 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →