← 최신 논문
🤖 AI

Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning

이 논문은 KV 캐시 압축을 동적으로 조정하고, 불필요한 성찰을 억제하며, 프로세스 보상에 기반한 조기 종료를 가능하게 함으로써 정확도를 유지하면서도 추론 비용과 지연 시간을 크게 줄이는 방식으로 대규모 추론 모델을 최적화하는 보상 협응 프레임워크인 ReCo를 소개한다.

원저자: Qiyuan Zhu, Dezhi Li, Pengyu Cheng, Tianle Chen, Jiacheng Wang, Ruijie Shen, Hao Gu, Sida Lin, Zirui Liu, Jiacheng Liu, Sirui Han

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qiyuan Zhu, Dezhi Li, Pengyu Cheng, Tianle Chen, Jiacheng Wang, Ruijie Shen, Hao Gu, Sida Lin, Zirui Liu, Jiacheng Liu, Sirui Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇이 스스로에게 말을 걸며 어려운 퍼즐을 푸는 모습을 상상해 보세요. 이 로봇은 단순히 추측하는 것이 아니라, 최종 답을 내놓기 전에 자신의 사고 과정을 단계별로 상세하게 기록하며 긴 이야기를 써 내려갑니다. 이것이 현대의 '대규모 추론 모델(Large Reasoning Models)'이 작동하는 방식입니다. 이들은 마치 모든 단서와 막다른 길, 그리고 '아하!' 하는 깨달음의 순간까지 하나하나 모두 기록하기 전에는 사건을 해결하기를 거부하는 명석한 탐정과 같습니다. 문제는 이 탐정이 너무 말이 많다는 점입니다. 때로는 "2+2는 무엇인가?"와 같은 간단한 질문에 대해 "4"라고 답하기 전, 수학의 역사에 관한 소설 분량의 에세이를 쓰기도 합니다. 이러한 '과잉 사고(overthinking)'는 엄청난 양의 컴퓨터 메모리와 시간을 소모하며, 로봇을 느리고 비싸게 만듭니다.

이를 해결하기 위해 과학자들은 로봇의 메모리를 더 효율적으로 만드는 방법을 시도해 왔습니다. 로봇의 메모리를 자신이 생각을 적어 내려가는 화이트보드라고 생각해 보세요. 로봇이 더 오래 생각할수록 화이트보드는 가득 차게 됩니다. 흔히 쓰이는 기술 중 하나는 공간을 만들기 위해 가장 오래된, 즉 '덜 중요한' 메모를 지우는 것입니다. 이를 'KV 캐시 압축(KV-cache compression)'이라고 부릅니다. 하지만 이 논문의 연구자들은 이 지우는 방식에 결함이 있다는 것을 발견했습니다. 만약 잘못된 메모를 지우게 되면, 로봇은 혼란에 빠져 상황을 파악하기 위해 오히려 더 많이 말을 하기 시작하며, 이는 메모를 지워서 아끼려 했던 시간을 모두 상쇄해 버린다는 사실을 발견했습니다. 이는 요리법의 몇 단계를 건너뛰어 시간을 아끼려다가, 핵심 재료를 빠뜨린 것을 깨닫고 결국 요리 전체를 처음부터 다시 시작해야 하는 것과 같습니다.

이 논문은 이 복잡한 문제를 해결하기 위해 ReCo(Reward-Coordinated Compression, 보상 협응 압축)라는 새로운 시스템을 소개합니다. 단순히 무작위로 오래된 메모를 지우거나 모두에게 동일한 고정된 규칙을 적용하는 대신, ReCo는 로봇 옆에 서 있는 현명한 코치처럼 행동합니다. 로봇이 한 단계를 내디딜 때마다 코치는 이렇게 묻습니다. "네가 올바른 길로 가고 있다고 얼마나 확신하니?" 만약 로봇이 잘하고 있고 탄탄한 경로 위에 있다면(즉, "높은 보상" 단계라면), 코치는 말합니다. "아주 잘하고 있어, 모든 옛날 메모를 다 가지고 있을 필요는 없어. 공간을 아끼기 위해 몇 개 지우자." 하지만 로봇이 헤매고 있거나 새로운 아이디어를 탐색 중이라면(즉, "낮은 보상" 단계라면), 코치는 말합니다. "잠깐, 지금은 모든 메모가 필요해. 아무것도 지우지 마."

영리한 점은 이 동일한 '확신 점수'가 두 가지 역할을 동시에 수행한다는 것입니다. 첫째, 이 점수는 메모를 얼마나 유지하거나 삭제할지를 결정합니다. 둘째, 이 점수는 로봇이 과잉 사고를 하지 않도록 제어합니다. 만약 로봇이 확신을 갖고 올바른 길을 가고 있다면, 코치는 로봇이 말을 길게 늘어놓는 것을 멈추고 그냥 답을 내놓도록 부드럽게 유도합니다. 반면 로봇이 여전히 혼란스러워한다면, 코치는 계속해서 생각하고 탐색할 수 있도록 허용합니다. 이렇게 메모를 정리하는 것과 로봇이 얼마나 말할지를 제어하는 두 가지 동작을 조율함으로써, 시스템은 로봇이 혼란에 빠져 이를 보완하기 위해 더 긴 이야기를 쓰는 것을 방지합니다.

결과는 인상적입니다. 연구진이 세 가지 서로 다른 추론 모델을 여섯 가지 유형의 퍼즐(수학 문제부터 과학 질문까지)에 대해 ReCo로 테스트했을 때, 로봇은 훨씬 빨라졌고 사용되는 단어 수도 크게 줄었습니다. 구체적으로, 이 시스템은 로봇이 생성하는 단어 수를 **37%에서 65%**까지 줄였으며, 표준적인 최적화되지 않은 방식보다 2.08배에서 2.35배 더 빠르게 전체 과정을 완료했습니다. 결정적으로, 이 모든 과정에서 로봇이 눈에 띄게 멍청해지지 않았으며 정확도는 거의 동일하게 유지되었습니다. 이 논문은 단순히 메모를 줄이려고 노력하는 것만으로는 충분하지 않으며, 진정한 속도 향상을 얻기 위해서는 로봇의 사고 과정도 동시에 관리해야 한다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →