← 최신 논문
💬 NLP

R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning

R-Stitch는 토큰별 엔트로피를 활용해 불확실한 구간은 대형 언어 모델(LLM)에, 확실한 구간은 소형 언어 모델(SLM)에 맡기는 동적 경로 스티칭(Dynamic Trajectory Stitching) 방식을 통해, 추론 정확도를 유지하면서도 CoT(Chain-of-Thought) 생성 속도를 획기적으로 높인 학습 불필요(training-free) 하이브리드 디코딩 프레임워크입니다.

원저자: Zhuokun Chen, Zeren Chen, Jiahao He, Lu Sheng, Mingkui Tan, Jianfei Cai, Bohan Zhuang

게시일 2026-02-10
📖 2 분 읽기☕ 가벼운 읽기

원저자: Zhuokun Chen, Zeren Chen, Jiahao He, Lu Sheng, Mingkui Tan, Jianfei Cai, Bohan Zhuang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 배경: "천재 수학자와 초등학생의 협업"

우리가 아주 어려운 수학 문제를 풀려고 한다고 상상해 보세요.

  • LLM (거대 언어 모델): 모든 지식을 다 알고 있는 **'천재 교수님'**입니다. 하지만 교수님은 한 문장을 말할 때마다 아주 신중하고 느리게, 그리고 엄청나게 긴 설명을 덧붙이며 말합니다. (비용과 시간이 많이 듭니다.)
  • SLM (소형 언어 모델): 기초 지식은 있지만 조금 부족한 **'초등학생'**입니다. 하지만 말하는 속도가 엄청나게 빠르고, 쉬운 문제는 아주 간단하게 대답합니다. (빠르고 저렴합니다.)

지금까지의 기술(Speculative Decoding)은 초등학생이 먼저 답을 써 내려가면 교수님이 "맞았어!" 혹은 "틀렸어, 다시 해!"라고 검사하는 방식이었습니다. 그런데 초등학생이 조금이라도 교수님과 다르게 말하면, 교수님이 "틀렸어! 처음부터 다시 써!"라고 하며 모든 걸 뒤엎어버리는 바람에 오히려 시간이 더 걸리는 문제가 있었습니다.


2. R-Stitch의 핵심 아이디어: "똑똑한 이어붙이기(Stitching)"

R-Stitch는 이 문제를 **'불확실성(Entropy)'**이라는 신호등을 이용해 해결합니다.

비유하자면, '자율주행 자동차의 속도 조절'과 같습니다.

  1. 초등학생(SLM)이 먼저 달립니다: 아주 쉬운 계산이나 뻔한 문장은 초등학생이 빠르게 써 내려갑니다.
  2. 신호등(Entropy)을 확인합니다: 초등학생이 글을 쓰다가 "어... 이건 좀 어려운데? 내가 맞게 쓰고 있나?" 하고 헷갈려 하는 순간(즉, 불확실성/엔트로피가 높아지는 순간)이 옵니다.
  3. 교수님(LLM)에게 바통을 넘깁니다: 초등학생이 헷갈려 하는 그 지점에서 딱 멈추고, 교수님이 나타나서 그 부분만 정확하게 고쳐줍니다.
  4. 다시 초등학생에게 넘깁니다: 교수님이 어려운 고비를 넘겨서 다시 명확한 길을 찾아주면, 초등학생이 다시 바통을 이어받아 빠르게 달려갑니다.

이것을 논문에서는 **'동적 궤적 스티칭(Dynamic Trajectory Stitching)'**이라고 부릅니다. 마치 끊어진 길을 상황에 맞춰 딱딱 이어 붙이는 것과 같죠.


3. R-Stitch+ : "더 똑똑해진 내비게이션"

논문에서는 여기서 한 단계 더 나아간 **'R-Stitch+'**도 제안합니다.

기존에는 "헷갈리면 교수님 불러!"라는 단순한 규칙(고정된 문턱값)만 있었다면, R-Stitch+는 '경험을 통해 배우는 내비게이션' 같습니다.

  • "이 정도 난이도에서는 교수님을 부르는 게 시간 대비 효율적이야."
  • "이 문제는 초등학생이 그냥 가도 충분해."

이런 판단을 **강화학습(RL)**을 통해 스스로 학습합니다. 즉, **'정확도'**와 **'속도'**라는 두 마리 토끼를 가장 완벽하게 잡을 수 있는 최적의 타이밍을 스스로 찾아내는 것이죠.


4. 결과: "성능은 그대로, 속도는 광속으로!"

이 기술을 적용했더니 놀라운 결과가 나왔습니다.

  • 속도: 기존 방식보다 훨씬 빨라져서, 어떤 경우에는 최대 4배 이상 속도가 빨라졌습니다.
  • 정확도: 교수님이 중요한 순간에 개입해주기 때문에, 초등학생만 썼을 때보다 훨씬 정확하며, 교수님 혼자 썼을 때와 거의 차이가 없습니다.
  • 효율성: 교수님이 모든 문장을 다 쓸 필요가 없으니, 컴퓨터 자원(메모리, 전기 등)도 훨씬 적게 씁니다.

요약하자면?

R-Stitch는 "쉬운 건 빠르게, 어려운 건 정확하게!"를 실현하기 위해, 초등학생의 속도와 교수님의 지혜를 '불확실성'이라는 신호등에 맞춰 아주 유연하게 이어 붙인 똑똑한 인공지능 가속 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →