← 최신 논문
💻 computer science

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE는 외부 증강 모델을 사용하여 올바른 추론 궤적에서 반복적이거나 관련 없는 내용을 편집하고 제거함으로써 대규모 언어 모델의 추론 효율성을 향상시키는 콘텐츠 수준 최적화 프레임워크로, 명시적인 길이 예산에 의존하지 않고도 정확도-효율성 트레이드오프를 개선합니다.

원저자: Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 한 수학 문제를 풀려고 노력하는 천재이지만 지나치게 수다스러운 학생이 있다고 말입니다. 이 학생은 현대의 대규모 언어 모델 (LLM) 을 대표하며, 정답을 찾는 데는 매우 능숙하지만 종종 "과도하게 생각"합니다. 간단한 방정식을 풀기 위해 50 페이지 분량의 에세이를 작성하거나, 같은 단계를 세 번 반복하거나, 중간에 뜬구름 잡는 소리를 쓰거나, 이미 해답을 찾았음에도 불구하고 계속 긴 글을 작성할 수 있습니다.

이 논문은 이러한 문제를 해결하기 위해 CLORE(Reasoning Efficiency 를 위한 콘텐츠 수준 최적화) 라는 새로운 방법을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명해 보겠습니다.

문제: "과도하게 생각하는" 학생

현재의 AI 모델들은 정답을 얻도록 훈련됩니다. 학생이 정답을 맞히면 교사 (훈련 시스템) 는 "잘했다!"라고 말하며 보상을 줍니다.

하지만 교사는 학생이 어떻게 그 답에 도달했는지는 중요하게 여기지 않습니다.

  • 문제점: 학생이 완벽한 해답을 작성하더라도, 그 뒤에 10 페이지 분량의 뜬구름 잡는 소리를 덧붙이거나, 같은 문장을 50 번 반복하거나, 답이 박스 안에 표시된 후에도 계속 글을 작성할 수 있습니다.
  • 결과: AI 는 "불필요한 내용"에 시간과 컴퓨터 자원 (토큰) 을 낭비합니다. 기존 방법들은 단순히 학생에게 "500 단어를 넘기지 마라"고 말함으로써 이를 해결하려 합니다. 하지만 이는 마치 엄격한 편집자가 에세이의 끝부분만 잘라내는 것과 같습니다. 에세이 중간이 반복적인 뜬구름 잡는 소리로 가득 차 있다는 사실은 해결되지 않습니다.

해결책: CLORE("똑똑한 편집자")

CLORE 는 게임의 규칙을 바꿉니다. 단순히 단어 수를 세는 대신 생각의 질을 살펴봅니다.

CLORE 를 학생과 함께 일하는 똑똑한 편집자로 생각해 보세요. 과정은 다음과 같습니다.

  1. 초안: 학생 (AI) 이 문제를 풉니다. 정답을 틀리면 CLORE 는 무시합니다. 정답을 맞추면 CLORE 가 개입합니다.
  2. 수정: 똑똑한 편집자는 올바른 해답을 읽으며 질문합니다. "이 부분은 필요한가? 이 부분은 단순히 반복되는가? 이 부분은 뜬구름 잡는 소리는 아닌가?"
    • 비유: 학생이 "2 와 2 를 더해야 합니다. 2 더하기 2 는 4 입니다. 따라서 2+2=4 입니다. 합계는 4 입니다."라는 문단을 썼다고 가정해 보세요. 편집자는 반복되는 부분을 지우고 "2+2=4"만 남깁니다.
    • 비유: 학생이 수학 계산과 모순되는 코드 전체를 작성했다면, 편집자는 그 코드를 삭제합니다.
  3. 교훈: 편집자는 두 가지 버전을 만듭니다. 원본(길고, messy 하며, 정확한 버전) 과 강화된 버전(짧고, 깔끔하며, 정확한 버전) 입니다.
  4. 훈련: AI 는 이제 강화된 버전을 선호하도록 훈련됩니다. AI 는 다음과 같이 학습합니다. "hey, 나는 똑같은 정답을 얻을 수 있지만, 뜬구름 잡는 소리 없이 더 간결하게 작성하면 더 좋은 보상을 받는다."

왜 이것이 다른가

대부분의 다른 방법들은 타이머와 같습니다. "이 문제를 1 분 안에 풀어라"라고 말합니다. 30 초 만에 풀면 훌륭합니다. 59 초 만에 풀어도 훌륭합니다. 하지만 그 1 분 중 50 초를 천장을 바라보며 낭비하는 것을 막지는 못합니다.

CLORE 는 콘텐츠 코치와 같습니다. "59 초 만에 문제를 풀었지만, 그중 40 초는 자신을 반복하는 데 썼다. 다음에는 반복을 줄여 20 초 만에 풀어보자"라고 말합니다.

결과

이 논문은 수학 문제 (고등학교 경시대회 및 올림피아드 등) 에서 이를 테스트했습니다. 그들은 다음과 같은 결과를 발견했습니다.

  • 더 짧은 답변: AI 가 훨씬 더 짧은 설명을 작성하기 시작했습니다.
  • 동일한 정확도: AI 의 수학 실력이 나빠지지 않았습니다. 여전히 정답을 맞췄습니다.
  • 덜 많은 "불필요한 내용": AI 는 반복적인 루프, 뜬구름 잡는 소리, 또는 해답을 찾은 후에도 계속 생각하는 것을 멈췄습니다.
  • 더 나은 효율성: AI 가 더 적게 작성하기 때문에 컴퓨터 자원을 덜 사용하고 더 빠르게 실행됩니다.

한 마디로 요약

CLORE 는 AI 모델이 간결한 사고자가 되도록 가르칩니다. 단순히 짧게 작성하도록 강요하는 것이 아니라, 실제로 문제를 해결하는 지적인 부분들은 유지하면서 반복, 뜬구름 잡는 소리, 과도한 생각과 같은 자신의 "정신적 잡음"을 인식하고 삭제하는 법을 가르칩니다. 그 결과, 더 빠르게 사고하고 에너지를 덜 사용하면서도 여전히 정답을 얻는 AI 가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →