← 최신 논문
💬 NLP

On the Optimal Reasoning Length for RL-Trained Language Models

이 논문은 강화 학습으로 훈련된 언어 모델의 경우, 추론 정확도가 출력 길이와 비단조적 관계를 보이며, 이는 사고 사슬(chain of thought)이 길어짐에 따라 최빈값의 정확도는 계속 향상됨에도 불구하고 점진적으로 정답에 가까워지는 중심 경향성 주변의 분산이 증가함에 따라 중간값에서 정점을 찍는다는 것을 입증한다.

원저자: Daisuke Nohara, Taishi Nakamura, Rio Yokota

게시일 2026-06-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Daisuke Nohara, Taishi Nakamura, Rio Yokota

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 수다스러운 학생에게 어려운 수학 문제를 풀거나 컴퓨터 코드를 작성하는 법을 가르치고 있다고 상상해 보세요. 당신은 이 학생이 생각을 소리 내어 말하게 하는 과정(이를 '사고의 사슬(Chain-of-Thought)'이라고 부릅니다)을 허용하면, 그들이 어려운 문제를 훨씬 더 잘 풀게 된다는 사실을 발견했습니다. 하지만 함정이 하나 있습니다. 학생이 똑똑해질수록 더 많이 떠드는 경傾向이 있다는 점입니다. 그들은 정답 대신 에세이를 쓰기 시작하며, 이는 생성하는 데 많은 시간과 비용을 소모하게 만듭니다.

이를 해결하기 위해, 연구자들은 학생에게 너무 많이 말하는 것에 대해 '벌칙'을 부여함으로써 간결하게 말하도록 가르치려 노력했습니다. 그들은 학생이 조금만 덜 말하게 한다면, 여전히 똑똑하면서도 더 빨라질 것이라고 기대했습니다.

거대한 놀라움
Nohara와 동료들의 논문에 따르면, "학생이 얼마나 많이 말하는가"와 "얼마나 똑똑한가" 사이의 관계는 직선이 아닙니다. 그것은 마치 언덕과 같습니다.

  • 너무 짧음: 학생에게 너무 짧게 말하도록 강요하면, 생각할 시간이 부족해져서 오답을 냅니다.
  • 적당함: 학생이 조금 더 말하게 하면 정확도가 올라갑니다. 정확도가 가장 높은 "스위트 스팟(최적의 지점)"이 존재합니다.
  • 너무 김: 학생이 너무 오래 말하게 내버려 두면, 비록 여전히 열심히 생각하고 있음에도 불구하고 정확도가 다시 떨어지기 시작합니다.

이 현상은 서로 다른 유형의 학생들(서로 다른 AI 모델들)과 서로 다른 과목들(수학과 코딩) 모두에서 나타났습니다.

"중심" vs "방황하는 군중"
왜 너무 많이 말할 때 정확도가 떨어지는 걸까요? 저자들은 이를 설명하기 위해 영리한 비유를 사용했습니다. 학생의 답변들을 들판 위에 서 있는 사람들의 무리라고 상상해 보세요.

  1. "중심" (최빈 정확도): 학생이 길게 말할수록, 군중의 중심은 정답에 점점 더 가까워집니다. 실제로 학생에게 100개의 답변을 생성하게 한 뒤 가장 자주 등장하는 답변을 고른다면, 그 "가장 흔한" 답변은 학생이 더 길게 말할수록 더 정확해집니다. 핵심 아이디어는 개선되고 있다는 것입니다.
  2. "분산" (최빈값 유출): 하지만 학생이 길게 말할수록, 군중의 개별적인 사람들은 그 중심으로부터 더 멀리 방황하기 시작합니다. 그들은 주의가 산만해지거나, 횡설수설하거나, 이상한 경로로 빠집니다.

결과:
"너무 긴" 구간에서, 군중의 중심은 과녁 정중앙에 서 있지만, 개별 사람들은 타겟에서 너무 멀리 흩어져 있어 무작위로 한 명을 뽑는다면 목표를 놓칠 가능성이 높습니다.

  • 짧은 답변: 군중이 아직 목표를 찾지 못했습니다.
  • 중간 길이의 답변: 군중이 목표 주변에 빽빽하게 모여 있습니다.
  • 긴 답변: 군중의 중심은 완벽하게 과녁 위에 있지만, 사람들은 들판 곳곳에서 원을 그리며 뛰어다니고 있습니다.

시사점
논문은 단순히 AI 모델을 적게 말하게 하는 것이 항상 정답은 아니지만, 그렇다고 끝없이 말하게 두는 것 또한 역효과를 낸다는 결론을 내립니다. 모델이 정답을 찾을 만큼 충분히 집중하면서도, 자신의 횡설수설에 정신이 팔려 정확도를 잃지 않을 수 있는 최적의 길이가 존재합니다. 연구자들은 미래의 도구들이 우리가 설정을 추측하게 만드는 대신, 우리를 위해 이 "스위트 스팟"을 자동으로 찾아내야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →