← 최신 논문
💬 NLP

Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning

이 논문은 autoregressive 생성 시 발생하는 '얕은 탐색의 함정'을 극복하고 상태 커버리지를 극대화하기 위해 길이 기반 보상과 중복성 패널티를 결합한 'Length-Incentivized Exploration' 방법을 제안하여, 다양한 모델에서 도메인 내외부 작업 성능을 유의미하게 향상시켰음을 보여줍니다.

원저자: Futing Wang, Jianhao Yan, Yun Luo, Ganqu Cui, Zhi Wang, Xiaoye Qu, Yue Zhang, Yu Cheng, Tao Lin

게시일 2026-02-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Futing Wang, Jianhao Yan, Yun Luo, Ganqu Cui, Zhi Wang, Xiaoye Qu, Yue Zhang, Yu Cheng, Tao Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 이 더 똑똑하게 생각하게 만드는 새로운 방법"**에 대한 이야기입니다.

기존의 AI 는 문제를 풀 때 보통 "가장 빠르고 간단한 길"을 찾습니다. 하지만 수학이나 논리 같은 어려운 문제는 단순히 빨리 답을 내는 것보다, **여러 가지 가능성을 상상하고, 실수를 찾아내고, 다시 생각해보는 과정 (탐색)**이 필요합니다.

이 논문은 AI 가 그 '깊은 생각'을 하도록 유도하는 **LIE(길이 인센티브 탐색)**라는 방법을 제안합니다.


🧠 핵심 비유: "미로 찾기 게임"

AI 가 문제를 푸는 상황을 거대한 미로 찾기 게임이라고 상상해 보세요.

  1. 기존의 문제 (얕은 탐색의 함정):

    • 대부분의 AI 는 미로에 들어서는 순간, "가장 짧은 길"만 쫓습니다.
    • 문제는 정답이 있는 길은 보통 길고 복잡하다는 점입니다.
    • AI 는 "길이가 긴 길"로 갈수록 갈 확률이 급격히 떨어지도록 훈련되어 있습니다. (마치 "오래 걸으면 지치니까 빨리 끝내라"는 규칙이 있는 것처럼요.)
    • 결과: AI 는 미로의 입구 근처만 맴돌고, 정답이 있는 깊은 곳에는 절대 도달하지 못합니다. 이를 논문에서는 **"얕은 탐색의 함정 (Shallow Exploration Trap)"**이라고 부릅니다.
  2. 새로운 해결책 (LIE 방법):

    • 연구자들은 AI 에게 **"더 많이 생각해보라"**고 강제로 부추기는 두 가지 규칙을 만들었습니다.
    • 규칙 1: "길게 말하면 점수 줌" (길이 보상)
      • AI 가 문제를 풀 때, 바로 답을 내지 않고 생각하는 과정 (토큰) 을 더 길게 늘리면 보상을 줍니다.
      • 비유: "미로에서 100 걸음 이상 걸으면 보너스 점수를 줄게!"라고 하는 거죠. 이렇게 하면 AI 는 자연스럽게 더 깊은 곳까지 가게 됩니다.
    • 규칙 2: "중복되면 감점" (중복 패널티)
      • 하지만 단순히 길게만 말하면 AI 가 "아... 아... 아..."라고 반복하며 시간을 끄는 (지루한) 행동을 할 수 있습니다.
      • 그래서 같은 말을 반복하거나 쓸데없는 내용을 넣으면 점수를 깎습니다.
      • 비유: "길게 걸어도 되지만, 같은 곳을 두 번 오면 벌점을 줄게. 진짜 새로운 길을 찾아야 해!"라고 하는 거죠.

🚀 이 방법이 왜 대단할까요?

이 두 가지 규칙을 합치면 AI 는 다음과 같은 변화를 겪습니다.

  • 더 깊게 생각함: AI 는 더 많은 가능성을 시도해 봅니다. (예: "이렇게 해볼까? 아니면 저렇게 해볼까?")
  • 실수 고침: 처음에 틀린 길로 갔다가, 뒤로 돌아와서 (Backtracking) 다시 올바른 길을 찾는 능력을 키웁니다.
  • 어려운 문제 해결: 평소에는 풀지 못했던 아주 어려운 수학 문제나 논리 퀴즈에서도 정답을 찾아내는 능력이 크게 향상되었습니다.

📊 실제 성과

연구진은 이 방법을 다양한 AI 모델 (Qwen, Llama 등) 에 적용해 보았습니다.

  • 결과: AI 가 문제를 풀 때 정답률이 평균 4.4%~2.7% 정도 올랐습니다.
  • 의미: 단순히 AI 를 더 크게 만드는 것 (모델 크기 증가) 보다, AI 가 문제를 풀 때 '더 많이, 더 깊이' 생각하게 만드는 것이 훨씬 효과적이라는 것을 증명했습니다.

💡 한 줄 요약

"AI 에게 '더 길게 생각하라'고 장려하고, '중복된 생각은 하지 말라'고 경고하면, AI 는 미로 속에서 정답을 찾기 위해 훨씬 더 똑똑하고 창의적인 방법을 찾아냅니다."

이 연구는 AI 가 단순히 정보를 암기하는 것을 넘어, 인간처럼 복잡한 문제를 해결하는 '사고력'을 키우는 방법을 제시했다는 점에서 매우 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →