← 최신 논문
🤖 machine learning

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

이 논문은 동적 목적 함수 재가중치를 적용한 엔드투엔드 리플레이 전략인 RECAP을 소개하며, 이는 강화 학습으로 훈련된 대규모 추론 모델의 일반 능력 망각을 효과적으로 완화하는 동시에 유연한 보상 트레이드오프를 통해 추론 성능을 향상시킨다.

원저자: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "전문가"의 함정

당신이 무엇이든 요리할 수 있는 아주 유능하고 다재다능한 셰프를 고용했다고 상상해 보세요. 이 셰프는 완벽한 케이크를 굽고, 정교하게 채소를 다질 수 있으며, 심지어 주방의 새는 수도꼭지를 고칠 수도 있습니다(이는 모델의 수학, 시각, 일반 지식 처리 능력을 비유합니다).

그런 그 후, 당신은 이 셰프가 중요한 파이 먹기 대회에서 우승하도록 특화된 훈련을 시키기로 결정했습니다. 당신은 셰프를 파이 레시피와 포크를 잡는 엄격한 규칙만 있는 방에 가두고 훈련시킵니다.

그 결과는 어떨까요?
몇 주간의 집중 훈련 끝에, 셰프는 세계적인 수준의 파이 먹기 전문가가 되었습니다. 포크 규칙도 완벽하게 따릅니다. 하지만 파이 연습에만 모든 시간을 쏟은 나머지, 채소를 써는 법이나 수도꼭지를 고치는 법을 잊어버리기 시작합니다. 만약 당신이 양파를 썰어달라고 요청한다면, 셰프는 멍하니 바라보거나 양파를 통째로 삼키려 할지도 모릅니다.

AI의 세계에서도 정확히 이런 일이 일어나고 있습니다. 연구자들은 대규모 언어 모델(LLM)이 "추론"(수학 문제 풀기, 복잡한 논리 따르기)을 학습하도록 RLVR(검증 가능한 보상을 통한 강화 학습)이라는 기술을 사용하고 있습니다. 모델은 추론 능력 면에서 놀라운 발전을 보이지만, 이미지 속 사물을 인식하거나 이미지 내 텍스트를 읽거나, 안전하고 정직함을 유지하는 것과 같은 다른 기술들을 망각하기 시작합니다.

논문의 해결책: "RECAP"

저자들은 RECAP(Replay-Enhanced CApability Preservation)이라고 불리는 새로운 방법을 제안합니다. RECAP을 그 셰프를 위한 스마트한 훈련 일정이라고 생각하면 됩니다.

단순히 셰프에게 하루 종일 파이 레시피만 먹이는 대신, RECAP은 두 가지 일을 수행합니다:

  1. 기초 재현 (Replays the Basics): 셰프가 잊어버리지 않도록 가끔씩 예전의 "채소 썰기"나 "수도꼭지 고치기" 레시피를 다시 가져옵니다.
  2. 동적 가중치 조절 (Dynamic Weighting): 실시간으로 셰프의 진척도를 지켜보는 스마트한 코치 역할을 합니다.

"스마트 코치"의 작동 방식 (비유)

셰프가 동시에 세 가지를 연습하고 있다고 가정해 봅시다:

  • 포크 규칙 (Format): 포크를 잡는 법.
  • 맛 (Accuracy): 파이가 맛있는가?
  • 뒷정리 (General Skills): 주방을 깨끗하게 유지하는 것.

일반적인 훈련 세션에서 코치는 "세 가지를 모두 똑같이 연습해!"라고 말할 수 있습니다. 하지만 이는 비효럽습니다.

  • 포크 규칙은 쉽습니다. 셰프는 5분 만에 마스터합니다. 코치가 셰프에게 한 시간 동안 계속 이 연습을 시킨다면 그것은 시간 낭비입니다.
  • 은 어렵습니다. 셰프는 이 부분에서 고전합니다.
  • 뒷정리는 셰프가 딴 데 정신이 팔려 있어 엉망이 되어가고 있습니다.

RECAP의 코치는 데이터를 보고 이렇게 말합니다:

"이봐, 셰프는 이미 포크 규칙을 마스터했어. 이제 그 부분에 집중하는 건 그만하자(가중치를 낮춤). 대신 맛과 뒷정리에 더 많은 시간을 쓰자. 그 부분들이 아직 서툴거나 불안정하니까."

RECAP은 어떤 기술이 "포화 상태"(이미 학습됨)인지, 어떤 기술이 "변동성이 큰지"(서투르거나 급격히 변함)를 자동으로 감지합니다. 그리고 훈련의 초점을 어려워하거나 변화가 심한 기술으로 옮겨서, 모델이 쉬운 것에 과하게 몰입하다가 어려운 것을 잊어버리지 않도록 조절합니다.

연구 결과 (The Results)

연구진은 강력한 AI 모델(특히 Qwen2.5-VL 제품군)을 대상으로 테스트를 진행했습니다. 그들이 발견한 내용은 다음과 같습니다:

  1. "망각"은 실재한다: 모델을 추론 작업에만 훈련시켰을 때, 모델은 수학 능력은 향상되었지만 이미지 속 텍ền트를 읽거나 사물을 인식하는 등의 능력은 현저히 떨어졌습니다.
  2. RECAP이 구원하다: 동적 일정을 사용하여 훈련한 결과, 모델은 높은 추론 능력을 유지하면서도(때로는 오히려 개선되기도 함) 일반적인 기술들을 잃지 않았습니다. 실제로 RECAP을 사용한 모델은 표준 방식으로 훈련된 모델보다 일반 작업에서 더 나은 성능을 보이기도 했습니다.
  3. 효율성: RE-CAP으로 훈련된 모델은 단순히 똑똑해진 것뿐만 아니라, 더 효율적이 되었습니다. 시스템이 굳이 필요하지 않은 작업에 대해 "생각(긴 텍스트 체인 작성)"하도록 강요하지 않기 때문에, 모델은 더 짧고 직접적인 답변을 내놓기 시작했습니다.

핵심 요약 (The Takeaway)

이 논문은 우리가 AI 모델을 다른 모든 것을 무시한 채 오직 "추론 기계"로만 만들어서는 안 된다고 주장합니다. 그렇게 하면 AI는 현실 세계에서 도움이 되는 법을 잊어버린 '한 가지 기술만 가진 동물(one-trick pony)'이 되어 버립니다.

RECAP은 AI 훈련을 위한 균형 잡힌 식단 역할을 하는 간단한 플러그인 도구입니다. 이는 모델이 복잡한 퍼즐을 푸는 법을 배우는 동안에도, 세상을 보고 읽고 이해하는 법을 잊지 않도록 보장합니다. 즉, AI를 똑똑하게 만드는 동시에, 여전히 다재다능함을 유지하게 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →