← 최신 논문
💬 NLP

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

이 논문은 모델이 핵심 증거에 집중하는 대신 입력 텍스트를 무분별하게 복사하는 '반복적 복사(repetitive copying)'를 롱 컨텍스트 추론에서의 결정적인 실패 모드로 규정하고, 관련 정보에 근거한 추론에는 보상을 주고 무관한 방해 요소에 대한 의존에는 벌점을 부여함으로써 성능을 향상시키는 증거 인식 강화 학습 방법론인 GEAR를 제안한다.

원저자: Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 100페이지 분량의 거대한 미스터리 소설을 풀려고 한다고 상상해 보세요. 단서들은 첫 번째 장에 숨겨져 있지만, 나머지 부분은 그저 소음의 벽일 뿐입니다. 당신에게는 1초 만에 책 전체를 읽을 수 있는 초천재 탐정 친구(대규모 언어 모델)가 있습니다. 과거에 이 탐정들은 짧은 단편 소설에는 뛰어났지만, 당신이 100페이지짜리 소설을 주자 이상하게 행동하기 시작했습니다. 생각하는 대신, 그들은 '패닉 복사(panic-copy)'를 하기 시작했습니다. 그들은 추리 노트를 작성할 때 원래 책의 거대한 문장들을 그대로 다시 페이지에 붙여넣으며 반복해서 써 내려가기 시작했습니다. "Copy Less, Ground More(더 적게 복사하고, 더 많이 근거를 찾아라)"라는 제목의 이 논문은 바로 이 특정 결함에 대해 파고듭니다. 이 논문은 단계별로 추론하도록 설계된 이러한 AI "사고(thinking)" 모델들이, 이야기가 너무 길어질 때 왜 무의식적으로 텍는 복사하는 루프에 빠지는지를 탐구합니다. 연구진은 이것이 단순히 해롭지 않은 습관이 아니라, AI를 더 멍청하고 느리게 만들며 문제를 해결할 가능성을 낮추는 함정이라는 것을 발견했습니다. 그들은 AI에게 소음을 무시하고 오직 정말 중요한 아주 작은 핵심 단서들에만 집중하도록 가르치는 새로운 학습 방법을 제 제안합니다.

문제는 이 AI 탐정들이 "롱 컨텍스트(long-context, 긴 문맥)" 과제에 직면할 때 시작됩니다. 긴 문맥이란 답이 수백만 단어 사이에 묻혀 있는 거대한 도서관과 같습니다. 이 논문은 "반복적 복사(repetitive copying)"라고 불리는 결정적인 실패 모드를 식별했습니다. 도서관이 거대해지면, AI는 생각을 멈추고 고장 난 뇌를 가진 복사기처럼 행동하기 시작합니다. 해결책을 찾아내는 대신, 프롬프트(질문과 이야기)에서 추출한 방대한 구절들을 자신의 추론 과정(reasoning trace) 속에 직접 그대로 복사해 넣습니다. 연구진은 이러한 현상이 테스트한 거의 모든 최상위 AI 모델에서 나타나며, 문맥이 길어질수록 심화된다는 것을 발견했습니다. 이는 마치 수학 문제를 푸는 대신, 답안지에 교과서 페이지를 그대로 다시 쓰기 시작하는 학생과 같습니다. 이러한 행동은 만연하며, 7개의 서로 다른 프런티어 모델에서 나타났고, 문맥 길이가 8,000단어에서 64,000단어로 늘어남에 따라 더욱 심해졌습니다.

하지만 AI는 왜 이런 행동을 할까요? 저자들은 더 깊이 파고들어, 복사 자체가 나쁜 것이 아니라 AI가 모든 것을 무차별적으로 복사하고 있다는 점이 근본 원인임을 깨달았습니다. 그들은 AI가 핵심 증거에 "근거를 두는(grounding)" 데 실패한다는 것을 발견했습니다. 당신이 거대한 실타래 속에서 특정한 빨간 실을 찾고 있다고 상상해 보세요. 똑똑한 탐정이라면 딱 그 빨간 실만 뽑아낼 것입니다. 하지만 혼란에 빠진 AI는 파란색, 초록색, 노란색의 잡동사니를 포함한 실타래 전체를 움켜쥐고 함께 끌고 갑니다. 논문은 AI가 주로 "방해 요소(distractor)" 텍스트(잡동사니)를 복사할 때 과업에 실패한다는 것을 보여줍니다. 반면, "핵심 증거(key evidence)"(빨간 실)를 선택적으로 복사할 때는 성공합니다. 문제는 복사가 아니라, 집중력의 부재입니다. AI는 어떻게 신호와 소음을 구분해야 하는지 모르기 때문에 무관한 세부 사항들에 빠져 허우적거리고 있는 것입니다.

이를 해결하기 위해 팀은 GEAR(Grounding Evidence-Aware Reward, 근거 기반 증거 인식 보상)라고 불리는 새로운 학습 방법을 발명했습니다. 이것을 비디오 게임의 새로운 규칙이라고 생각해 보세요. 예전 게임에서는 AI가 최종 정답을 맞혔을 때만 점수를 받았습니다. 하지만 새로운 GEAR 게임의 규칙은 더 엄격합니다. AI의 추론 과정이 특정 "핵심 증거"(빨간 실)와 겹치면 보너스 점수를 받습니다. 하지만 여기서 핵심은, 만약 그 과정이 "방해 요소" 텍스트(잡동사니)와 겹친다면 무거운 벌점을 받는다는 것입니다. 이것은 줄다리기를 만들어냅니다. AI는 승리하기 위해서 자신이 기관총이 아닌 저격수가 되어야 한다는 것을 배웁니다. 올바른 단서를 찾고 나머지는 무시해야 합니다. 이를 실제 세계의 문서(단순히 만들어진 수학 문제가 아닌)에 적용하기 위해, 그들은 긴 문서를 조각내어 어떤 부분이 "증거"이고 어떤 부분이 "군더더기"인지를 식별하는 스마트한 편집자 역할을 하는 자동화된 파이프라인을 구축하여 3,200개의 문제로 구성된 학습 데이터셋을 만들었습니다.

새로운 방법을 테스트했을 때, 결과는 판도를 바꾸어 놓았습니다. 그들은 GEAR 보상 시스템을 사용하여 90억 개에서 350억 개의 파라미터에 이르는 세 가지 크기의 AI 모델을 훈련시켰습니다. 결과는 GEAR가 표준 학습 방법들을 일관되게 이겼다는 것을 보여주었습니다. 평균적으로, GEAR는 다양한 어려운 벤치마크에서 AI의 성능을 최대 4.6포인트 향상시켰습니다. 더 중요한 것은, GEAR가 나쁜 습관을 고쳤다는 점입니다. AI는 복사를 덜 하게 되었고, "사고" 과정은 더 짧고 효율적이 되었으며, 특히 매우 긴 문맥(최대 128,000단어)에서 문제를 해결하는 능력이 실제로 향상되었습니다. 이 논문은 AI가 복잡한 추론을 향해 나아갈 때, 올바른 증거 위에 확고히 서 있는 능력이 가장 중요한 기술임을 시사합니다. 그것 없이는 AI는 자신의 복사 작업 속에 길을 잃게 됩니다. GEAR를 통해, AI는 덜 복사하고 더 많이 근거를 찾으며, 혼란스러운 복사기에서 날카로운 탐정으로 거듭납니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →