← 최신 논문
💬 NLP

AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research

AgentCPM-Report는 인간과 유사한 "쓰면서 추론하기(Writing As Reasoning)" 정책을 활용하여 초안 작성과 심층 탐구를 동적으로 교차함으로써, 소형 8B 파라미터 모델이 통찰력 있는 보고서를 생성하는 데 있어 선도적인 폐쇄형 시스템들을 능가할 수 있도록 하는 경량 로컬 딥 리서치 시스템입니다.

원저자: Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

게시일 2026-02-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

AgentCPM-Report 논문 설명: 일상적인 언어와 비유를 통한 해설

거대한 문제: "경직된 설계도"의 함정

당신이 "AI의 미래"와 같이 잘 알지 못하는 주제에 대해 50페이지 분량의 방대한 백과사전 항목을 작성해야 한다고 상상해 보세요.

현재 대부분의 AI 시스템은 경직된 건축가처럼 작동합니다. 이들은 단 한 단어를 쓰기 전에도, 건물 전체에 대한 완벽하고 상세한 설계도를 그리려고 시도합니다. 첫 벽돌을 놓기도 전에 모든 방이 어떤 모습일지를 미리 결정해 버립니다.

  • 결함: 만약 건축가가 설계도에서 실수를 한다면(모든 것을 알지 못하는 상태에서 완벽하게 설계하기란 매우 어렵습니다), 건물 전체가 실패하게 됩니다. 일단 공사가 시작되면 계획을 쉽게 바꿀 수 없습니다.
  • 결과: 좋은 설계도를 만들려면 천재적인 건축가(거대하고 비싼 폐쇄형 AI)가 필요합니다. 만약 더 작고 저렴한 AI를 사용한다면, 설계도는 대개 형편없을 것이고, 최종 보고서는 피상적이고 지루해질 것입니다.

해결책: "조각가" 방식

이 논문의 저자들은 AgentCPM-Report라는 새로운 시스템을 만들었습니다. 그들은 AI를 건축가가 아닌 조각가처럼 취급합니다.

조각가는 조각상의 모든 곡선을 미리 계획하지 않습니다. 거친 돌덩이(단순한 개요)에서 시작하여, 일부를 깎아내고, 모양을 살펴본 뒤, *"아, 이 디테일을 놓쳤구나. 이 부분을 더 깊게 파야겠어"*라고 깨닫습니다. 즉, 작업하는 동안 계획을 변경합니다.

이를 **WARP (Writing As Reasoning Policy, 추론으로서의 글쓰기)**라고 부릅니다. 이는 글을 쓰는 행위 자체가 곧 생각하는 행위임을 의미합니다. AI는 한 섹션을 작성하다가, 내용이 너무 얕다는 것을 깨달으면 멈추고, 더 많은 정보를 찾으러 갔다가, 계획을 업데이트한 뒤 다시 글을 씁니다.

작동 원리: 두 단계의 댄스

AI는 마치 스텝을 바꾸는 무용수처럼 두 가지 모드를 번갈아 가며 수행합니다.

  1. 증거 기반 초안 작성 (필사가): AI는 개요의 한 섹션을 선택하여 인터넷에서 사실을 검색하고 문단을 작성합니다. 이는 필사가가 자신이 찾은 내용을 옮겨 적는 것과 같습니다.
  2. 추론 중심의 심화 (탐정): 글을 쓴 후, AI는 한 걸음 물러나 질문합니다. "이 정도면 충분한가? 놓친 것은 없는가?"
    • 만약 답이 아니오라면, AI는 탐정처럼 행동합니다. 이야기의 빈틈을 찾아내고, 해당 섹션을 더 작고 구체적인 질문들로 쪼갠 뒤, 개요를 업데이트합니다.
    • 만약 답이 라면, 다음 단계로 넘어갑니다.

이 루프를 통해 AI는 처음에 나쁜 계획에 갇혀 있는 대신, 글을 쓰는 과정 중에 새로운 아이디어를 발견할 수 있습니다.

학습: 사냥법을 가르치는 작은 강아지

이 논문은 상대적으로 작은 AI 모델(80억 개의 파라미터, AI 세계에서는 "작은" 수준)을 사용합니다. 보통 작은 모델은 복잡한 계획을 세우는 데 서툽니다. 이를 해결하기 위해 팀은 **다단계 학습 전략(Multi-Stage Training Strategy)**을 사용했습니다.

  1. 콜드 스타트 (기초 학습): AI에게 알파벳을 가르쳤습니다. 검색하는 법, 문장을 쓰는 법, 기본 규칙을 따르는 법을 배웠습니다.
  2. 원자적 기술 강화학습 (반복 훈련): 특정 동작들을 연습했습니다. AI가 좋은 문단을 쓰거나 좋은 검색 질문을 던지는 법을 가르쳤고, 이러한 작은 과제들을 제대로 수행했을 때 보상을 주었습니다.
  3. 전체 파이프라인 강화학습 (마라톤): 마지막으로, AI가 전체 경주를 달리게 했습니다. 단순히 문장이 좋은지만 확인한 것이 아니라, 전체 보고서가 통찰력이 있는지를 확인했습니다.
    • 핵심 기술: 그들은 "궤적 가지치기(Trajectory Pruning)" 기법을 사용했습니다. 선생님이 긴 이야기를 쓰다가 무작위로 멈추는 상황을 상상해 보세요. AI는 선생님이 만든 모든 초안을 살펴보고, 가장 좋은 것을 골라 "여기서 멈춰!"라고 말했습니다. 이를 통해 작은 AI는 시간을 낭비하지 않고 정보를 더 깊이 파헤치는 것을 멈춰야 할 정확한 시점을 배웠습니다.

결과: 작은 모델, 큰 두뇌

이 시스템은 Google, OpenAI, Anthropic과 같은 기업의 가장 크고 비싼 AI 시스템들을 대상으로 테스트되었습니다.

  • 놀라운 점: 이 작은 로컬 AI(AgentCPM-Report)가 통찰력 있는 보고서를 만드는 데 있어 거대하고 폐쇄적인 시스템들을 이겼습니다.
  • 이유: "조각가" 방식(WARP) 덕분에 작은 AI가 임기응변을 발휘할 수 있었기 때문입니다. 완벽한 설계도를 그리기 위해 거대한 두뇌가 필요한 것이 아니라, 진행하면서 계획을 조정하는 능력이 중요했던 것입니다.

이것이 왜 중요한가 (논문에 따르면)

  • 개인정보 보호: 이 시스템은 여러분의 컴퓨터(또는 로컬 서버)에서 실행될 수 있을 만큼 작기 때문에, 심도 있는 연구 보고서를 얻기 위해 개인 데이터를 거대 기업의 클라우드로 업로드할 필요가 없습니다.
  • 비용: 고품질의 연구를 위해 비싸고 거대한 AI 모델을 사용할 비용을 지불할 필요가 없습니다.
  • 품질: AI가 인간 연구자처럼 작업하는 동안 생각을 바꿀 수 있도록 허용되었기 때문에, 보고서는 더 깊이 있고 스마트합니다.

요약하자면: 심도 있는 연구를 하는 데 거대한 두뇌가 필요한 것이 아니라, 글을 쓰면서 배우고 적응할 수 있게 해주는 스마트한 작업 방식(WARP)이 필요하다는 것을 이 논문은 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →