AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
AgentCPM-Report는 인간과 유사한 "쓰면서 추론하기(Writing As Reasoning)" 정책을 활용하여 초안 작성과 심층 탐구를 동적으로 교차함으로써, 소형 8B 파라미터 모델이 통찰력 있는 보고서를 생성하는 데 있어 선도적인 폐쇄형 시스템들을 능가할 수 있도록 하는 경량 로컬 딥 리서치 시스템입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
AgentCPM-Report 논문 설명: 일상적인 언어와 비유를 통한 해설
거대한 문제: "경직된 설계도"의 함정
당신이 "AI의 미래"와 같이 잘 알지 못하는 주제에 대해 50페이지 분량의 방대한 백과사전 항목을 작성해야 한다고 상상해 보세요.
현재 대부분의 AI 시스템은 경직된 건축가처럼 작동합니다. 이들은 단 한 단어를 쓰기 전에도, 건물 전체에 대한 완벽하고 상세한 설계도를 그리려고 시도합니다. 첫 벽돌을 놓기도 전에 모든 방이 어떤 모습일지를 미리 결정해 버립니다.
- 결함: 만약 건축가가 설계도에서 실수를 한다면(모든 것을 알지 못하는 상태에서 완벽하게 설계하기란 매우 어렵습니다), 건물 전체가 실패하게 됩니다. 일단 공사가 시작되면 계획을 쉽게 바꿀 수 없습니다.
- 결과: 좋은 설계도를 만들려면 천재적인 건축가(거대하고 비싼 폐쇄형 AI)가 필요합니다. 만약 더 작고 저렴한 AI를 사용한다면, 설계도는 대개 형편없을 것이고, 최종 보고서는 피상적이고 지루해질 것입니다.
해결책: "조각가" 방식
이 논문의 저자들은 AgentCPM-Report라는 새로운 시스템을 만들었습니다. 그들은 AI를 건축가가 아닌 조각가처럼 취급합니다.
조각가는 조각상의 모든 곡선을 미리 계획하지 않습니다. 거친 돌덩이(단순한 개요)에서 시작하여, 일부를 깎아내고, 모양을 살펴본 뒤, *"아, 이 디테일을 놓쳤구나. 이 부분을 더 깊게 파야겠어"*라고 깨닫습니다. 즉, 작업하는 동안 계획을 변경합니다.
이를 **WARP (Writing As Reasoning Policy, 추론으로서의 글쓰기)**라고 부릅니다. 이는 글을 쓰는 행위 자체가 곧 생각하는 행위임을 의미합니다. AI는 한 섹션을 작성하다가, 내용이 너무 얕다는 것을 깨달으면 멈추고, 더 많은 정보를 찾으러 갔다가, 계획을 업데이트한 뒤 다시 글을 씁니다.
작동 원리: 두 단계의 댄스
AI는 마치 스텝을 바꾸는 무용수처럼 두 가지 모드를 번갈아 가며 수행합니다.
- 증거 기반 초안 작성 (필사가): AI는 개요의 한 섹션을 선택하여 인터넷에서 사실을 검색하고 문단을 작성합니다. 이는 필사가가 자신이 찾은 내용을 옮겨 적는 것과 같습니다.
- 추론 중심의 심화 (탐정): 글을 쓴 후, AI는 한 걸음 물러나 질문합니다. "이 정도면 충분한가? 놓친 것은 없는가?"
- 만약 답이 아니오라면, AI는 탐정처럼 행동합니다. 이야기의 빈틈을 찾아내고, 해당 섹션을 더 작고 구체적인 질문들로 쪼갠 뒤, 개요를 업데이트합니다.
- 만약 답이 예라면, 다음 단계로 넘어갑니다.
이 루프를 통해 AI는 처음에 나쁜 계획에 갇혀 있는 대신, 글을 쓰는 과정 중에 새로운 아이디어를 발견할 수 있습니다.
학습: 사냥법을 가르치는 작은 강아지
이 논문은 상대적으로 작은 AI 모델(80억 개의 파라미터, AI 세계에서는 "작은" 수준)을 사용합니다. 보통 작은 모델은 복잡한 계획을 세우는 데 서툽니다. 이를 해결하기 위해 팀은 **다단계 학습 전략(Multi-Stage Training Strategy)**을 사용했습니다.
- 콜드 스타트 (기초 학습): AI에게 알파벳을 가르쳤습니다. 검색하는 법, 문장을 쓰는 법, 기본 규칙을 따르는 법을 배웠습니다.
- 원자적 기술 강화학습 (반복 훈련): 특정 동작들을 연습했습니다. AI가 좋은 문단을 쓰거나 좋은 검색 질문을 던지는 법을 가르쳤고, 이러한 작은 과제들을 제대로 수행했을 때 보상을 주었습니다.
- 전체 파이프라인 강화학습 (마라톤): 마지막으로, AI가 전체 경주를 달리게 했습니다. 단순히 문장이 좋은지만 확인한 것이 아니라, 전체 보고서가 통찰력이 있는지를 확인했습니다.
- 핵심 기술: 그들은 "궤적 가지치기(Trajectory Pruning)" 기법을 사용했습니다. 선생님이 긴 이야기를 쓰다가 무작위로 멈추는 상황을 상상해 보세요. AI는 선생님이 만든 모든 초안을 살펴보고, 가장 좋은 것을 골라 "여기서 멈춰!"라고 말했습니다. 이를 통해 작은 AI는 시간을 낭비하지 않고 정보를 더 깊이 파헤치는 것을 멈춰야 할 정확한 시점을 배웠습니다.
결과: 작은 모델, 큰 두뇌
이 시스템은 Google, OpenAI, Anthropic과 같은 기업의 가장 크고 비싼 AI 시스템들을 대상으로 테스트되었습니다.
- 놀라운 점: 이 작은 로컬 AI(AgentCPM-Report)가 통찰력 있는 보고서를 만드는 데 있어 거대하고 폐쇄적인 시스템들을 이겼습니다.
- 이유: "조각가" 방식(WARP) 덕분에 작은 AI가 임기응변을 발휘할 수 있었기 때문입니다. 완벽한 설계도를 그리기 위해 거대한 두뇌가 필요한 것이 아니라, 진행하면서 계획을 조정하는 능력이 중요했던 것입니다.
이것이 왜 중요한가 (논문에 따르면)
- 개인정보 보호: 이 시스템은 여러분의 컴퓨터(또는 로컬 서버)에서 실행될 수 있을 만큼 작기 때문에, 심도 있는 연구 보고서를 얻기 위해 개인 데이터를 거대 기업의 클라우드로 업로드할 필요가 없습니다.
- 비용: 고품질의 연구를 위해 비싸고 거대한 AI 모델을 사용할 비용을 지불할 필요가 없습니다.
- 품질: AI가 인간 연구자처럼 작업하는 동안 생각을 바꿀 수 있도록 허용되었기 때문에, 보고서는 더 깊이 있고 스마트합니다.
요약하자면: 심도 있는 연구를 하는 데 거대한 두뇌가 필요한 것이 아니라, 글을 쓰면서 배우고 적응할 수 있게 해주는 스마트한 작업 방식(WARP)이 필요하다는 것을 이 논문은 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.