daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
이 논문은 실제 풀 리퀘스트(Pull Request) 시퀀스를 활용하여 고품질의 장기적(long-horizon) 훈련 데이터를 합성함으로써, 과도한 주석 비용 없이도 복잡한 에이전트 워크플로우에서 상당한 성능 향상을 가능하게 하는 데이터 효율적인 프레임워크인 daVinci-Agency를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 문제: AI의 "짧은 주의 집중 시간"
당신에게 아주 똑똑한 학생이 한 명 있다고 상상해 보세요. 이 학생은 "2+2는 무엇인가요?" 또는 "고양이에 대한 시를 써주세요"와 같은 단일 질문에 답하는 데는 매우 뛰어납니다. 이 학생이 바로 **대규모 언어 모델(LLM)**입니다.
하지만 만약 당신이 이 학생에게 집을 지으라고 요청한다면, 그 학생은 어려움을 겪을 것입니다. 기초를 다져놓고는 지붕이 필요하다는 사실을 잊어버리거나, 벽을 엉뚱한 곳에 세워두고는 프로젝트가 끝날 때까지 그 사실을 깨닫지 못할 수도 있습니다. AI의 세계에서 이를 **장기적 과제(long-horizon task)**라고 부릅니다. 이는 많은 단계가 필요한 작업으로, 초기에 저지른 실수가 나중에 전체 프로젝트를 망칠 수 있는 일입니다.
이 논문은 현재의 AI 모델들이 장기적인 작업을 수행하는 데 실패하는 이유가, 긴 시간 동안 앞을 내다보고 계획하며, 일관성을 유지하고, 자신의 실수를 스스로 수정하는 법을 보여주는 데이터로 학습되지 않았기 때문이라고 주장합니다.
해결책: "소프트웨어 진화"로부터의 학습
저자들(SII, SJDT, GAIR 소속)은 AI에게 복잡하고 긴 프로젝트를 처리하는 법을 가르치는 가장 좋은 방법은 실제 인간이 소프트웨어를 어떻게 구축하는지 살펴보는 것이라는 점을 깨달았습니다.
비유: "풀 리퀘스트(Pull Request)"의 사슬
소프트웨어 개발에서 프로그래머가 새로운 기능을 추가하거나 버그를 수정하고 싶을 때, 완성된 코드를 그냥 툭 던져놓지 않습니다. 대신 **"풀 리퀘스트(Pull Request, PR)"**를 제출합니다.
- 1단계: 작은 변경 사항을 제출합니다 (PR #15).
- 2단계: 검토자가 "내용은 좋지만, 안전장치가 빠졌습니다"라고 피드백을 줍니다.
- 3단계: 프로그래머는 이를 수정하여 첫 번째 변경 사항 위에 쌓아 올린 새로운 변경 사항(PR #21)을 제출합니다.
- 4단계: 기능이 완벽해질 때까지 이 과정이 여러 차례 반복됩니다.
저자들은 이를 **"풀 리퀘스트의 사슬(Chain of Pull Requests)"**이라고 부릅니다. 이는 각 장(chapter)이 이전 장에 의존하며, 등장인물(코드)이 시간이 흐름에 따라 진화하고 개선되는 이야기와 같습니다.
혁신: daVinci-Agency
연구팀은 daVinci-Agency라는 새로운 시스템을 만들었습니다. AI가 학습할 수 있도록 가짜 시나리오를 만들거나 사람에게 비용을 지불하여 긴 이야기를 쓰게 하는 대신, 그들은 GitHub(거대한 실제 소프트웨어 프로젝트 라이브러리)로 가서 이러한 자연스러운 "풀 리퀘스트의 사슬"을 수집했습니다.
그들은 이 실제 세계의 개발 이야기들을 학습 데이터로 변환했습니다.
- 학습 방식: 모델(GLM-4.6)을 가져와 이 사슬들을 보여주었습니다.
- 교훈: AI는 성공하기 위해서 다음을 수행해야 함을 배웠습니다.
- 분해(Decompose): 거대한 목표를 작고 관리 가능한 단계로 나눕니다.
- 일관성 유지(Stay Consistent): 50단계가 지난 후에도 원래의 목표를 기억합니다.
- 정교화(Refine): 자신의 실수(버그)를 살펴보고, 처음부터 다시 시작하는 대신 이를 수정합니다.
"마법 같은" 결과: 적은 데이터, 큰 성과
보통 AI를 더 똑똑하게 만들기 위해서는 수백만 개의 예시를 입력해야 합니다.
- 기존 방식: 66,000개의 예시로 학습 (논문에 언급된 다른 데이터셋들).
- daVinci 방식: 단 239개의 예시로 학습.
결과:
200배나 적은 데이터를 사용했음에도 불구하고, daVinci-Agency로 학습된 모델은 방대한 데이터셋으로 학습된 모델보다 현저히 뛰어난 성능을 보였습니다.
- 도구를 사용하여 문제를 해결해야 하는 Toolathlon 테스트에서, 모델의 성능이 47% 향상되었습니다.
- 실제 소프트웨어 버그를 수정하는 테스트인 SWE-bench에서도 훨씬 높은 점수를 기록했습니다.
왜일까요? 그 239개의 예시가 고품질이었기 때문입니다. 그것들은 무작위가 아니라, 복잡한 문제가 시간에 따라 어떻게 해결되는지를 보여주는 실제 이야기였습니다. AI는 단순히 사실을 암기한 것이 아니라, 끈기와 교정이라는 습관을 배운 것입니다.
AI가 실제로 배운 것 (메타 기술)
이 논문은 AI가 단순히 코딩 실력이 좋아진 것이 아니라, 생각하는 법 자체가 좋아졌음을 보여줍니다.
- 이전: AI가 실수를 하면 혼란에 빠지거나, 관련 없는 주제로 벗어나거나, 포기해 버렸습니다(이를 "도피(escapism)"라고 합니다).
- 이후: 실수를 했을 때, AI는 잠시 멈추고 "잠깐, 내가 지금 틀리게 하고 있구나"라고 깨달은 뒤 이를 수정했습니다. AI는 계획하고 궤도를 유지하는 법을 배웠습니다.
효율성: 적은 것으로 더 많이 하기
논문은 또한 새로운 AI가 더 효율적이라는 것을 발견했습니다.
- 비유: 두 사람이 미로를 탈출하려고 한다고 상상해 보세요.
- 사람 A (기존 AI): 모든 막다른 길에 부딪히고, 비명을 지르며, 100가지의 잘못된 경로를 시도합니다.
- 사람 B (daVinci AI): 지도를 보고 막다른 길을 파악한 뒤, 곧장 직진하는 경로를 택합니다.
- daVinci로 학습된 AI는 동일한 문제를 해결하는 데 더 적은 **단어(토큰)**와 더 적은 도구 클릭을 사용했습니다. 혼란 때문에 에너지를 낭비하지 않았습니다.
"스케일링(Scaling)"의 발견
마지막으로, 저자들은 학습하는 이야기가 더 길어지면 어떤 일이 발생하는지 테스트했습니다.
- 그들은 AI를 더 많은 단계(더 긴 풀 리퀘스트 사슬)를 가진 체인으로 학습시키면 AI가 더욱 향상된다는 것을 발견했습니다.
- 이는 AI가 더 긴 "원거리" 사고를 연습할수록, 매우 길고 복잡한 문제를 해결하는 능력이 더 좋아진다는 것을 시사합니다.
요약
daVinci-Agency는 AI 에이전트를 훈련시키는 새로운 방법입니다. AI에게 수백만 개의 짧고 가짜인 과제를 암기하도록 강요하는 대신, 인간이 소프트웨어를 구축하는 실제적이고 긴 이야기를 보여줌으로써 가르칩니다. 이러한 자연스러운 "사건의 사슬"로부터 학습함으로써, AI는 계획하고, 일관성을 유지하며, 자신의 실수를 스스로 수정하는 법을 배워, 이전보다 훨씬 적은 데이터로도 훨씬 더 똑똑하고 효율적으로 변합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.