← 최신 논문
💬 NLP

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

Confucius Code Agent(CCA)는 Confucius SDK를 기반으로 구축된 확장 가능한 소프트웨어 엔지니어링 에이전트로, 고급 컨텍스트 관리, 지속적 학습, 그리고 자동화된 정교화를 위한 메타 에이전트를 통합하여 SWE-Bench-Pro와 같은 실제 코딩 작업에서 최첨단 성능을 달성합니다.

원저자: Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 책이 코드 조각으로 이루어져 있고, 그 책들이 끊임없이 다시 쓰이고 있는 거대한 20층 규모의 도서관을 수리하려고 한다고 상상해 보십시오. 당신에게는 읽고 쓸 줄 아는 아주 똑똑한 사서(AI 모델)가 있지만, 만약 당신이 도서관 전체를 그들에게 통째로 건네준다면, 그들은 압도당하고 5분 전에 자신이 무엇을 했는지조차 잊어버리며 실수를 하기 시작할 것입니다.

이 논문은 실제로 거대하고 복잡한 소프트웨어 프로젝트를 길을 잃지 않고 처리할 수 있는 '슈퍼 사서'를 구축하는 새로운 방법인 **Confucius Code Agent (CCA)**를 소개합니다.

다음은 이 논문의 내용을 쉬운 개념들로 나누어 설명한 것입니다.

1. 문제점: "압도당한 천재"

현재의 AI 코딩 도구들은 짧은 작업에는 뛰어나지만 긴 작업에는 서툰 천재들과 같습니다.

  • 연구용 도구들은 투명성(그들이 어떻게 생각하는지 볼 수 있음)을 갖추고 있지만, 작업 규모가 커지면 무너집니다.
  • 상용 도구들은 실제 사용 시에는 잘 작동하지만, 블랙박스와 같아서 왜 실패했는지 이해하거나 직접 수정하기가 쉽지 않습니다.
  • 문제점: 실제 소프트웨어 엔지니어링은 단순히 코드 한 줄을 쓰는 것이 아닙니다. 그것은 수천 개의 파일, 수많은 단계, 그리고 며칠 전 자신이 무엇을 했는지 기억하는 과정이 포함된 긴 여정입니다. 기존의 도구들은 정보의 양이 너무 많아지면 정보를 잊어버리거나 혼란에 빠집니다.

2. 해결책: "3가지 경험" 도서관 시스템

저자들은 Confucius SDK라는 플랫폼을 구축했습니다. 단순히 AI에게 더 많은 지능을 부여하는 대신, 모든 것이 원활하게 돌아가도록 도서관을 세 가지 뚜렷한 역할로 조직했습니다.

  • Agent Experience (AX): 이것은 AI의 "내부 작업 공간"입니다. AI가 생각하는 데 필요한 필수적인 노트만을 볼 수 있는 깨끗하고 정리된 책상입니다. 지저한 로그나 인간의 잡담에 의해 방해받지 않습니다.
  • User Experience (UX): 이것은 당신(인간)이 보는 것입니다. AI의 진행 상황을 보여주는 명확하고 읽기 쉬운 대시보드로, 마치 작업 중인 영상을 스트리밍하는 것처럼 보여주어 당신이 원시 컴퓨터 코드 때문에 혼란스럽지 않게 합니다.
  • Developer Experience (DX): 이것은 AI를 만드는 엔지니어들을 위한 "제어실"입니다. 엔지니어가 도구를 쉽게 교체하고, AI가 어떻게 학습하는지 관찰하며, 시스템 자체의 버그를 수정할 수 있게 해줍니다.

비유하자면: 건설 현장을 상상해 보세요.

  • AX는 설계도와 할 일 목록만 적힌 현장 소장의 클립보드입니다.
  • UX는 고객이 작업 과정을 지켜보는 안전 유리창입니다.
  • DX는 건축가들이 망치와 드릴을 쉽게 교체할 수 있도록 정리해 둔 공구함 방입니다.

3. 네 가지 초능력

거대한 코드베이스에서 이 시스템이 작동하도록 만들기 위해, Confucius Agent는 네 가지 특정 기술을 사용합니다.

A. "스마트 요약기" (컨텍스트 관리)

AI와 오랫동안 대화를 나누면 대화 내용이 너무 길어져서 AI가 모든 것을 기억하기 어려워집니다.

  • 작동 방식: 에이전트에는 "코드 아키텍트(Code Architect)"가 있어 대화를 지켜봅니다. 대화가 너무 길어지면, 아키텍트는 동작을 멈추고 기록을 읽은 뒤, 구조화된 요약본(목표, 결정 사항, 오류 등을 담은 불렛 포인트 목록)을 작성합니다. 그리고 오래되고 지저분한 채팅 로그를 버리고 이 깨끗한 요약본으로 대체합니다.
  • 결과: AI는 몇 시간이 지난 후에도 큰 그림을 절대 잊지 않습니다.

B. "지속적인 노트" (노트 테이킹)

보통 AI가 실패하면, 다음에 다시 시작할 때 그 실패를 잊어버립니다.

  • 작동 방식: 에이전트에게는 발생한 일을 영구적이고 체계적인 노트(Markdown 파일)에 기록하는 전용 "노트 테이커(Note-Taker)"가 있습니다. 결정적으로, 이들은 실패 노트도 작성합니다 (예: "이 파일을 이런 방식으로 편집하려고 하지 마십시오. 오류가 발생합니다").
  • 결과: 에이전트가 나중에 동일한 문제에 직면했을 때, 노트를 펼쳐 과거의 실수를 확인하고, 똑같은 실수를 반복하는 대신 즉시 문제를 해결합니다.

C. "모듈형 도구 상자" (확장 기능)

AI가 도구(파일 편집기 등)를 사용하는 방식을 하드코딩하는 대신, 이 시스템은 "확장 기능(Extensions)"을 사용합니다.

  • 작의 방식: 이것은 레고 블록과 같습니다. 검색, 편집, 명령 실행과 같은 다양한 도구를 에이전트에 딱 붙일 수 있습니다. 만약 도구가 고장 나거나 새로운 규칙이 필요하다면, 전체 로봇을 다시 만들 필요 없이 그냥 블록을 교체하기만 하면 됩니다.
  • 결과: 시스템이 유연하고 업데이트하기 쉽습니다.

D. "자기 개선 코치" (메타 에이전트)

이것이 가장 독특한 부분입니다. 시스템에는 첫 번째 AI를 구축하고 개선하는 것만을 목표로 하는 두 번째 AI(메타 에이전트)가 포함되어 있습니다.

  • 작동 방식: 메타 에이전트는 메인 에이전트에게 도구를 사용하는 방법을 알려주는 다양한 방식을 테스트합니다. 이를 시험해 보고, 어떤 방식이 가장 잘 작동하는지 확인한 뒤, 지침(프롬프트)을 더 명확하게 자동으로 재작성합니다.
  • 결과: 사람이 일일이 모든 지침을 미세 조정할 필요 없이, 에이전트는 스스로 자신의 업무 능력을 향상시킵니다.

4. 결과: 거인들을 이기다

저자들은 이 시스템을 오픈 소스 소프트웨어의 실제 버그를 수정해야 하는 매우 어려운 테스트인 SWE-Bench-Pro에서 테스트했습니다.

  • 경쟁: 그들은 이 에이전트를 다른 최고 수준의 연구용 도구들, 심지어 OpenAI나 Anthropic 같은 빅테크 기업들이 사용하는 독점적(비공개) 도구들과 비교했습니다.
  • 결과: Confucius Code Agent는 문제의 **59%**를 해결했습니다.
    • 이는 이전의 연구 기록을 경신했습니다.
    • 동일한 기본 "두뇌"(모델)와 동일한 도구를 사용했음에도 불구하고, OpenAI의 GPT-5.2 및 Anthropic의 Claude Opus 4.5의 결과보다 뛰어난 성적을 거두었습니다.
  • 시사점: 이 논문은 AI를 어떻게 조직하느냐(스캐폴딩/구조화)가 AI가 얼마나 똑똑한가만큼 중요하다는 것을 증명합니다. 훌륭한 시스템을 갖춘 약간 더 약한 모델이, 약한 시스템을 가진 더 강한 모델을 이긴 것입니다.

요약

이 논문은 AI가 실제 소프트웨어 엔지니어링을 수행할 수 있도록 만들려면, 단지 AI를 더 똑똑하게 만드는 것만으로는 부족하다고 주장합니다. 우리는 AI가 일할 수 있는 더 나은 "사무실"을 만들어야 합니다. 즉, 깨끗한 책상(AX), 인간을 위한 명확한 시야(UX), 고치기 쉬운 도구(DX), 과거의 실수를 기억하는 방법(노트 테이킹), 그리고 학습을 돕는 코치(메타 에이전트)가 있는 환경 말입니다. 이렇게 할 때, 일반적인 AI라도 거대한 소프트웨어 프로젝트를 해결할 수 있는 강력한 힘을 갖게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →