← 최신 논문
🤖 AI

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

Argus는 특화된 역할들을 통해 관리되는 지속적이고 자기 진화적인 상태를 활용하여 미션 궤적을 자율적으로 검증, 복구 및 정교화함으로써 다양한 벤치마크 전반에 걸쳐 우수한 장기 추론 성능을 달성하는 범용 고정 가중치 에이전트 런타임입니다.

원저자: Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang
게시일 2026-08-06
📖 6 분 읽기🧠 심층 분석

원저자: Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

장기 추적 탐정: 왜 AI에게는 기억력과 코치가 필요한가

당신이 작동하는 로봇을 처음부터 만드는 법을 알아내거나, 실제로 앞뒤가 맞는 소설을 쓰는 것과 같이 며칠씩 걸리는 거대한 미스터리를 풀려고 노력하고 있다고 상상해 보십시오. 만약 당신이 몇 년 전의 컴퓨터 프로그램이었다면, 지시 사항을 읽고, 추측을 한 뒤, 다시 시도하기 전에 방금 했던 모든 것을 즉시 잊어버리는 방식으로 문제를 해결하려 했을 것입니다. 이것이 많은 초기 AI "에이전트"들이 작동하던 방식이었습니다. 그들은 단서 하나를 해결하면 바로 기억상실증에 걸려, 막다른 길에 부딪힐 때마다 처음부터 조사를 다시 시작해야 하는 탐정과 같았습니다. 그들은 읽는 속도는 빨랐지만, 긴 시간 동안 자신의 실수로부터 배우는 데는 형편없었습니다.

"장기 지평 추론(long-horizon reasoning)" 분야는 바로 이 문제를 해결하는 것에 관한 것입니다. 이 분야는 다음과 같은 질문을 던집니다: 어떻게 하면 AI가 며칠 또는 몇 주 동안 계획을 유지하고, 어제 무엇을 시도했는지 기억하며, 잘못된 방향으로 가고 있다는 것을 깨달았을 때 전략을 바꿀 수 있을까? 여기서 핵심 아이디어는, 똑똑하다는 것이 단순히 큰 뇌(강력한 모델)를 갖는 것만이 아니라, 좋은 노트(지속적인 기억)와 당신이 막혔을 때 스스로를 속이지 못하도록 막아주는 엄격한 코치(검증)를 갖는 것이라는 점입니다. 이 논문은 AI 시스템이 단순히 제자리를 맴도는 것이 아니라, 처음부터 다시 훈련될 필요 없이 시간이 흐름에 따라 스스로의 방법을 진화시키고 더 어려운 문제를 해결할 수 있도록 구축하는 방법에 대해 다룹니다.


아거스(Argus)를 만나보세요: 피벗(Pivot)하는 법을 배우는 AI

새로운 종류의 AI "런타임"(AI의 두뇌를 실행하는 운영 체제나 엔진이라고 생각하십시오)인 **아거스(Argus)**를 소개합니다. 마이크로소프트와 여러 유수 대학의 연구진으로 구성된 아거스 개발팀은, AI가 진정으로 어렵고 장기적인 프로젝트를 수행하려면 단순히 맹목적으로 앞으로 나아가기만 해서는 안 된다는 점을 깨달았습니다. 만약 AI가 거대한 소프트웨어 코드베이스의 버그를 수정하거나 복잡한 수학 정리를 증명하려고 한다면, 몇 시간 동안 결국 막다른 길이 될 경로를 따라 계속 나아갈 수도 있습니다. 일반적인 AI는 그냥 계속 밀어붙이며 시간과 에너지를 낭비할 수 있습니다. 아거스는 다릅니다. 아거스는 **피벗(방향 전환)**하도록 설계되었습니다.

아거스를 혼자 일하는 개인이 아니라, 공유 오피스에서 일하는 매우 조직적인 연구 팀이라고 생각해 보십시오. 이 팀에는 네 가지 뚜렷한 역할이 있으며, 서로의 업무를 절대 혼동하지 않습니다.

  1. 매니저(Manager): 큰 그림을 쥐고 있는 보스입니다. 일일 계획이 바뀌더라도 팀이 원래의 목표(예: "로봇 만들기")에 집중할 수 있도록 합니다.
  2. 플래너(Planner): 전략가로서 큰 목표를 하루 동안 수행 가능한 작은 작업들로 나눕니다.
  3. 엔지니어(Engineer): 실제로 코드를 작성하거나, 실험을 실행하거나, 수학 계산을 수행하는 빌더입니다.
  4. 리뷰어(Reviewer): 엄격한 품질 관리 검사관입니다. 엔지니어가 만든 결과물을 보고 "좋다", "수정이 필요하다" 또는 "멈춰라, 이 경로는 막다른 길이다"라고 말하는 것이 그들의 임무입니다.

아거스의 마법은 실패를 데이터로 취급한다는 점에 있습니다. 엔지니어가 어떤 방법을 시도했다가 실패하면, 리뷰어는 단순히 "앗" 하고 넘어가지 않습니다. 그들은 정확히 실패했는지를 기록합니다. 이 기록은 영구적인 "프로젝트 상태"(팀의 공유 노트)에 저장됩니다. 나중에 팀이 동일한 막다른 길로 다시 가려고 하면, 시스템은 "헤이, 어제 이걸 시도했는데 안 됐었지"라고 기억하고 새로운 아이디어로 피벗합니다. 이것을 **검증 가이드형 지속성(verification-guided persistence)**이라고 부릅니다. 시스템은 리뷰어가 새로운 정보가 실제로 사실이고 유용하다고 검증했을 때만 "학습"(기억 업데이트)을 수행합니다.

발견한 점: 코드 수정 및 논문 작성 능력 향상

연구팀은 이 "기억력을 가진 팀" 접근 방식이 실제로 효과가 있는지 확인하기 위해 아거스를 매우 어려운 도전 과제들에 테스트했습니다.

1. 코드 수정 테스트 (SWE-Bench Pro)
그들은 아거스에게 731개의 실제 소프트웨어 버그를 수정하게 했습니다. 이는 프로그래머에게 엉망이고 망가진 코드베이스를 주고 인간의 도움 없이 수정하도록 요청하는 것과 같습니다.

  • 결과: 아거스는 약 **78%**의 버그를 성공적으로 수정했습니다.
  • 비교: 표준 AI 도구(Direct Copilot)는 이 중 **59%**만을 수정할 수 있었습니다.
  • 비용: 아거스는 표준 도구보다 약 1.41배 더 많은 컴퓨터 "토큰"(생각의 기본 단위)을 사용했습니다.
  • 시사점: 아거스는 생각을 조금 더 많이 했음에도 불구하고 훨씬 더 정확했습니다. 이는 작업을 확인하고 과거의 실수를 기억하는 데 시간을 들이는 것이 보상을 준다는 것을 입증했습니다.

2. "똑똑해지는" 테스트 (자기 진화)
가장 멋진 부분은 여기입니다. 연구진은 시간이 흐름에 따라 아거스를 관찰했습니다. 그들은 AI의 두뇌(모델 가중치)를 변경하지 않았습니다. 대신, 시스템이 기술과 기억이 담긴 "노트"를 쌓아 올리도록 두었습니다.

  • 결과: 시스템이 더 많은 작업을 수행하고 검증된 기술로 노트를 채워감에 따라, 시스템은 더 빠르고 저렴해졌습니다. 테스트 후반 단계에서 아거스는 시작할 때와 비교하여 작업당 토큰을 21% 적게 사용했고 시간은 15% 덜 소요되었습니다.
  • 의미: AI는 더 나아지기 위해 재훈련될 필요가 없었습니다. 단지 자신이 배운 것을 기억하기만 하면 되었습니다. AI는 근본적인 두뇌를 바꾸지 않고도 자신의 "런타임 상태"를 진화시켜 더 효율적인 작업자가 되었습니다.

3. "스스로를 속이지 마라" 테스트 (리뷰어의 개입)
팀은 리뷰어가 얼마나 자주 개입했는지 추적했습니다. 731개의 작업 중 리뷰어가 호출된 횟수는 466회였습니다.

  • 구조: 43건의 사례에서 리뷰어는 "아직 완료되지 않았으니 다시 시도하라"고 말했습니다. 엔지니어가 다시 시도한 후, 그중 34건이 성공적으로 수정되었고, 22건은 두 번째의 더 엄격한 리뷰까지 통과할 정도로 완벽하게 수정되었습니다.
  • 차단: 리뷰어는 또한 실제로 불가능하거나 고장 난 35건의 작업에 대해 승리를 선언하려는 시스템을 막았습니다. 이는 매우 중요합니다. 즉, 시스템이 가짜 해결책을 만들어내는 환각(hallucination)을 일으키는 대신 "나는 이것을 할 수 없다"라고 말하는 법을 배웠음을 의미합니다.

코드 그 이상: 수학, 칩, 그리고 논문

아거스는 코드 수정에만 머물지 않았습니다. 연구팀은 이 시스템이 다른 "장기 지평" 과제들도 처리할 수 있음을 보여주었습니다.

  • 수학 연구: 복잡한 수학 정리를 증명하는 캠페인에서, 아거스는 하나의 경로가 거짓으로 판명된(falsified route) 기록을 유지했습니다. 그 경로를 삭제하는 대신, "진입 금지" 표지판으로 간직했습니다. 이는 시스템이 나중에 해당 막다른 길을 피하고 성공적으로 정리의 경계를 강화하는 데 도움이 되었습니다.
  • 논문 작성: 그들은 과학 논문을 작성하기 위해 6개의 서로 다른 연구 프로젝트를 실행했습니다. 시스템은 254번의 미션을 수행했고, 16번의 주요 롤백(계획 전체를 되돌려야 했던 상황)을 견뎌냈으며, 여전히 6편의 논문을 모두 완성해 냈습니다. 한 프로젝트는 실패한 아이디어를 성공적인 "부정적 결과(negative results)" 연구로 바꾸어 놓았는데, 이는 때때로 무엇이 작동하지 않는지를 알아내는 것도 유효한 과학적 발견임을 입증했습니다.
  • 칩 설계: 무서운 테스트에서 아거스는 컴퓨터 칩(ACE-2)을 설계했습니다. 시스템은 코드를 작성하고 타이밍을 체크했으며, 최종 설계는 모든 엄격한 하드웨어 검사를 통과했습니다. 시스템은 심지어 자신이 무엇을 체크하지 않았는지(예: 칩이 실제 환경에서 작동할지 여부)를 정확히 알고 있었으며, 그 한계점을 명확히 기재했습니다.

결론

아거스는 AI가 진정한 장기 작업을 수행하기 위해서는 단순히 큰 두뇌만으로는 부족하다는 것을 보여줍니다. AI에게는 "보스"와 "작업자"를 분리하고, 무엇이 작동하고 무엇이 작동하지 않는지에 대한 영구적인 기록을 유지하며, 가짜 답변을 내놓지 않도록 막는 엄격한 "리뷰어"가 있는 시스템이 필요합니다.

이 논문은 이러한 "검증 게이트(verification-gated)" 접근 방식을 사용함으로써, AI가 더 어려운 문제를 해결하고, 재훈련 없이도 시간이 흐름에 따라 더 효율적으로 변하며, 심지어 막혔을 때 인정할 수도 있다는 것을 시사합니다. 이것은 모든 것을 즉시 해결하는 마법 지팡이가 아닙니다. 하지만 AI가 우리와 함께 복잡하고 긴 프로젝트를 수행하면서 길을 잃거나 진행 상황에 대해 거짓말을 하지 않도록 만드는, 실질적인 발걸음입니다. 저자들이 언급했듯이, 이것은 단순히 테스트 점수를 높이는 것이 아니라, 현실 세계의 복잡하고 장기적인 과제들을 해결하기 위해 지속하고, 피벗하고, 스스로의 방법을 진화시킬 수 있는 시스템을 구축하는 것에 관한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →