StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
이 논문은 내구성이 있는 상태(durable states), 검증된 전이(checked transitions), 그리고 버전 관리된 런북(versioned runbooks)을 통한 하네스 스케일링(harness scaling)을 활용하여 Terminal-Bench 2.1에서 장기 추론 에이전트 정확도를 95.3%까지 크게 높이는 동시에 베이스라인 모델 대비 추론 비용을 획기적으로 줄인 에이전트 네이티브 런타임인 StateM을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능 분야가 급격히 발전함에 따라 한 가지 지속적인 수수께끼가 등장했습니다. 왜 개별적인 복잡한 단계들은 완벽하게 해결할 수 있는 정교한 컴퓨터 프로그램들이, 긴 과정이 필요한 다단계 작업을 수행하라고 하면 종종 실패하는가 하는 점입니다. 완벽한 방을 설계할 수 있는 유능한 건축가가 기초를 놓는 것을 잊어버리거나, 숙련된 외과의사가 결점 없는 절개를 수행하면서도 작업 중간에 환자의 생체 징후를 놓치는 상황을 상상해 보십시오. '롱 호라이즌 에이전트(long-horizon agents)'라고 불리는 이 시스템들은 지능이 부족해서가 아니라, 프로세스 속에서 자신의 위치를 놓치기 때문에 자주 실수를 저지릅니다. 그들은 이미 무엇을 했는지 잊어버리거나, 필수적인 확인 절차를 건너뛰거나, 최종 목표에 진정으로 도달하기 전에 작업을 중단하기도 합니다. 수년 동안 표준적인 해결책은 더 크고 똑똑한 뇌를 만드는 것이었으며, 더 강력한 모델이라면 이러한 실수를 저지르지 않을 것이라는 희망을 품었습니다. 하지만 새로운 연구 방향은 문제가 뇌 자체가 아니라, 그 뇌가 일하는 환경에 있을 수도 있다는 점을 시사합니다.
연구자들은 다른 질문을 던지기 시작했습니다. 이 실패의 상당 부분이 실제로 에이전트의 주의력을 유지하고, 진행 상황을 추적하며, 작업을 끝마치도록 강제하는 시스템의 실패인가 하는 점입니다. 저자들이 '하네스 스케일링(harness scaling)'이라고 부르는 이 접근 방식은, 기존의 유능한 모델 자체를 변경하지 않고도 그 모델을 둘러싼 도구와 규칙을 개선함으로써 모델을 훨씬 더 신뢰할 수 있게 만들 수 있다고 제안합니다. 에이전트에게 모든 것을 스스로 기억하도록 강요하는 대신, 이 방법은 에이전트와 인간 감독자가 모두 읽고 업데이트할 수 있는 공유된 외부 노트북을 제공합니다. 이 노트북은 에이전트가 어디에 있는지, 다음에 무엇을 하기로 약속했는지, 그리고 앞으로 나아가기 위해 어떤 증거가 필요한지를 기록하는 내구성이 있는 기록 역할을 합니다. 실행 과정을 명확한 체크포인트가 있는 일련의 별개 단계로 취급함으로써, 시스템은 에이전트가 경로를 벗어나거나 작업을 미완성 상태로 남겨두지 않도록 보장합니다.
Ziheng Qin과 동료들이 이끄는 연구진은 이 아이디어를 테스트하기 위해 StateM이라는 경량 시스템을 구축했습니다. 그들은 인간이 터미널에 명령어를 입력하는 것과 유사하게, 명령줄을 통해 작동하는 표준 컴퓨터 에이전트와 함께 작동하도록 이를 설계했습니다. 이 발명품의 핵심은 '런북(runbook)'이라 불리는 단순하고 읽기 쉬운 문서입니다. 이 문서는 에이전트를 위한 지도이자 계약서 역할을 합니다. 이는 전체 작업을 계획, 구축, 점검, 인수인계와 같은 구체적인 단계 또는 상태로 나눕니다. 에이전트가 새로운 단계에 진입하면, 시스템은 지침을 새로 고치고 에이전트가 해당 단계를 떠나기 전에 반드시 완수해야 할 사항을 정확히 보여줍니다. 결정적으로, 에이전트는 단순히 단계를 완료했다고 선언할 수 없습니다. 반드시 검증 절차를 통과해야 합니다. 만약 에이전트가 단계를 건너뛰거나 검증에 실패하면, 시스템은 에이전트를 멈춰 세우고 다음 단계로 넘어가기 전에 오류를 수정하도록 강제합니다. 이를 통해 에이전트와 인간이 함께 작업을 검사하고, 결정을 감사하며, 규칙을 함께 업데이트할 수 있는 공유 공간이 만들어집니다.
이 접근 방식이 효과가 있는지 확인하기 위해, 연구팀은 Terminal-Bench라고 알려진 89개의 엄격하고 복잡한 컴퓨터 작업 세트로 테스트를 진행했습니다. 그들은 GPT-5.5라는 강력한 모델을 사용하여 새로운 시스템을 적용했습니다. 결과는 놀라웠습니다. 모델의 내부 코드를 변경하거나 새로운 데이터로 학습시키지 않고도, 시스템은 모델의 성공률을 83.1%에서 92.1%로 향상시켰습니다. 이 이득은 매우 유의미하여, 이 구형 모델과 더 최신 버전의 소프트웨어 사이의 격차를 사실상 메워주었습니다. 연구진은 동일한 규칙 세트, 즉 런북을 수정 없이 더 최신 모델인 GPT-5.6에 적용했습니다. 시스템은 더욱 뛰어난 성능을 보이며 수백 번의 실험을 통해 95.3%의 원시 정확도를 달고 달성했습니다. 또한 89개의 모든 작업을 적어도 한 번씩은 성공적으로 해결함으로써, 한 모델을 위해 개발된 규칙이 새로운 모델로 매끄럽게 전이될 수 있음을 입증했습니다.
연구진은 또한 더 저렴하고 다른 유형의 인공지능 모델을 통해서도 이러한 이점을 얻을 수 있는지 탐구했습니다. DeepSeek-V4 Flash라는 모델에 동일한 원칙을 적용했을 때, 초기 결과는 정확한 규칙이 완벽하게 맞지 않아 혼재된 양상을 보였습니다. 그러나 특정 관행을 이 새로운 모델에 맞추기 위해 38달러 미만의 적은 비용을 들인 결과, 성능을 82.7%에서 88.1%로 끌어올릴 수 있었습니다. 적응 및 최종 테스트를 포함하여 이 결과를 입증하는 데 든 총비용은 약 52달ler였습니다. 반면, 유사한 수준의 결과물을 내놓은 가장 비싼 공개 제출물은 거의 600달러에 달했습니다. 이는 더 나은 실행 시스템에 투자하는 것이 단순히 가장 강력한 모델을 구매하는 것보다 훨씬 더 비용 효율적일 수 있음을 시사합니다.
연구진은 또한 예산 승인이나 기계 작동과 같은 비즈니스 워크플로우가 포함된 다른 작업 세트에서도 시스템을 테스트했습니다. 여기서 결과는 규칙이 작업의 성격과 일치할 때 가장 잘 작동한다는 것을 보여주었습니다. 엄격한 규칙 준수와 명확한 인수인계가 필요한 작업의 경우, 시스템은 때때로 성공률을 두 배로 높이는 등 엄청난 개선을 보여주었습니다. 그러나 구조가 매우 다른 작업의 경우, 규칙이 너무 경직되어 있거나 프로세스의 잘못된 부분에 적용되면 시스템이 오히려 상황을 악화시키기도 했습니다. 이를 통해 연구진은 모든 가능한 상황에 대한 거대한 규칙 목록을 갖는 것이 아니라, 오류가 발생할 가능성이 가장 높은 특정 경계를 식별하고 그곳에만 체크를 강제하는 것이 핵심임을 배웠습니다.
궁극적으로, 이 연구는 인공지능의 신뢰성이 모델이 얼마나 똑똑한가만큼이나 우리가 그 업무를 어떻게 관리하느냐에 달려 있음을 시사합니다. 연구진은 유능한 에이전트가 실패하는 세 가지 주요 이유를 식별했습니다. 의사 결정 시점에 적절한 지식이 부족하거나, 이전 시도에서 배운 교훈을 잊어버리거나, 이미 알고 있는 절차를 따르지 못하는 것입니다. 그들의 시스템은 최신의 명확한 기록을 유지하고, 재사용 가능한 버전 관리 문서를 통해 교훈을 저장하며, 단계를 마쳤음을 증명하도록 강제함으로써 이러한 문제들을 해결합니다. 이 연구 결과는 복잡한 문제를 해결하기 위해 반드시 차세대 초지능 모델을 기다릴 필요는 없다는 것을 보여줍니다. 대신, 우리가 이미 보유한 모델을 안내할 더 나은 시스템을 구축함으로써, 유능하지만 신뢰할 수 없는 에이전트를 견고하게 일을 끝마치는 기계로 바꿀 수 있습니다. 앞으로 나아갈 길은 단순히 뇌를 크게 만드는 것이 아니라, 그 뇌를 이끌고 업무를 수행할 더 나은 몸을 만드는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.