Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First
SuperScout는 저장소를 탐색하여 검증되고 구조화된 핸드오프를 생성하는 경량 "검색자(searcher)" 에이전트를 배포함으로써, 라우터가 최상위 모델의 성능을 유지하면서도 해결당 비용을 약 5분의 1 수준으로 낮추어 소프트웨어 복구 작업을 할당할 수 있게 하는 비용 효율적인 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 고장 난 소프트웨어를 고칠 수 있는 코드를 작성할 수 있지만, 그 비용이 엄청나게 비싼 세상을 상상해 보세요. 이 "AI 코더"들을 마치 엘리트 탐정 팀처럼 생각해보십시오. 어떤 이들은 거의 모든 미스터리를 해결할 수 있는 슈퍼스타이지만 시간당 엄청난 비용을 요구합니다. 또 다른 이들은 저렴한 가격에 고용할 수 있는 똑똑하고 유능한 탐정이지만, 까다로운 단서는 놓칠 수도 있습니다. 오랫동안 이 분야의 큰 질문은 이것이었습니다: "특정 사건에 대해 어떤 탐정을 고용할지 어떻게 알 수 있을까?" 대부분의 사람들은 단순히 문제의 설명(즉, "이슈 텍스트")을 읽고, 저렴한 탐사로 충분할지 아니면 비싼 슈퍼스타를 불러야 할지를 예측하려고 노력했습니다.
하지만 여기 함정이 있습니다. 문제 설명을 읽는 것은 범죄 현장을 직접 방문하지 않고 오직 경찰 보고서만 보고 범죄를 해결하려는 것과 같습니다. 여러분이 읽게 될 이 논문은 더 똑똑한 아이디어를 탐구합니다. 만약 우리가 먼저 작고 저렴한 정찰병을 범죄 현장으로 보낸다면 어떨까요? 이 정찰병은 전체 미스터리를 해결하려고 애쓰는 것이 아니라, 그저 주변을 살피고, 고장 난 부분을 찾아내며, 검증된 빠른 보고서를 작성합니다. 그런 다음 매니저가 그 보고서를 사용하여 어떤 탐정을 고용할지 결정합니다. "스카우팅(scrouting)"이라고 불리는 이 접근 방식은 문제의 제목을 보고 추측하는 것보다 문제의 *맥락(context)*을 아는 것이 훨씬 더 가치 있다는 점을 시사합니다.
SuperScout 이야기: 먼저 정찰하는 탐정
비용을 낭비하지 않고 소프트웨어 버그를 수정하도록 설계된 새로운 시스템인 SuperScout를 만나보십시오. 이 시스템을 만든 팀은 기존의 AI 코더 고용 방식이 비효율적이라는 것을 깨달았습니다. 보통 라우터(의사 결정자)는 버그 보고서를 보고 즉시 모델을 선택합니다. 하지만 저자들은 놀라운 사실을 발견했습니다. 과거의 소프트웨어 수정 결과를 살펴보면, "슈퍼스타" 모델은 저렴한 모델이 해결할 수 있는 거의 모든 것을 해결할 뿐만 아니라 몇 가지 더 많은 문제를 해결한다는 것입니다. 이는 정확도(최대한 많은 문제를 해결하기 위해 완벽한 모델을 선택하는 것)를 위해 라우팅하는 것이 막다른 길임을 의미합니다. 왜냐하면 단순히 가장 비싼 모델을 항상 고용하는 것보다 더 나은 결과를 낼 수 없기 때문입니다.
그래서 팀은 발상을 전환했습니다. 완벽해지려고 노력하는 대신, 그들은 **비용 효율성(cost-aware)**을 고려하기로 했습니다. 그들의 목표는 더 많은 문제를 해결하는 것이 아니라, 아주 적은 비용으로 동일한 수의 문제를 해결하는 것이었습니다.
3막극: 정찰, 검증, 그리고 파견
SuperScout 시스템은 3단계 조립 라인처럼 작동합니다:
- 정찰병 (SuperScout-7B): 먼저, 작은 70억 파라미터 규모의 AI 모델(생각해 보면 주니어 인턴과 같습니다)이 소프트웨어 저장소로 파견됩니다. 이 모델의 임役은 버그를 고치는 것이 아니라, 코드를 탐색하고, 관련된 특정 파일들을 찾아내며, 버그가 존재함을 증명하는 테스트 케이스를 작성하는 것입니다. 이 모델은 "핸드오프(handoff)"를 생성합니다. 이는 용의 파일, 재현 테스트, 그리고 탐정의 메모가 포함된 구조화된 노트입니다.
- 보안 게이트 (Verify-then-Strip): 여기서 마법 같은 기술이 등장합니다. 인턴의 메모를 맹목적으로 신뢰하지 않습니다. 메인 탐정이 보기 전에, "샌드박스"(안전하고 격리된 테스트실)에서 인턴의 재현 테스트를 실제로 실행합니다. 만약 테스트가 실제로 코드를 깨뜨리지 못한다면(즉, 인턴이 환각을 일으켰거나 틀렸다면), 해당 주장은 삭제되어 버려집니다. 오직 검증된 사실만이 다음 단계로 넘어갑니다.
- 이력서 라우터 (Résumé Router): 마지막으로, 매니저는 작업 내용과 인턴의 "숨겨진 생각"(스카우트 모델의 내부 데이터 상태)을 보고 어떤 "해결사(fixer)"를 고용할지 결정합니다. 해결사 풀에는 저렴한 모델부터 비싼 모델까지 네 가지 서로 다른 프런티어 AI 모델이 포함됩니다. 라우터는 작업을 처리할 수 있다고 판단되는 가장 저렴한 모델을 선택합니다. 만약 인턴이 아무것도 찾아내지 못했다면, 해결사는 원래의 버그 보고서만을 가지고 작업합니다.
대반전: 핸드오프가 핵심적인 역할을 하다
연구진이 266개의 실제 Python 소프트웨어 버그(SWE-bench Pro라고 불리는 거대한 도전 과제)에 대해 SuperScout를 테스트했을 때, 결과는 충격적이었습니다.
- 점수: SuperScout는 266개 중 159개의 작업을 해결했습니다.
- 경쟁 상대: 단일 최강의 가장 비싼 모델(Claude Opus 4.6)은 266개 중 158개를 해결했습니다.
- 비용: SuperScout는 이 결과를 해결당 약 1.27이 들었습니다. 이는 대략 5분의 1 가격입니다!
그러나 가장 흥러운 발견은 라우터의 의사 결정에 관한 것이 아니었습니다. 연구진이 라우터를 완전히 제거하고, 인턴의 검증된 핸드오프와 함께 모든 작업을 가장 저렴한 모델(Kimi K2.5)로 보냈을 때, 이 모델은 159개의 작업을 해결했습니다—이는 전체 SuperScout 시스템과 동일한 숫자입니다.
이는 **검증된 핸드오프(verified handoff)**가 진정한 영웅이라는 점을 시사합니다. 저장소를 정찰하고 검증된 보고서를 제공하는 행위가 저렴한 모델의 성능을 끌어올려, 그들이 비싼 모델들과 대등한 수준에 도달하게 만들었습니다. 라우팅 결정 자체가 마법 같은 효과를 더한 것은 아니었습니다. 라우팅은 단지 저렴한 모델들이 핸드오프를 받도록 보장했을 뿐입니다.
이것이 왜 중요한가 (그리고 무엇이 아닌가)
논문은 몇 가지 사항을 명시적으로 배제합니다:
- 정확도를 위한 라우팅은 실패입니다: 문제 텍스트만 기반으로 모델을 교체한다고 해서 해결 가능한 작업의 수를 개선할 수는 없습니다. 가장 좋은 모델이 결국 승리하기 때문입니다.
- 핸드오프 텍스트는 라우터를 위한 것이 아닙니다: 흥미롭게도, 인턴의 보고서 텍스트를 라우터에게 입력하는 것은 오히려 성능을 악화시켰습니다. 라우터는 작성된 노트보다는 스카우트의 "숨겨진 상태"(내부 뇌 활동)를 사용할 때 더 잘 작동합니다. 노트는 해결사를 위한 것이지 매니저를 위한 것이 아닙니다.
- 모든 것에 통하는 마법의 탄환은 아닙니다: 이 시스템은 특정 266개 Python 작업에 대해 테스트되었습니다. 스카우트 모델이 학습하지 않은 언어에서도 작동할 수 있음을 보여주었지만, 다른 벤치마크에 대한 전체 시스템의 성능은 아직 테스트되지 않았습니다.
저자들은 이것이 영원히 해결된 문제라고 말하는 것이 아님을 주의 깊게 밝히고 있습니다. 결과는 이 특정 작업 세트와 현재 모델들에 국한됩니다. 그러나 메커니즘은 견고합니다. 해결사를 고용하기 전에 사실을 검증하기 위해 작은 스카우트를 보내면, 해결 능력을 재분배할 수 있습니다. 핸드오프는 저렴한 모델들을 끌어올려 그들을 비싼 모델들만큼이나 강력하게 만들며, 이 과정에서 스카우트 비용은 무시할 수 있는 수준(작업당 1센트 미만)입니다.
요컨대, SuperScout는 우리에게 **맥락이 왕(Context is King)**이라는 교훈을 줍니다. 직업 설명만 보고 누구를 고용할지 추측하지 마십시오. 먼저 현장으로 정찰병을 보내 사실을 검증한 다음, 가장 역량 있는 저렴한 작업자가 일을 하도록 하십시오. 이는 더 똑똑하고 저렴하게 소프트웨어를 구축하는 방법이며, 때로는 먼저 약간의 숙제를 하는 것이 돈을 아끼는 가장 좋은 방법임을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.