← 최신 논문
🤖 AI

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

이 논문은 외부 판사나 정답 문자열 매칭 없이도 SWE-bench Verified에서 개선된 해결률을 달라는 Risa를 소개하는데, 이는 네이티브 MoE 라우터 트레이스를 활용하여 다양한 탐색을 유도하고 주요 결정 지점에서의 합의를 통해 최종 솔루션을 선택함으로써 소프트웨어 에이전트를 위한 테스트 타임 스케일링 방법을 제시한다.

원저자: Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 소프트웨어 엔지니어처럼 행동하도록 설계된 새로운 부류의 프로그램들이 등장하고 있습니다. 이 에이전트들은 단순히 질문에 답하는 것에 그치지 않고, 복잡한 디지털 환경을 탐색하고, 코드를 읽고, 테스트를 실행하며, 고장 난 소프트웨어를 수리하기 위해 수정 사항을 작성합니다. 어려운 문제를 해결하기 위해 에이전트는 솔루션을 찾을 때까지 다양한 도구와 명령어를 시도하며 긴 의사결정의 사슬을 거쳐야 하는 경우가 많습니다. 이러한 작업은 매우 복잡하기 때문에, 연구자들은 에이전트에게 더 많은 컴퓨팅 파워를 부여하여 한 번에 여러 가지 경로를 시도하게 하는 것이 종종 더 나은 결과를 가져온다는 것을 발견했습니다. 하지만 에이전트가 많은 경로를 시도할 때 새로운 문제가 발생합니다. 바로 수많은 후보 중에서 단 하나의 최선의 솔루션을 어떻게 선택하느냐는 것입니다. 정답이 하나로 명확한 단순한 수학 문제와 달리, 소프트웨어 수정안은 다양한 모습으로 나타날 수 있어, 실제 시스템에서 직접 실행해 보지 않고서는 어떤 버전이 진정으로 최선인지 판단하기 어렵습니다. 이는 느리고 비용이 많이 드는 작업입니다.

푸단 대학교와 상하이 혁신 연구소의 연구진은 최종 출력물을 기다리는 대신 AI 자체의 내부적 '사고 과정'에 귀를 기울임으로써 이 선택 문제를 해결하는 새로운 방법을 개발했습니다. 그들은 '희소 전문가 혼합(sparse mixture-of-experts)'이라고 알려진 특정 유형의 AI 아키텍처에 주목했습니다. 이 모델들에서는 AI가 단어를 생성할 때마다 작은 내부 라우터가 어떤 특화된 하위 네트워크, 즉 '전문가(experts)'가 작업을 수행할지 결정합니다. 이 라우터는 어떤 전문가가 선택되었고 얼마나 기여했는지에 대한 기록인 흔적을 남깁니다. 연구진은 이 흔적이 AI의 행동을 나타내는 고유한 지문 역할을 한다는 점을 깨달았습니다. 두 가지 솔루션이 겉보기에는 완전히 달라 보일지라도, 그 솔루션을 만들어내기 위해 AI가 거친 내부 경로는 그것이 새로운 영역을 탐색하고 있는 것인지, 아니면 견고한 정답으로 수렴하고 있는 것인지를 드러내 줄 수 있습니다.

연구진은 이러한 내부 지문을 사용하여 에이전트의 여정을 안내하는 '리사(Risa)'라는 시스템을 구축했습니다. 에이전트가 문제를 해결하는 초기 단계에 있을 때, 리사는 에이전트가 계속해서 탐색하도록 독려합니다. 이를 위해 시스템은 에이전트의 최근 이력을 확인하며, 만약 AI가 방금 했던 것과 너무 유사한 단계를 밟으려 한다면 더 새롭고 차별화된 행동을 하도록 유도합니다. 이는 에이전트가 똑같은 실수를 반복하는 루프에 빠지는 것을 방지합니다. 그러나 에이전트가 코드 수정 패치(patch)를 작성하기 시작하면 전략이 바뀝니다. 이 단계에서 시스템은 여러 후보 사이의 일치성을 찾습니다. 서로 다른 지점에서 시작한 여러 시도가 모두 수정안에 대해 유사한 내부 구조에 도달한다면, 시스템은 이를 솔루션이 올바르다는 강력한 신호로 간 만큼 취급합니다.

이 아이디어를 테스트하기 위해 연구진은 수백 개의 실제 소프트웨어 수리 과제를 포함하고 있는 표준 벤치마크인 'SWE-bench Verified'를 사용하여 실험을 진행했습니다. 그들은 여러 가지 AI 모델을 사용하고 각 과제를 여러 번 시도하게 했습니다. 한 세트의 테스트에서, 그들은 라우팅 가이드 방식과 최종 선택을 무작위로 하는 단순한 방식을 비교했습니다. 결과는 명확한 개선을 보여주었습니다. 라우팅 시스템을 사용했을 때, 에이전트가 소프트웨어를 성공적으로 수리하는 비율이 약 45%에서 48% 이상으로 상승했습니다. 이는 수치상으로는 작아 보일 수 있지만, 모든 퍼센트 포인트가 상당한 진전을 의미하는 자동 소프트웨어 수리 분야에서는 유의미한 성과입니다. 이 시스템은 실제 솔루션의 텍스트를 비교하거나 별도의 판독기를 사용하여 정답을 검증할 필요 없이, 텍스트 기반의 비교 방식과 맞먹는 성능을 보여주었습니다.

또한 연구는 가장 유용한 정보가 AI 출력의 전체 이력이 아니라 특정 결정의 순간에 있다는 것을 밝혀냈습니다. AI가 코드 한 줄을 쓰는 데 있어 몇 가지 그럴듯한 방법들 사이에서 선택을 해야 할 때, 그 구체적인 선택들이 내부 라우팅 흔적에 뚜렷한 자국을 남겼습니다. 이러한 결정적인 결정 지점에만 집중함으로써, 시스템은 운 좋은 추측과 논리적인 솔루션을 구분할 수 있었습니다. 이 접근 방식은 다양한 유형의 AI 모델에서 작동하였으며, 이는 내부 라우팅 흔적이 복잡한 과제를 조율하는 데 사용할 수 있는 신뢰할 수 있는 신호임을 시사합니다. 연구진은 우리가 AI가 말하는 내용뿐만 아니라 AI가 내부 자원을 어떻게 할당하는지에 주목함으로써, 더 잘 탐색하고, 솔루션을 확정할 때 더 일관되며, 궁극적으로 어려운 문제를 해결하는 데 더 성공적인 에이전트를 구축할 수 있다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →