← 최신 논문
💻 computer science

An Empirical Investigation of Multi-Trial Consistency, Trajectory Pathologies, and Reliability Rankings in Software Engineering Agents

본 논문은 자율 소프트웨어 엔지니어링 에이전트의 일관성, 신뢰성 및 궤적 병리 현상을 평가하기 위한 포괄적인 다중 시행 평가 프레임워크를 제안하며, 상당한 인프라 검열률을 드러내고 단일 시행 성공 지표를 넘어설 수 있는 토대를 구축하는 파일럿 연구를 통해 그 운영 가능성을 입증한다.

원저자: Muhammad Tayyab

게시일 2026-09-22
📖 5 분 읽기🧠 심층 분석

원저자: Muhammad Tayyab

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 소프트웨어 개발의 세계에서, 방대한 코드 라이브러리는 버그를 찾아내고 수정하기 위해 자동화된 도구에 의존하는 엔지니어 팀들에 의해 유지 관리됩니다. 최근에는 코드베이스를 읽고, 문제를 이해하며, 스스로 필요한 수정 사항을 작성하려고 시도할 수 있는 자율적인 조수 역할을 할 수 있는 새로운 세대의 인공지능이 등장했습니다. 이러한 시스템은 종종 거대 언어 모델(LLM)을 기반으로 하며, 통제된 테스트 환경에서 복잡한 코딩 작업을 해결할 수 있음을 보여주었습니다. 그러나 한 가지 결정적인 질문이 여전히 해결되지 않은 채 남아 있습니다. 이 디지털 작업자들을 매번 신뢰할 수 있는가 하는 점입니다. 소프트웨어 업데이트가 자동으로 배포되는 실제 환경에서, 동일한 일을 요청했을 때 한 번은 성공하지만 다음번에는 실패하는 조수는 혼란을 야기합니다. 이는 예측 불가능성을 도입하여, 인간 개발자가 작업 내용을 끊임없이 확인하게 만듦으로써 자동화의 목적을 무색하게 합니다. 핵심 과제는 단순히 AI가 문제를 해결할 수 있는지 여부가 아니라, 혼란에 빠지거나, 무작위 오류를 범하거나, 시스템을 망가뜨리는 방식으로 접근 방식을 바꾸지 않고 얼마나 일관되게 문제를 해결할 수 있는지에 있습니다.

파키스탄 라호르에 위치한 공학기술대학교의 한 연구자는, 단순히 AI가 단 한 번의 시도에서 얼마나 자주 정답을 맞히는지 세는 현재의 기준을 넘어, 이 신뢰성을 측정할 수 있는 새로운 방법을 제안했습니다. '단일 시행 통과율(single-trial pass rate)'로 알려진 현재의 방식은 AI를 마치 일회성 시험을 치르는 학생처럼 취급합니다. 즉, 학생이 다시 풀 수 있는지 여부와 상관없이 답이 맞으면 합격 처리하는 것입니다. 이 새로운 연구는 소프트웨어 공학에 있어 이러한 접근 방식이 불충분하다고 주장합니다. 대신, 연구자는 이 에이전트들이 동일한 문제에 대해 여러 번 테스트를 수행하며 일관성을 찾는 엄격한 프로토콜을 설계했습니다. 목표는 AI가 코드 저장소를 탐색하고, 버그를 찾아내며, 매번 요청받을 때마다 정확히 동일한 방식으로 이를 수정할 수 있는지, 아니면 반복되는 검증 속에서 성능이 무너지는지를 확인하는 것이었습니다.

이를 테스트하기 위해, 연구자는 인기 있는 오픈 소스 프로젝트에서 추출한 특정 실무 코딩 작업들을 포함하는 대규모 실험을 설정했습니다. 연구는 이 작업들을 다양한 AI 모델과 다양한 소프트웨어 프레임워크의 그리드에 걸쳐 실행하고, 전체적인 성능을 파악하기 위해 각 작업을 다섯 번씩 반복하도록 계획했습니다. 본격적인 실험을 실행하기 전, 연구자는 테스트 메커니니즘이 제대로 작동하는지 확인하기 위해 작은 규모의 '타당성 파일럿(feasibility pilot)'을 실시했습니다. 이 파일럿은 두 개의 특정 AI 모델과 두 개의 서로 다른 소프트웨어 스캐폴딩 시스템을 사용하여 30개의 서로 다른 코딩 문제에 대해 360번의 시도를 계획하는 과정을 포함했습니다. 그러나 360번의 시도 중 312번만이 성공적으로 완료되어 분석되었으며, 48번은 외부 요인에 의해 중단되었습니다. 연구자들은 AI가 취하는 모든 단계를 주의 깊게 추적하여, 성공 또는 실패 여부뿐만 아니라, AI가 몇 번이나 생각을 바꾸었는지, 컴퓨터 도구를 사용하는 과정에서 얼마나 자주 실수를 했는지, 그리고 테스트 인프라 자체가 얼마나 자주 고장 났는지까지 기록했습니다.

파일럿 연구 결과, 테스트 환경 자체가 매우 취약하다는 사실이 드러났습니다. 계획된 360번의 시도 중 48번이 클라우드 서비스 제공업체의 타임아웃이나 컴퓨터 컨테이너의 예기치 않은 리셋과 같은 외부 요인으로 인해 중단되었습니다. 이는 13.3%의 취소율을 기록했으며, 이러한 복잡한 테스트를 안정적으로 실행하는 것이 얼마나 어려운지를 보여주는 발견입니다. 더 중요한 것은, 파일럿 연구를 통해 현재의 테스트 예산(시간 제한)이 성공적인 수리를 만들어내기에는 너무 짧다는 점이 밝혀졌습니다. AI가 한 번의 시도당 단 5회의 대화나 행동으로 제한되었기 때문에, 완료된 312개의 에피소드 중 성공적인 수리로 이어진 사례는 단 하나도 없었습니다. 에이전트들은 제한된 시간을 단순히 코드를 탐색하고 문제를 이해하는 데에만 모두 소비했으며, 해결책을 적용할 단계에 전혀 도달하지 못했습니다.

이 짧은 파일럿 단계에서의 성공적인 수리 사례 부재에도 불구하고, 본 연구는 에이전트들의 행동에 대한 상세한 데이터를 수집하는 것이 가능하다는 것을 성공적으로 입증했습니다. 연구자들은 AI가 컴퓨터 시스템과 상호작용할 때 발생하는 구체적인 오류 유형을 식별해냈습니다. 예를 들어, 컴퓨터가 이해할 수 없는 명령어를 생성하거나 존재하지 않는 파일에 접근하려는 시도 등이 있습니다. 또한, 그들은 AI가 최종 답변에 도달하기 전 자신의 작업물을 얼마나 많이 변경하는지를 추적하는 '코드 churn(code churn)'을 측정하는 새로운 방법도 개발했습니다. 높은 수준의 churn은 에이전트가 결단력이 없거나 불안정하여, 명확한 계획 없이 코드를 계속해서 다시 쓰고 있음을 시사합니다. 아울러 연구는 '도구 실패(tool failure)' 지표를 도입하여, AI의 추론 능력 부족으로 인한 오류와 컴퓨터 시스템의 충돌로 인한 오류를 구분했습니다.

논문은 이러한 AI 에이전트들이 유망함을 보여주기는 하지만, 현재의 평가 방식은 불완전하다고 결론짓습니다. 단일 시도에만 집중함으로써, 산업계는 이러한 도구들을 실무에서 신뢰할 수 없게 만드는 '플래키니스(flakiness, 일관성 없는 동작)'를 놓치고 있습니다. 연구자는 진정으로 신뢰할 수 있는 에이전트라면 단순히 한 번 운 좋게 맞히는 것이 아니라, 여러 차례의 시행을 통해 문제를 일관되게 해결할 수 있어야 한다고 주장합니다. 파일럿 연구는 이러한 일관성을 측정하기 위한 필요한 도구들이 존재하며, 비록 현재의 AI 모델들이 아직 전체 테스트를 통과할 준비가 되지 않았을지라도 인프라가 데이터 수집을 감당할 수 있음을 증명했습니다. 연구 결과는 향후의 평가가 단순한 합격/불합격 점수를 넘어, AI의 여정에 대한 상세한 로그를 수집하고, 얼마나 자주 비틀거리는지, 얼마나 자주 망설이는지, 그리고 외부 중단으로 인해 작업을 완료하지 못하는 경우가 얼마나 빈번한지를 측정해야 함을 시사합니다.

이 연구의 궁극적인 목표는 자동화된 소프트웨어 공학에 대한 신뢰의 새로운 표준을 확립하는 것입니다. 인간 직원이 일관성이 없고 신뢰할 수 없을 경우 해고되는 것과 마찬가지로, AI 조수 또한 안정적으로 업무를 수행할 수 있음을 증명해야 합니다. 이 연구는 현재의 AI 모델이 자동 수리 문제를 해결했다고 주장하는 것이 아닙니다. 실제로 파일лот 데이터는 엄격한 조건 하에서 성공적인 수리가 0건이었음을 보여주었습니다. 대신, 이 연구는 향-후 이러한 시스템을 적절히 테스트하기 위한 청사진을 제공합니다. 일관성을 위한 새로운 지표를 정의하고 실패를 유발하는 구체적인 병리학적 현상을 추적함으로써, 연구자는 인공지능의 소프트웨어 개발 분야에 대한 더욱 정직하고 엄격한 평가를 위한 토대를 마련했습니다. 앞으로의 과제는 더 긴 시간 제한과 더 강력한 모델을 사용하여 전체 규모의 실험을 실행함으로써, 일관성이 개선되는지, 아니면 에이전트들이 오류를 범하는 방식이 더 정교해질 뿐인지를 확인하는 것입니다. 그때까지 산업계는 단 한 번의 성공적인 수정이 복잡한 소프트웨어 유지보수의 세계에서 안전과 신뢰성을 보장하기에는 충분하지 않다는 점을 인식해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →