← 최신 논문
🤖 AI

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

본 논문은 이진 테스트 결과에만 의존하는 방식이 해결책의 품질 차이를 은폐한다는 점을 보여줌으로써 SWE-agent 평가에서 '운 좋은 통과' 현상의 보편성을 드러내는 프레임워크인 AgentLens 를 소개하고, 모델 성능을 더 정확하게 순위 매기기 위해 작업 수준 접두사 트리 수용자 참조를 활용한 프로세스 수준 평가 방법을 제안한다.

원저자: Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자동차 수리를 위해 정비사를 고용한다고 상상해 보세요. 현재 AI 소프트웨어 엔지니어 (SWE 에이전트) 를 평가하는 방식은 매우 단순합니다. 고장 난 차를 건네면, 그들은 고쳐진 차를 가져오고, 시동이 걸리는지 확인합니다. 시동이 걸리면 금색 별을 주고, 걸리지 않으면 빨간 X 를 줍니다.

이는 '합격/불합격' 시스템입니다. 이 논문에 따르면, 문제점은 이 시스템이 두 가지 매우 다른 정비사를 정확히 동일하게 대우한다는 것입니다:

  1. 마스터 정비사: 문제를 빠르게 진단하고, 올바른 부품을 주문하며, 효율적으로 수리하고, 작업을 이중으로 확인합니다.
  2. 운 좋은 도박사: 50 개의 무작위 부품을 시도하고, 맹목적으로 교체하며, 그 과정에서 몇 가지 다른 것들을 고장 내고, 좌절하다가 결국—순전히 운 좋게—올바른 부품을 끼웁니다. 그리고 차가 시동이 걸립니다.

구식 시스템 하에서는 둘 다 금색 별을 받습니다. 하지만 이 논문은 이것이 실수라고 주장합니다. '운 좋은 도박사'는 실제로 나쁜 채용입니다. 그들의 과정은 혼란스럽고, 낭비적이며, 예측 불가능하기 때문입니다.

문제: '운 좋은 합격'

연구진들은 AI 에이전트들이 실제 소프트웨어 버그를 수정하려는 2,600 회 이상의 시도를 분석했습니다. 그들은 '성공적인' 수정 중 **10.7%**가 실제로는 '운 좋은 합격'이었다는 사실을 발견했습니다.

이 에이전트들은 논리적으로 문제를 해결하지 않았습니다. 대신 그들은 다음과 같은 행동을 했습니다:

  • 맹목적인 재시도: 노래가 제대로 들릴 때까지 피아노를 두드리는 아이처럼.
  • 확인 누락: 코드를 수정했지만 실제로 작동하는지 테스트를 실행하지 않았습니다.
  • 시간 낭비: 정답에 우연히 도달하기 전에 잘못된 파일을 탐색하거나 빙빙 돌았습니다.

해결책: AGENTLENS ('프로세스 카메라')

이를 해결하기 위해 팀은 AGENTLENS라는 새로운 도구를 개발했습니다. 이는 완성된 차만 바라보는 것이 아니라, 전체 수리 과정을 슬로우 모션으로 기록하는 고화질 카메라라고 생각하세요.

AGENTLENS 는 두 가지 주요 작업을 수행합니다:

1. '좋은 해결책의 지도' (PTA)
AI 의 작업을 단순히 하나의 '완벽한' 예시와 비교하는 대신, AGENTLENS 는 **접두어 트리 수용기 (Prefix Tree Acceptor, PTA)**를 구축합니다.

  • 비유: 트렁크가 작업 시작을 나타내는 나무를 상상해 보세요. 가지들은 차를 고르는 다양한 유효한 방법을 나타냅니다. 일부 가지는 엔진실을 통과하고, 다른 가지는 트렁크를 통과합니다.
  • AI 가 나무 위에 존재하는 경로를 따른다면, 그것은 현명한 행동입니다. 나무에서 벗어나 숲으로 헤매는다면 시간을 낭비하는 것입니다.

2. '의도 번역기'
이 도구는 AI 가 무엇을 하고 있는지 관찰하며 각 단계를 '생각'으로 레이블링합니다:

  • 탐색: "문제를 찾고 있습니다."
  • 구현: "부품을 고치고 있습니다."
  • 검증: "작동하는지 확인하고 있습니다."
  • 조정: "생각을 정리하고 있습니다."

AI 가 코드를 작성하기 전에 테스트를 실행하면, 이 도구는 이를 혼란으로 표시합니다. 코드를 수정했지만 테스트를 실행하지 않으면 위험한 것으로 표시합니다.

그들이 발견한 것

이 새로운 '프로세스 카메라'를 데이터에 적용했을 때, 결과는 놀라웠습니다:

  • 모든 승자가 같은 것은 아님: 그들은 성공적인 수정을 세 그룹으로 나누었습니다:
    • 이상적 (20%): 깔끔하고, 논리적이며, 효율적입니다.
    • 견고 (69%): 좋지만, 약간 지저분할 수 있습니다.
    • 운 좋은 (10.7%): '도박사' 그룹입니다. 그들은 올바른 답을 얻었지만, 혼란을 통해 얻었습니다.
  • 순위 변경: 그들이 문제 해결 방법 (단순히 해결했는지 여부가 아닌) 에 따라 AI 모델을 순위 매겼을 때, 리더보드가 뒤집혔습니다.
    • 한 모델 (GPT-4o) 은 성공했을 때 매우 깔끔하게 수행했기 때문에 8 위에서 3 위로 뛰어올랐습니다.
    • 다른 모델 (Opus 4.6) 은 1 위에서 6 위로 떨어졌습니다. 높은 성공률을 보였지만, 그 승자들 중 많은 부분이 낭비된 노력으로 가득 찬 '운 좋은 합격'들이었습니다.
  • 운의 비용: '운 좋은' 에이전트들은 놀라울 정도로 비쌌습니다. 일부는 동일한 결과를 얻기 위해 효율적인 에이전트보다 최대 **40 배 더 많은 컴퓨팅 파워 (토큰)**를 낭비했습니다. 너트 크래커 사용법을 모른다고 너트를 깨기 위해 망치를 사용하는 것과 같습니다.

'운 좋은' 다섯 가지 유형

이 논문은 또한 에이전트들이 정확히 어떻게 운을 얻었는지를 분류했습니다:

  1. 과신자: 고쳤지만 작동하는지 확인하지 않았습니다.
  2. 무차별 공격자: 하나가 작동할 때까지 무작위 시도를 계속했습니다.
  3. 반쪽짜리: 문제의 일부만 고쳤지만, 나머지 부분을 잡아내기에 테스트가 충분히 엄격하지 않았습니다.
  4. 방황자: 탐색에 길을 잃고 결코 집중하지 못했습니다.
  5. 창의적 천재: '지도'가 예상하지 못한 완전히 다른 유효한 해결책을 찾았습니다 (이것이 유일한 '좋은' 유형의 운입니다).

결론

이 논문은 우리가 AI 에게 단순히 "고쳤나요?"라고 묻는 것만으로는 안 된다고 결론 내립니다. 우리는 "올바른 방법으로 고쳤나요?"라고 물어야 합니다.

AGENTLENS를 사용하면 운이 좋거나 낭비적인 AI 모델에게 보상을 주는 것을 멈출 수 있습니다. 대신, 우리는 그들을 마스터 정비사처럼 훈련시킬 수 있습니다: 효율적이고, 논리적이며, 신뢰할 수 있는 것입니다. 연구진들은 다른 사람들이 이 '프로세스 카메라'를 사용하여 AI 엔지니어를 더 잘 평가할 수 있도록 도구와 데이터를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →