← 최신 논문
🤖 machine learning

SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions

이 논문은 현실적이고 다회차의 사용자 주도적 소프트웨어 엔지니어링 과제를 통해 코딩 에이전트를 평가하는 새로운 벤치마크인 SWE-Interact를 소개하며, 기존의 단일 회차 벤치마크에서의 강력한 성능이 효과적인 실제 개발에 필요한 상호작용적이고 반복적인 워크플로우로 반드시 신뢰성 있게 이어지지는 않는다는 점을 밝히고 있습니다.

원저자: Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

게시일 2026-06-30
📖 2 분 읽기☕ 가벼운 읽기

원저자: Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 경험은 부족한 건축가를 고용하여 집을 짓게 한다고 상상해 보십시오.

과거의 방식 (전통적인 벤치마크)
과거에 연구자들은 이 AI "건축가"들을 테스트하기 위해 첫날부터 완벽한 50페이지 분량의 설계도를 건네주었습니다. 그 설계도에는 나무의 종류, 페인트의 정확한 색조, 모든 콘센트의 배치, 그리고 수도꼭지의 브랜드까지 모든 세부 사항이 적혀 있었습니다. AI의 역할은 단순히 그 계획을 읽고 집을 완벽하게 짓는 것이었습니다.

  • 문제점: 이는 실제 건설 현장이 어떻게 돌아가는지를 반영하지 못합니다. 현실 세계에서 고객들은 완벽한 설계도를 준비해 두는 경우가 드뭅니다. 대개 그들은 "아늑한 집과 큰 주방을 원해요"라고 말한 뒤, 공사 진행 상황을 보면서 마음을 바꾸곤 합니다.

새로운 방식 (SWE-INTERACT)
이 논문은 실제 건설 프로젝트를 시뮬레이션하는 새로운 테스트인 SWE-INTERACT를 소개합니다.

  • 설정: 완벽한 설계도 대신, AI는 "집을 지어줘"라는 모호한 요청과 함께 시작합니다.
  • 고객 (시뮬레이터): 한 컴퓨터 프로그램이 "고객" 역할을 합니다. 이 프로그램은 가만히 앉아 있지 않습니다. 능동적으로 건설 현장을 돌아다닙니다.
    • 기초 공사를 보더니 말합니다. "아, 제가 지하실을 원한다는 걸 깜빡했네요."
    • 주방을 보더니 말합니다. "사실, 가스레인지는 여기가 아니라 저기에 있었으면 좋겠어요."
    • 배선을 확인하더니 말합니다. "잠깐, 콘센트가 더 필요해요."
  • 목표: AI는 이러한 변화무쌍한 의견들을 경청하고, 실수를 바로잡으며, 고객이 계속해서 새로운 요구사항을 추가하는 동안 집을 조각조각 완성해 나가면서 고객이 실제로 무엇을 원하는지 파악해야 합니다.

중요한 발견
연구진은 세계에서 가장 똑똑한 AI 코딩 모델들을 두 가지 시나리오 모두에서 테스트했습니다. 결과는 다음과 같습니다.

  1. 읽기는 잘하지만 듣기는 서툴다: 완벽한 설계도로 집을 짓는 데 뛰어났던 모델들(Single-Turn 테스트)은 고객이 마음을 바꿀 때마다 성능이 크게 떨어졌습니다. 성공률이 약 **50%**에서 **25%**로 급감했습니다.
  2. "과잉 확신"의 실수: 가장 뛰어난 모델들(GPT-5.5 및 Opus 4.8 등)은 모호한 지시에도 불구하고 용기 있게 건축을 시작했습니다. 이들은 고객이 수정 사항을 알려줄 때 이를 복구하고 고칠 수 있었습니다. 하지만 너무 똑똑하게 굴려다 보니 이전의 지시 사항을 잊어버리거나 기술적인 오류를 범하기도 했습니다.
  3. "포기"의 실수: 성능이 낮은 모델들은 모호한 시작 단계에서 혼란을 느껴 너무 일찍 포기하거나, 고객의 새로운 지시 사항을 완전히 무시해 버렸습니다.

이것이 왜 중요한가
이것은 비디오 게임과 같습니다. 예전의 테스트가 적이 어디에 있고 보스가 어떻게 생겼는지 정확히 알고 있는 레벨이었다면, 새로운 테스트는 "게임 마스터"(고객)가 플레이 도중에 스토리를 바꾸는 라이브 액션 롤플레잉 게임(LARP)과 같습니다.

이 논문은 훌륭한 코더가 된다는 것이 단지 코드를 작성하는 법(설계도)을 아는 것뿐만 아니라, 자신이 무엇을 원하는지 알지 못하는 사람과 협력할 수 있는 인내심과 기술을 갖추는 것임을 결론짓습니다. 현재의 AI 모델들은 이 부분에서 발전하고 있지만, 실제 세계의 복잡하고 협력적인 환경에서 인간 개발자를 진정으로 대체하기까지는 아직 갈 길이 멉니다.

요약하자면: 이 논문은 AI 코더들이 단순히 명령을 따르는 것을 넘어, 진행 과정에서 생각을 정리해 나가는 인간과 실제로 협업할 수 있도록 훈련하는 새로운 "체육관"을 만든 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →