The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation
이 논문은 평가 하네스가 코딩 에이전트의 성능과 효율성에 모델 선택보다 더 크게 영향을 미친다는 점을 입증하며, 최대 40배의 토큰 사용량 차이와 모델과 무관한 실패 패턴을 밝힘으로써 모델 비교와 함께 전체 하네스 사양 및 토큰/지연 시간 지표를 보고할 것을 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇 코더 뒤에 숨겨진 보이지 않는 손
당신이 요리 경연 대회를 보고 있다고 상상해 보세요. 두 명의 뛰어난 셰프, 셰프 A와 셰프 B가 완벽한 초콜릿 케이크를 만들기 위해 경쟁하고 있습니다. 심사위원들은 보통 완성된 케이크만 보고 "셰프 A가 더 나은 케이크를 만들었군요!"라고 말합니다. 하지만 만약 심사위원들이 셰프 A는 모든 재료를 미리 다 썰어두고 오븐을 정확한 시간에 맞춰 예열해 주는 최첨식 자동화 주방을 사용한 반면, 셰프 B는 녹슨 칼과 고장 난 가스레인지가 있는 먼지 쌓인 창고에서 작업했다는 사실을 언급하는 것을 잊었다면 어떨까요? 그 결과는 단순히 셰프의 재능 때문만이 아니라, 그들에게 주어진 '주방' 때문일 수도 있습니다.
인공지능의 세계, 특히 "코딩 에이전트"(소프트웨어를 작성하는 AI 프로그램)의 세계에서 우리는 정확히 그와 같은 일을 해왔습니다. 우리는 AI 모델이 얼마나 많은 코딩 문제를 해결하는지를 기준으로 순위를 매겨왔지만, 그들이 일하는 '주방'은 무시해 왔습니다. 이 주방은 **하네스(harness)**라고 불립니다. 하네스를 AI에게 도구를 건네주고, 메모리를 관리하며, 언제 작업을 멈출지 결정하는 보이지 않는 조수라고 생각하세요. 어떤 하네스는 모든 것을 완벽하게 정리해 주는 초효율적인 로봇 집사 같지만, 다른 어떤 하네스는 계속해서 같은 질문을 반복하며 시간과 에너지를 낭비하는 혼란스러운 인턴 같습니다. 연구자들이 던지는 핵심 질문은 이것입니다. AI의 두뇌가 더 중요한가, 아니면 그 조수의 품질이 더 중요한가?
위대한 "주방" 실험
한 연구팀은 추측을 멈추고 측정을 시작하기로 했습니다. 그들은 "셰프"(AI 모델)는 똑같이 유지하면서 "주방"(하네스)을 교체했을 때 어떤 일이 일어나는지 확인하기 위해 거대한 실험을 설계했습니다. 그들은 매우 똑똑한 두 가지 AI 코딩 모델인 Qwen 3.6 Plus와 MiniMax M2.5를 선정하여 50가지의 서로 다른 코딩 퍼즐을 풀게 했습니다. 하지만 여기 반전이 있습니다. 그들은 이 동일한 모델들을 Goose, OpenCode, OpenHands-SDK라는 이름의 세 가지 오픈 소스 하네스를 통해 실행했습니다.
결과는 정말 충격적이었습니다.
연구자들이 AI가 퍼즐을 해결한 횟수(성공률, pass rate)를 살펴보았을 때, 하네스 간의 차이는 미미했습니다. AI가 Goose, OpenCode, 또는 OpenHands-SDK 중 무엇을 사용하든, 대략 38%에서 50% 사이의 비슷한 문제 해결 수를 보였습니다. 하네스를 바꾼다고 해서 AI가 갑자기 천재가 되거나 실패자가 되지는 않았습니다. 성공률은 대체로 평탄했습니다.
하지만 문제를 해결하는 데 드는 비용을 살펴보았을 때, 이야기는 완전히 달라졌습니다. 연구자들은 이를 "토큰(tokens)" 단위로 측정했는데, 토큰은 AI가 처리하는 데이터의 기본 단위(단어나 코드 조각 등)입니다. 그들은 하네스의 선택이 비용을 무려 40배나 변화시킨다는 것을 발견했습니다.
이를 체감할 수 있게 설명하자면, 만약 Goose 하네스가 AI가 약 28,000 토큰을 사용하여 퍼즐을 풀도록 도왔다면, OpenCode 하네스는 정확히 똑같은 AI가 동일한 퍼즐을 푸는 데 110만 개 이상의 토큰을 사용하게 만들었습니다. 이는 동일한 결과에 대해 40배의 비용 차이가 발생함을 의미합니다! 마치 한 셰프는 케이크를 굽기 위해 달걀 한 개를 사용하는 반면, 다른 셰프는 단지 주방 도구가 비효률적이라는 이유만으로 똑같은 케이크를 만드는 데 달걀 40개를 사용하는 것과 같습니다.
"유휴 턴(Idle Turn)" 세금
왜 비용이 그렇게 많이 올라갔을까요? 연구자들은 숨겨진 범인을 찾아냈습니다. 바로 **유휴 턴(idle turns)**이었습니다.
당신이 친구에게 컴퓨터를 고쳐달라고 부탁하며 대화하고 있다고 상상해 보세요. 가끔 친구는 실제로 타이핑을 하거나 화면에 아무것도 바꾸지 않으면서, 그냥 "음, 잠시만 확인해 볼게..."라며 생각에 잠겨 앉아 있을 때가 있습니다. AI의 세계에서는 이를 "무작위 동작 턴(no-action turns)"이라고 부릅니다. OpenCode 하네스는 AI를 이러한 생각의 루프 속에 태스크당 약 2회 정도 머물게 한 반면, Goose 하네스는 약 0.2회 정도만 머물게 했습니다.
AI가 이러한 루프에 빠질 때마다, AI는 자신이 어디에 있는지 추적하기 위해 전체 대화 기록을 서버로 다시 보내야 합니다. 이것은 마치 당신이 생각에 잠길 때마다 100페이지짜리 일기를 통째로 보내는 것과 같습니다. OpenCode는 AI를 훨씬 더 자주 멈추고 생각하게 만들었기 때문에, 엄청난 속도로 토큰을 태워버렸습니다. 연구자들은 이를 "태스크당 대기 세금(per-task wait tax)"이라고 부릅니다. 이것은 단순히 돈의 문제가 아니라 시간의 문제입니다. AI를 지켜보는 인간 개발자는 아무것도 하지 않고 화면만 바라보며 돈과 인내심을 낭비하는 이 유휴 루프를 견뎌내야 합니다.
실패의 "지문"
또한 이 연구는 각 하네스가 마치 지문처럼 자신만의 고유한 실패 방식을 가지고 있다는 것을 발견했습니다. 이러한 패턴은 어떤 AI 모델을 사용하느냐에 따라 변하는 것이 아니라, 하네스 자체에 의해 발생했습니다.
- Goose는 신중한 타입이었습니다. 막혔을 때, 섣불리 추측하기보다는 "할 수 없습니다"라고 말하며 멈췄습니다. 잘못된 아이디어를 검증하려고 시간을 낭비하는 경우가 거의 없었습니다.
- OpenHands-SDK는 끈기 있는 타입이었습니다. 자신의 답변을 검증하거나, 시도할 수 있는 최대 횟수(max turns) 제한에 도달할 때까지 계속해서 시도했습니다.
- OpenCode는 루프에 빠지는 타입이었습니다. 시간 제한(wall-time limit)에 걸리거나, 아무것도 하지 못한 채 헛바퀴를 돌며 '행(hang)' 상태에 빠져 있었습니다.
이는 개발자 입장에서 당신이 단순히 AI를 선택하는 것이 아니라, 실패의 스타일을 선택하는 것임을 의미합니다. 솔직하게 빨리 포기하는 AI를 원하시나요, 아니면 당신의 인내심이 바닥날 때까지 계속 헛바퀴를 돌리는 AI를 원하시나요?
핵심 결론
이 논문의 주요 교훈은 우리가 AI 코딩 벤치마크를 완전히 잘못된 방식으로 바라보고 있었다는 점입니다. 우리는 Qwen이나 MiniMax 같은 모델을 마치 그것만이 유일하게 중요한 것처럼 순위를 매겨왔습니다. 하지만 이 연구는 하네스(주방)가 모델(셰프)만큼이나 중요하다는 것을 보여줍니다.
만약 당신이 AI가 실제로 얼마의 비용을 들일지, 혹은 작업을 마치는 데 얼마나 걸릴지 알고 싶다면, 단순히 모델의 이름만 봐서는 안 됩니다. 당신은 모델과 그 모델이 실행되는 하네스의 조합을 보아야 합니다. 똑똑한 모델이라도 나쁜 하네스에 있으면 좋은 하네스에 있는 똑똑한 모델보다 40배 더 비쌀 수 있습니다.
연구자들은 향후에는 단순히 "성공률(Pass Rate)"만을 보고해서는 안 된다고 제안합니다. 우리는 해결된 태스크당 비용, 유휴 턴 횟수, 그리고 실패 패턴을 보고해야 합니다. 왜냐하면 실제 인간 개발자에게 있어서, 1달러가 드는 50%의 성공률과 40달러가 드는 50%의 성공률 사이의 차이는 유용한 도구와 돈 먹는 하마 사이의 차이이기 때문입니다. "스캐폴드 효과(Scaffold Effect)"는 실재하며, 이제 우리는 로봇을 안내하는 보이지 않는 손을 무시하는 것을 멈춰야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.