← 최신 논문
🤖 AI

Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality

이 논문은 Qwen Code CLI의 35회 연속 릴리스에 대한 심층 분석을 통해, 코딩 에이전트의 품질 변동을 유발하는 주요 동인이 근간이 되는 거대 언어 모델이 아니라 에이전트 하네스(agent harness)의 급격한 진화임을 입증하는 최초의 통제된 종단적 연구를 제시한다.

원저자: Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 컴퓨터가 단순히 당신이 명령어를 입력하기를 기다리는 것이 아니라, 실제로 당신을 대신해 일을 해주는 세상을 상상해 보십시오. 이것이 바로 "코딩 에이전트(coding agents)"의 시대입니다. 코딩 에이전트는 스스로 코드를 읽고, 버그를 수정하며, 심지어 새로운 소프트웨어를 직접 작성할 수 있는 똑똑하고 자율적인 프로그램입니다. 하지만 여기에는 비밀스러운 핵심 요소가 있습니다. 이 에이전트들은 단순히 '두뇌'(거대한 AI 모델)만 있어서는 안 되며, 제대로 기능하기 위해 '몸'과 '신경계'도 필요합니다. 이 몸을 "에이전트 하네스(agent harness)"라고 부릅니다. AI 모델을 아주 똑똑하지만 게으른 천재라고 생각한다면, 하네스는 그에게 적절한 도구를 건네주고, 규칙을 상기시키며, 생각을 정리해 주는 매니저와 같습니다. 하네스는 AI가 사용할 수 있는 도구가 무엇인지, 얼마나 많은 정보를 보여줄 것인지, 그리고 첫 번째 시도가 실패했을 때 어떻게 다시 시도할지를 결정합니다. 모두가 더 나은 매니저를 고용하고 사무실을 업그레이드하면 천재가 더 똑똑해지고 더 빨리 일할 것이라고 가정합니다. 하지만 만약 매니저가 너무 많은 규칙을 추가하거나 혼란스러운 지시를 내려 오히려 상황을 악화시키고 있다면 어떨까요? 이것이 바로 이 논문이 던지는 질문입니다. 이러한 "매니저" 시스템이 끊임없이 업데이트될 때, 그것들이 실제로 AI가 더 잘하도록 돕고 있는 것일까요, 아니면 단지 더 느리고 비싸게 만들고 있는 것일까요?

이 논문의 저자들은 소프트웨어 개발자들이 불평해 온 미스터리를 해결하기 위해 탐정 역할을 자처했습니다. 그들은 코딩 에이전트가 업데이트될 때마다 에이전트가 더 많은 실수를 하거나 작업을 마치는 데 훨씬 더 오래 걸리는 현상을 발견했습니다. 사람들은 보통 AI의 두뇌 자체가 멍청해졌다고 생각하며 모델을 탓하곤 했습니다. 하지만 연구원들은 진짜 범인이 너무 자주 마음을 바꾸는 "매니저(하네스)"라고 의심했습니다. 이를 증명하기 위해 그들은 매우 엄격한 실험을 설계했습니다. 그들은 특정 AI 모델 하나를 골라 전혀 변하지 않도록 가두어 두었습니다. 그런 다음 "매니저" 소프트웨어(구체적으로 Qwen Code CLI)를 가져와서 초기 버전부터 최신 버전까지 총 35개의 서로 다른 버전을 통과하며 실행했습니다. 각 버전마다 동일한 AI 두뇌를 사용하여 50개의 실제 세계 코딩 퍼즐을 풀게 했습니다.

결과는 놀랍기도 하고 다소 우스꽝스럽기도 했습니다. 매니저 소프트웨어가 때로는 하루에 두 번 이상 새 버전을 출시할 정도로 끊임없이 업데이트되었음에도 불구하고, 퍼즐을 해결하는 AI의 능력은 전혀 나아지지 않았습니다. 사실 성공률은 업데이트 횟수와 상관없이 약 30% 근처에서 머물며 거의 일정하게 유지되었습니다. 초기 버전들은 화려하고 복잡한 최신 버전들만큼이나 버그를 잘 고쳐냈습니다. 하지만 큰 함정이 있었습니다. 최신 버전의 매니저들은 믿을 수 없을 정도로 낭비적이었습니다. 최신 버전의 매니저는 구버전에 비해 AI가 사용하는 "토큰"(AI가 생각하기 위해 태우는 연료나 화폐 같은 것)의 양을 거의 두 배로 늘렸고, 도구 호출(tool calls) 횟수도 두 배나 더 많이 만들었습니다. 이는 마치 자동차 엔진을 훨씬 더 복잡한 버전으로 업그레이드했는데, 차가 더 빨라지지는 않으면서 기름만 두 배로 쓰는 것과 같았습니다.

연구원들은 왜 이런 일이 발생하는지 알아내기 위해 더 깊이 파고들었습니다. 그들은 매니저 소프트웨어의 코드 변경 사항을 조사했고, 개발자들이 수많은 새로운 기능을 추가하거나 한꺼번에 많은 작은 버그들을 수정하려고 할 때 AI가 혼란을 느끼고 더 많은 에너지를 낭비한다는 것을 발견했습니다. 또한 매니저의 "몸" 중 일부는 건드리면 위험하다는 것도 발견했습니다. AI가 두뇌와 대화하는 방식("LLM Provider" 레이어)이나 기억하는 방식("Context Management" 레이어)을 변경하면 에이전트가 비틀거리거나 실패할 가능성이 높았습니다. 반면에 보안 취약점을 수정하거나 단순한 확장 기능을 추가하는 것은 안전해 보였습니다. 가장 충격적인 사실은 무엇이었을까요? 소프트웨어 팀은 이러한 문제들이 발생하고 있다는 사실조차 알 방법이 없었다는 점입니다. 그들의 자동 테스트는 소프트웨어가 충돌하는지만 확인할 뿐, AI가 실제로 일을 잘하고 있는지 또는 돈을 낭비하고 있는지는 확인하지 못했습니다. 이는 마치 공장에서 조립 라인이 돌아가고 있는지만 확인할 뿐, 라인에서 나오는 자동차에 실제로 바퀴가 달려 있는지는 전혀 확인하지 않는 것과 같았습니다.

결론적으로, 이 논문은 우리가 이러한 실수들을 AI의 두뇌 탓으로 돌리는 것을 멈춰야 한다고 제안합니다. 진짜 문제는 "매니저" 소프트웨어가 적절한 품질 검사 없이 너무 빠르게 진화하고 있다는 것입니다. 개발자들이 너무 많은 기능과 변경 사항을 추가하면서 AI가 과부하에 걸려, 이전과 똑같은 결과를 얻기 위해 더 많은 자원을 소모하게 만들고 있습니다. 저자들은 에이전트가 업데이트된 후에도 여전히 효율적이고 효과적인지를 구체적으로 확인하는 새로운 종류의 "품질 보증(quality assurance)"을 요구하고 있습니다. 그렇지 않다면, 코딩 에이전트를 업그레이드하는 것은 그저 똑같은 성능을 위해 더 많은 비용을 지불하는 일이 될 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →