← 최신 논문
💻 computer science

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks

이 논문은 작업 명세가 에이전트 기반 코딩 워크플로의 토큰 소비에 어떤 영향을 미치는지 조사하며, 지나치게 짧은 프롬프트가 비용을 상당히 증가시킨다는 점을 입증하는 동시에 다양한 구성에 따른 토큰 지출을 높은 정확도로 추정할 수 있는 예측 방법을 제시한다.

원저자: Jakub Smékal

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jakub Smékal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 소프트웨어 개발의 세계에는 새로운 종류의 노동자가 등장했습니다: 바로 인공지능 에이전트입니다. 단일 질문에 답하는 단순한 챗봇과 달리, 이 에이전트들은 컴퓨터 프로그램의 버그를 수정하거나 새로운 기능을 처음부터 구축하는 것과 같은 복잡하고 다단계적인 작업을 수행하도록 설계되었습니다. 이들은 작업 설명을 읽고, 문제에 대해 고민하며, 코드를 작성하고 테스트하기 위해 디지털 도구를 사용하고, 작업이 완료될 때까지 이 과정을 반복함으로써 임무를 완수합니다. 하지만 이러한 자율성에는 대가가 따릅니다. AI가 생각하거나, 읽거나, 쓸 때마다 '토큰'이라 불리는 디지털 자원을 소비하게 되는데, 이는 모델이 처리하는 텍스트의 기본 단위입니다. 이 토큰은 곧바로 돈으로 직결됩니다. 이러한 에이전트가 실제 시스템에서 점점 더 흔해짐에 따라, 엔지니어들은 절박한 질문에 직면해 있습니다: AI가 문제를 해결하게 하는 데 비용이 얼마나 들 것이며, 그 비용을 통제할 수 있는가?

그 답은 단순히 더 저렴한 컴퓨터 모델을 선택하는 것만큼 간단하지 않습니다. 최근 연구들에 따르면, AI에게 정확히 동일한 지침을 주더라도 실행할 때마다 소모되는 비용은 크게 달라질 수 있음이 밝혀졌습니다. 때로는 동일한 작업에 대한 두 번의 실행 결과가 비용 면에서 30배까지 차이가 나기도 합니다. 이러한 예측 불가능성은 예산 책정을 어렵게 만듭니다. 더욱이, 연구자들은 서로 다른 AI 모델의 성능을 조사해 왔지만, 인간이 작업을 기술하는 방식 자체가 가격을 어떻게 변화시키는지에 대해서는 대체로 간과해 왔습니다. 시니어 엔지니어는 소프트웨어 수정을 위해 상세하고 구조화된 명세서를 작성할 수 있는 반면, 주니어 엔니어는 가공되지 않은 에러 메시지를 그대로 붙여넣을 수 있습니다. 이러한 서로 다른 설명이 비용의 차이를 만들어낼까요, 아니면 요청이 어떻게 표현되든 AI는 상관없이 동일한 양의 작업을 수행하는 것일까요?

이를 알아내기 위해 스탠퍼드 대학교의 한 연구자가 Kimi K3라고 알려진 특정 AI 모델을 사용하여 대규모 실험을 수행했습니다. 연구팀은 개발자들이 사용하는 표준 테스트 스위트에서 다섯 가지의 뚜렷한 소프트웨어 수리 작업을 선정했습니다. 각 작업에 대해, 그들은 가능한 모든 세부 사항을 포함한 완전하고 고도로 구조화된 문서부터 정보가 거의 없는 아주 기본적인 설명에 이르기까지 매우 다양한 지침들을 만들었습니다. 또한 그들은 AI가 행동하기 전에 얼마나 깊이 추론하는지를 실질적으로 제어하는 세 가지 다른 수준의 '사고 노력(thinking effort)'을 테스트했습니다. 총 2,700번의 시스템 실행을 통해, 연구팀은 각 시도에 소요된 비용과 에이전트가 업무를 수행하기 위해 컴퓨터에 몇 번이나 접근했는지를 면밀히 추적했습니다.

결과는 명확하고 놀라운 패턴을 보여주었습니다. 작업이 기술되는 방식은 평균 비용에 엄청난 영향을 미칩니다. 연구진이 상세한 명세를 단순한 일상 언어로 된 사용자 요구 사항 이야기로 축소했을 때, 문제를 해결하는 데 드는 비용은 거의 30% 급증했습니다. 이는 테스트한 모든 작업에서 일관되게 나타났습니다. AI에게 충분한 세부 사항이 주어지지 않으면, AI는 누락된 부분을 스스로 파악하기 위해 더 많은 시간과 비용을 써야 한다는 것을 의미합니다. 그러나 연구는 지침의 내용이 비용의 예측 불가능성을 바꾸지는 않는다는 점도 발견했습니다. 프롬프트가 얼마나 상세하든 혹은 모호하든 관계없이, 한 실행과 다음 실행 사이의 차이는 대략 동일하게 유지되었습니다. 단일 시도의 비용은 본질적으로 불안정하며, 전체 청구 금액을 더 예측 가능하게 만드는 유일한 방법은 개별 시도의 비용을 낮추는 것입니다.

또 다른 핵심 발견은 AI에게 제한된 사고 예산이 주어졌을 때 지침의 상세 수준이 가장 중요하다는 점이었습니다. AI가 깊고 광범위하게 생각할 수 있도록 허용되면, 상세한 프롬프트와 모호한 프롬프트 사이의 비용 차이는 줄어듭니다. 이는 AI에게 추론할 충분한 시간을 준다면 부족한 설명의 빈틈을 스스로 채울 수 있지만, 사고 시간을 제한한다면 명확하고 상세한 프롬프트가 비용을 절감하는 데 필수적이라는 것을 시사합니다. 또한 연구진은 에지 케이스(edge cases) 목록이나 성공 기준과 같은 특정 섹션을 제거하는 것은 그 자체로는 작은 영향을 미쳤지만, 사용자 스토리 전체나 테스트 시나리오를 제거하는 것은 비용을 급격히 상승시킨다는 것을 발견했습니다.

이 도구들을 사용하는 사람들에게 가장 실용적인 발견은 아마도 새로운 작업에 대한 비용을 예측하는 방법일 것입니다. 연구팀은 새로운 문제에 대해 수십 번의 실행을 거치지 않고도 그것이 얼마의 비용이 들지 알 수 있다는 것을 보여주었습니다. 새로운 문제에 대해 단 한 번의 저렴한 테스트를 실행함으로써, 그들은 다양한 지침 스타일과 사고 설정 하에서 해당 문제가 얼마의 비용이 들지 상당히 정확하게 예측할 수 있었습니다. 이 단 한 번의 테스트 없이는, 새로운 작업의 비용에 대한 어떤 추측도 100% 이상의 오차를 보일 가능성이 높았습니다. 하지만 단 한 번의 작은 측정을 통해 오차는 약 36%로 떨어졌습니다. 이는 엔지니어들이 광범한 시행착오를 겪으며 자원을 낭비하지 않고도 자신들의 선택이 가져올 재정적 영향을 빠르게 가늠할 수 있음을 의미합니다.

연구는 AI의 행동이 본질적으로 예측 불가능하지만, 작업의 비용은 인간이 요청을 어떻게 구성하느냐에 따라 크게 좌우된다는 결론을 내립니다. 잘 구조화되고 상세한 작업 설명은 특히 AI에게 무제한의 사고 시간을 주지 않을 때 지출되는 비용을 크게 줄일 수 있습니다. 이 연구는 이러한 비용을 관리하는 가장 효과적인 방법이 AI의 무작위성을 제거하려고 노력하는 것이 아니라, 작업 지침을 신중하게 설계하고 새로운 작업을 위한 기대치를 조정하기 위해 단 한 번의 저비용 테스트를 사용하는 것이라고 제안합니다. 이러한 에이전트들이 일상 업무에 통합됨에 따라, 우리가 사용하는 단어와 우리가 쓰는 돈 사이의 관계를 이해하는 것은 그들이 작성하는 코드만큼이나 중요해질 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →