← 최신 논문
🤖 AI

Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering

이 논문은 LLM 기반 멀티 에이전트 소프트웨어 엔지니어링 시스템의 토큰 소비 패턴을 분석하여, 반복적인 코드 리뷰 단계와 입력 토큰이 자원 사용을 지배한다는 점을 밝힘으로써, 주요 비용이 초기 코드 생성보다는 자동화된 정제 및 검증에 있음을 강조한다.

원저자: Mohamad Salim, Jasmine Latendresse, SayedHassan Khatoonabadi, Emad Shihab

게시일 2026-01-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mohamad Salim, Jasmine Latendresse, SayedHassan Khatoonabadi, Emad Shihab

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 소프트웨어를 만들기 위해 AI 로봇 팀을 고용했다고 상상해 보십시오. 당신은 아마도 가장 비싼 부분이 실제 "구축"(코드 작성) 단계일 것이라고 생각할지도 모릅니다. 하지만 이 논문은 그것이 마치 집을 지을 때 가장 비싼 부분이 벽돌을 쌓는 것이라고 생각하는 것과 같다고 말합니다. 실제로는 팀원들이 페인트 색상이 맞는지 틀린지를 두고 끝없이 논쟁하는 회의에서 비용이 발생하기 때문입니다.

연구진이 발견한 내용을 다음과 같이 간단히 정리했습니다.

핵심 아이디어: "토큰노믹스(Tokenomics)"

저자들은 AI의 "경제학"을 설명하기 위해 **"토큰노믹스"**라는 새로운 단어를 만들어냈습니다. 인간 팀이 급여와 커피값으로 돈을 쓰는 것처럼, AI 팀은 "토큰"(AI가 생각하고 대화하는 데 사용하는 통화)을 소모합니다. AI가 프롬프트를 읽거나 코드 한 줄을 쓸 때마다 토큰이 소모됩니다. 연구진은 아주 단순한 질문에 답하고자 했습니다: 이 돈은 정확히 어디로 가는가?

실험: 가상 소프트웨어 공장

이를 알아내기 위해 연구진은 ChatDev라는 가상의 소프트웨어 회사를 설립했습니다. 이 AI 팀에게 간단한 수학 문제부터 체스 게임 제작까지 30가지의 서로 다른 업무를 맡겼습니다. 그리고 팀을 구동하기 위해 매우 똑똑한 AI 모델인 GPT-5를 사용했습니다.

연구진은 AI 팀이 단계별로 작업하는 과정을 지켜보며, 모든 토큰 사용량을 추적하고 이를 실제 소프트웨어 개발 단계에 매칭했습니다:

  • 설계(Design): 무엇을 만들지 계획함.
  • 코딩(Coding): 초안 작성.
  • 코드 리뷰(Code Review): 작업물을 점검하고 실수를 수정함.
  • 테스트(Testing): 제대로 작동하는지 확인하기 위해 일부러 망가뜨려 봄.
  • 문서화(Documentation): 매뉴얼 작성.

놀라운 결과

1. "코드 리뷰"는 돈이 새는 구멍이다
당신은 "코딩" 단계가 가장 비용이 많이 들 것이라고 예상할 수도 있습니다. 하지만 그렇지 않습니다.

  • 비유: 건설 현장을 상상해 보십시오. 실제로 못을 박는 작업(코딩)은 빠르고 저렴합니다. 하지만 현장 소장과 설계사가 같은 벽을 가리키며 서서, 설계를 계속 수정하고 치수를 반복해서 확인하며 논쟁하는 부분은 어떠합니까? 그것이 바로 코드 리뷰입니다.
  • 발견: 연구진은 전체 토큰(돈)의 **59.4%**가 오직 이 "코드 리뷰" 단계에서만 소비되었다는 것을 발견했습니다. AI 에이전트들은 코드를 개선하고 수정하기 위해 끊임없이 서로 대화했으며, 이는 엄청난 비용을 발생시켰습니다.

2. "듣기" 세금
AI 토큰은 세 가지 유형으로 나뉩니다: 입력(Input)(AI가 읽는 것), 출력(Output)(AI가 쓰는 것), 그리고 추론(Reasoning)(AI가 생각하는 것).

  • 비유: 사람들이 퍼즐을 풀려고 노력하는 상황을 상상해 보십시오. 그들은 지침을 읽고 조각들을 살펴보는 데 2분을 쓰지만, 실제로 조각을 배치하는 데는 1분만 사용합니다.
  • 발견: AI는 시간의 **53.9%**를 단순히 문맥(Context)을 읽는 데(입력) 사용했습니다. 연구진은 이를 **"커뮤니케이션 세금"**이라고 부릅니다. 에이전트들이 서로 대화를 주고받는 루프(Loop) 구조 때문에, 그들은 전체 대화 내용과 코드를 계속해서 서로에게 전달하고 다시 읽습니다. 즉, 새로운 것을 창조하기보다는 이미 알고 있는 것을 반복하는 데 예산의 대부분을 쓰고 있는 것입니다.

3. 직무에 따라 달라지는 비용

  • 코딩: 이 단계는 사실 가장 저렴했습니다. 이는 "출력 중심(Output-heavy)"이었는데, 즉 AI가 새로운 것을 활발하게 써 내려가는 단계였음을 의미합니다.
  • 문서화 및 리뷰: 이 단계들은 "입력 중심(Input-heavy)"이었습니다. AI가 아주 작은 요약본을 쓰거나 작은 버그를 찾기 위해 방대한 양의 기존 코드를 읽어야 했기 때문입니다.

결론

이 논문은 AI를 이용한 소프트웨어 개발 비용이 높은 이유가 AI의 코딩 능력이 부족해서가 아니라고 결론짓습니다. 그 이유는 AI 팀이 서로 대화하는 방식이 비효율적이기 때문입니다.

그들은 작업물을 확인하고 재확인하는 루프(코드 리뷰)와 동일한 문맥을 반복해서 읽는 과정(입력)에 막대한 자원을 소비합니다. 연구진은 만약 우리가 AI 소프트웨어 개발을 더 저렴하고 빠르게 만들고 싶다면, AI가 코드를 더 빨리 쓰도록 만드는 데 집중할 것이 아니라, AI 팀이 그렇게 많이 논쟁하고 다시 읽지 않도록 만드는 데 집중해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →