← 최신 논문
💬 NLP

Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents

이 사전 등록된 벤치마크 연구는 프롬프트 문구와 하네스 설계가 작업 성공을 개선하지 못한 채 대규모 코딩 에이전트의 추론 비용을 종종 2.4배에서 30배까지 크게 부풀린다는 점을 입증하며, 특히 "다양한 접근 방식을 개발하라"와 같은 특정 지침과 특정 하네스 아키텍처가 이러한 비효율성의 주요 동인임을 보여준다.

원저자: Sarel Weinberger, Amir Hozez

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Sarel Weinberger, Amir Hozez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 고장 난 토스터기를 고치기 위해 초지능형 로봇 조수를 고용한다고 상상해 보세요. 당신은 단순히 로봇이 토스터기를 고치기만을 원하는 것이 아니라, 고치기 전에 먼저 어떻게 고칠지 '생각'하기를 원합니다. 인공지능의 세계에서 이러한 "생각하는" 단계는 **추론 토큰(reasoning tokens)**이라고 불립니다. 마치 인간이 퍼즐을 풀기 전에 메모를 적고, 선을 긋고, 다양한 아이디어를 시도해보는 것처럼, 이 AI 모델들은 당신에게 답을 주기 전에 고민하고 노력하며 시간과 비용을 소비합니다.

하지만 여기 함정이 있습니다. 당신은 로봇이 하는 모든 생각, 즉 버려지는 생각에 대해서도 비용을 지불해야 합니다. 만약 당신이 로봇에게 "정말 열심히 생각하라"거나 "다섯 가지 다른 방법을 시도해 봐"라고 요청한다면, 로봇은 당신의 예산을 다 써버리면서도, 그냥 "토스터기를 고쳐줘"라고 말했을 때보다 더 나은 결과를 내놓지 못한 채 정확히 그 명령을 수행할 수도 있습니다. 이 논문은 연구자들이 탐정처럼 행동하여, 어떤 단어가 로봇으로 하여금 돈을 낭비하게 만드는지, 그리고 어떤 단어가 로봇의 예산을 아껴주는지를 밝혀내려는 컴퓨터 과학의 기묘한 영역을 탐구합니다. 그들은 단순히 추측하는 것이 아니라, 서로 다른 문구들이 정확히 얼마나 많은 비용을 발생시키는지 알아내기 위해 수천 번의 통제된 실험을 수행합니다.


위대한 프롬프트 실험: 당신의 말이 왜 돈이 되는가

당신에게 여섯 대의 서로 다른 초지능형 로봇 셰프 군단이 있다고 상상해 보세요. 당신은 그들에게 코딩(컴퓨터의 레시피와 같은 것)을 시켜 24가지의 구체적인 요리 과제를 해결하게 하려고 합니다. 하지만 반전이 있습니다. 요리하는 동안 셰프들이 하는 모든 생각에 대해 비용을 지불해야 한다는 것입니다. 연구자들은 알고 싶었습니다: 주문을 작성하는 방식이 셰프들의 생각하는 양을 변화시키는지, 그리고 그 생각이 실제로 요리의 맛을 더 좋게 만드는지 말입니다.

이를 알아내기 위해 그들은 거대하고 매우 체계적인 주방 실험실을 구축했습니다. 그들은 단순히 추측하지 않았습니다. 그들은 요리를 시작하기 전에 규칙을 미리 적어두었습니다(이는 식료품점에 가기 전 메뉴를 작성하는 '사전 등록'과 같습니다). 그들은 셰프들과 대화하기 위해 두 가지 유형의 주방 매니저(이를 '하네스'라고 부름)를 사용했습니다. 하나는 직설적이고 군더더기 없는 매니저였고, 다른 하나는 매 주문마다 엄청난 양의 배경 정보를 함께 보내는 매우 수다스럽고 상세한 매니저였습니다.

4,600회 이상의 요리 세션을 실행한 후 그들이 발견한 결과는 다음과 같습니다:

1. "모든 것을 시도하라"의 함정

가장 큰 돈 낭비 요인은 무엇이었을까요? 바로 로봇에게 **"여러 가지 접근 방식을 개발하고 비교하라"**고 말하는 것이었습니다.
언뜻 들으면 똑똑한 명령처럼 들립니다. 마치 훌륭한 셰프가 하나의 소스를 고르기 전 세 가지 소스의 맛을 보는 것처럼 말이죠. 하지만 이 AI 로봇들에게 이 지시는 재앙이었습니다. 이 명령은 로봇을 평소보다 2.4배에서 7.4배 더 많이 생각하게 만들었습니다. 그리고 가장 최악인 점은, 최종 결과물(코드)이 전혀 더 나아지지 않았다는 것입니다. 그들은 단지 사용하지도 않을 옵션들을 생각하느라 추가적인 현금을 태워버린 것뿐입니다. 이는 셰프에게 샌드위치를 위한 세 가지 다른 레시피를 쓰고, 그것들을 모두 맛본 뒤, 결국 그냥 "샌드위치 하나 만들어줘"라고 했을 때와 똑같은 샌드위치를 내놓으라고 돈을 지불하는 것과 같습니다.

2. 아무것도 하지 못하는 마법의 단어들

사람들은 종로종 더 나은 결과를 얻기 위해 "단계별로 생각하라"거나 "깊게 생각하라"고 말하곤 합니다. 연구자들은 코딩 로봇들에게 이러한 "깊은 생각"을 유도하는 마법의 단어들이 그저 순전한 낭비라는 것을 발견했습니다. 이 단어들은 결과물을 개선하지 못한 채 로봇을 1.6배에서 2.2배 더 오래 생각하게 만들었습니다. 이는 계산기에게 2 + 2를 하기 전에 "깊이 생각하라"고 말하는 것과 같습니다. 답은 같지만, 당신은 그 추가적인 생각 시간에 대한 비용을 지불하게 됩니다.

3. "경계 효율성(Bounded Efficiency)"의 비결

반면에, 돈을 아껴주는 비밀 소스가 있었습니다. 만약 당신이 로봇에게 엄격한 틀을 제공한다면—즉, 목표가 무엇인지, 규칙이 무엇인지, 그리고 언제 멈춰야 하는지를 정확히 알려준다면—로봇은 실제로 더 적게 생각했습니다. 한 로봇은 생각하는 시간을 절반으로 줄이기도 했습니다! 이 "경계 효율성" 템플릿은 무료로 사용할 수 있으며, 코드의 질을 떨어뜨리지 않으면서도 로봇을 더 빠르고 저렴하게 만들었습니다.

4. 셰프보다 매니저가 더 중요하다

가장 놀라운 발견 중 하나는 로봇을 관리하는 사람이 누구인지가 로봇 자체보다 더 중요하다는 것이었습니다.
그들은 동일한 로봇을 두 가지 다른 매니저로 테스트했습니다. 한 매니저(PI.DEV)는 효율적이었습니다. 반면 다른 매니저(Claude Code)는 매 메시지마다 12~15배나 더 큰 "도입부 연설"을 보내는 마이크로매니저 같았습니다. 심지어 로봇이 문제를 완벽하게 해결했을 때조차, 이 마이크로매니저 버전은 대화 방식 때문에 5배에서 30배 더 많은 비용이 발생했습니다. 결국, (AI를 감싸고 있는 소프트웨어인) "매니저"가 AI 자체보다 훨씬 더 큰 비용을 차지하는 경우가 많다는 사실이 드러났습니다.

5. "숨겨진 할인"의 환상

연구자들은 기업들이 이 로봇들에게 비용을 청구하는 방식도 조사했습니다. 그들은 기업들이 매번 보내는 "도입부 연설"을 기억함으로써 자동으로 비용을 절감한다는 것을 발견했습니다. 이것은 약 61%의 청구 금액을 절감했습니다. 하지만 연구자들은 경고합니다: 이것을 "효율성"이라고 부르지 마십시오. 이것은 그저 기존 작업에 대한 "할인"일 뿐입니다. 로봇이 실제로 더 빠르거나 똑똑하게 일한 것이 아니라, 기업이 기억하고 있는 부분에 대해서는 비용을 청구하지 않은 것뿐입니다.

6. 새로운 로봇, 똑같은 구식 수법

새롭고 매우 빠른 로봇(Kimi-K3)이 출시되었을 때, 연구자들은 즉시 이를 테스트했습니다. 이 새로운 로봇은 본래 더 저렴하게 운영되도록 설계되었음에도 불구하고, "여러 접근 방식을 시도하라"와 같은 나쁜 지시사항은 평소보다 15배나 더 많은 돈을 낭비하게 만들었습니다. 교훈은 명확합니다. 로봇이 아무리 똑똑하거나 저렴하더라도, 잘못된 지시는 항상 과도한 지출을 만듭니다.

결론

이 논문은 질문을 어떻게 하느냐에 따라 결과가 같더라도 비용이 달라진다는 것을 증명합니다.

  • 실제로 그런 기능이 꼭 필요한 경우가 아니라면, 로봇에게 "많은 접근 방식을 시도하라"거나 "깊게 생각하라"고 말하지 마십시오.
  • 대신 명확한 경계와 중단 조건을 제시하십시오.
  • 로봇을 관리하는 소프트웨어가 로봇 자체보다 더 많은 비용을 발생시킬 수 있음을 기억하십시오.

연구자들은 자신들의 모든 데이터, 코드, 그리고 테스트 레시피를 공개했습니다. 그들은 AI 에이전트의 세계에서 생각하는 척하는 연극(thinking theater)을 줄이고 명확한 지시를 내리는 것이 돈을 아끼고 업무를 완수하는 최선의 방법이라는 것을 모두가 알기를 바랍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →