← 최신 논문
💬 NLP

Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems

이 논문은 CoT 분기 엔트로피(CoT Branching Entropy)를 통해 워크플로 수준의 비용을 예측하고 의미적 교환율(Semantic Exchange Rate)을 통해 모델 선택을 최적화함으로써, FrugalGPT와 같은 기존 방식보다 더 적은 토큰으로 더 높은 정확도를 달arl achieve하여 에이전트 기반 LLM 시스템의 "토큰 인플레이션" 격차를 해결하는 새로운 라우팅 프레임워크인 InflationAgent를 소개한다.

원저자: Heming Fu, Shan Lin, Qianqian Xie, Guojun Xiong

게시일 2026-08-17
📖 5 분 읽기🧠 심층 분석

원저자: Heming Fu, Shan Lin, Qianqian Xie, Guojun Xiong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 배송 부대를 운영하는 배송 서비스를 운영한다고 상상해 보세요. 어떤 로봇은 아주 작고 빠르며 운영 비용이 저렴하지만, 가끔 혼란을 느껴 패키지를 떨어뜨리기도 합니다. 반면 어떤 로봇은 거대하고 매우 똑똑하며 비용이 많이 들지만, 거의 실수를 하지 않습니다. 인공지능의 세계에서 이 로봇들은 "대규모 언어 모델(LLM)"입니다. 이들은 챗봇과 코딩 어시스턴트의 두뇌 역할을 합니다. 보통 우리가 질문을 던질 때, 우리는 단 하나의 로봇에게 질문을 보내고 답변을 기다립니다. 하지만 현실 세계에서는 상황이 복잡하게 돌아갑니다. 만약 작은 로봇이 틀렸을 때, 스마트한 시스템은 그냥 포기하는 대신 로봇에게 다시 시도하라고 요청합니다. 심지어 거대한 로봇이 개입하도록 요청할 수도 있습니다. 이것을 "에이전틱 시스템(agentic system)"이라고 부르며, 문제를 해결하기 위해 협력하는 AI 에이전트들의 팀을 의미합니다.

문제는 우리가 이 배송 비용을 잘못 계산해 왔다는 점입니다. 우리는 단 한 번의 여정에 드는 가격만 계산했을 뿐, 만약 로봇이 사고를 쳐서 다시 창고로 돌아와 재시도를 해야 한다면, 우리가 지불하는 것은 편도 티켓이 아니라 왕복 전체 비용이라는 사실을 잊었습니다. 이 논문은 이러한 AI 팀을 관리하는 새로운 방법을 다룹니다. 이를 통해 우리가 잘못된 로봇을 작업에 투입하여 재시도가 너무 많이 발생하는 바람에 예산을 실수로 탕진하는 일을 방지하고자 합니다.


숨겨진 비용: "다시 시도하기"

당신이 카니발의 게임 부스에 있다고 상상해 보세요. 당신에게는 놀이에 사용할 수 있는 제한된 금액(토큰)이 있습니다. 당신은 한 번 시도할 때 1달러가 드는 저렴하고 덜 견고한 기계와, 한 번 시도할 때 10달러가 드는 화려하고 하이테크한 기계 중 하나를 선택할 수 있습니다.

기존의 사고방식은 단순했습니다: "저렴한 기계는 1달러니까, 그걸 고를래!" 하지만 여기에는 함정이 있습니다. 저렴한 기계는 까다롭습니다. 어려운 질문을 던지면 틀릴 수도 있습니다. 그래서 당신은 두 번째 시도를 위해 다시 1달러를 내야 합니다. 세 번째, 네 번째도 마찬가지입니다. 마침내 정답을 얻었을 때, 당신은 저렴한 기계에 이미 5달러를 쓴 셈이 됩니다. 반면, 화려한 기계는 첫 번째 시도에 10달러를 들여 바로 정답을 맞혔을 것입니다.

이 논문은 이 숨겨진 추가 비용을 **"토큰 인플레이션(Token Inflation)"**이라고 부릅니다. 이는 당신이 지불한다고 생각하는 비용(한 번의 시도)과 당신이 실제로 지불하는 비용(다섯 번의 시도) 사이의 격차입니다. 저자들은 어려운 과업의 경우 이 인플레이션이 엄청날 수 있다는 것을 발견했습니다. 작은 규모의 저렴한 모델은 계속 실패하고 재시도가 필요하기 때문에 예상보다 4.25배 더 많은 비용이 들 수도 있습니다.

새로운 전략: "인플레이션에이전트(InflationAgent)"

연구진은 이를 해결하기 위해 **인플레이션에이전트(InflationAgent)**라는 새로운 시스템을 구축했습니다. 이 시스템은 단순히 한 번의 시도에 드는 가격표만 보는 대신, 어떤 기계가 고장 나기 쉬운지 정확히 알고 있는 노련한 카니발 매니저처럼 행동합니다.

작동 방식은 다음과 같습니다.

1. "직감 테스트" (CoT 분기 엔트로피)
시스템이 로봇에게 문제를 풀라고 요청하기도 전에, 시스템은 빠르고 무료인 사전 테스트를 수행합니다. 시스템은 작은 로규모의 로컬 로봇에게 문제를 세 가지 다른 방식으로 생각해보라고 요청합니다.

  • 만약 로봇이 세 번 모두 같은 답을 내놓는다면, 시스템은 문제가 쉽다는 것을 압니다.
  • 만약 로봇이 완전히 다르고 혼란스러운 세 가지 답을 내놓는다면, 시스템은 문제가 어렵고 로봇이 재시도의 굴레에 빠질 가능성이 높다는 것을 압니다.
    저자들은 이 측정값을 **CoT 분기 엔트로피(CoT Branching Entropy)**라고 부릅니다. 이는 마치 여행을 시작하기도 전에 자동차 엔진이 덜컥거리는지 확인하는 것과 같습니다. 이 과정은 비싼 클라우드 서버가 아닌 로컬 컴퓨터에서 일어나기 때문에 추가 비용이 들지 않습니다.

2. "가격표" 계산기
이 "직감 테스트"를 사용하여 시스템은 "인플레이션"이 얼마나 발생할지 예측합니다. 단순히 추측하는 것이 아니라, 과거 데이터로 학습된 작고 똑똑한 계산기(머신러닝 모델)를 사용합니다. 시스템은 다음과 같이 예측합니다: "이 어려운 질문을 작은 로봇에게 보내면 아마 3번 실패할 것이고, 따라서 실제 비용은 가격의 3배가 될 것이다."

3. "최고의 거래" 선택기
이제 시스템은 **의미적 교환 비율(Semantic Exchange Rate, SER)**을 계산합니다. 이는 "내가 실제로 지불하는 1달러당 얼마나 많은 정확도를 얻을 수 있는가?"라고 묻는 세련된 방식입니다.

  • 만약 작은 로봇이 저렴하지만 4번 실패한다면, 그 "거래"는 형편없습니다.
  • 만약 큰 로봇이 비싸지만 한 번에 성공한다면, 그 "거래"가 실제로 더 나은 조건일 수 있습니다.
    시스템은 단순히 가장 싼 가격표를 가진 로봇이 아니라, 최고의 가치를 제공하는 로봇을 선택합니다.

4. "새 출발" 규칙
이것이 가장 중요한 기술입니다. 만약 시스템이 질문을 로봇에게 보냈는데 실패했고, 그 후 더 크고 똑똑한 로봇으로 격상하기로 결정했다면, 시스템은 이전의 실패한 시도를 버립니다.
연구진은 놀라운 사실을 발견했습니다. 만약 큰 로봇에게 작은 로봇의 엉망이고 혼란스러운 메모를 보여주면, 큰 로봇도 함께 혼란에 빠진다는 것입니다. 이는 마치 천재 학생에게 고군분투하는 학생의 낙서가 가득한 페이지를 보여주는 것과 같습니다. 천재는 자신의 답에 의구심을 갖기 시작할 수 있습니다.
큰 로봇에게 **새로운 프롬프트(fresh prompt, 깨끗한 상태)**를 제공함으로써, 시스템은 높은 정확도를 유지합니다. 만약 실패한 메모를 그대로 전달했다면, 어려운 문제에서 큰 로봇의 정확도는 34.8 퍼센트 포인트나 떨어졌을 것입니다.

연구 결과

연구팀은 수학 문제(GSM8K)와 까다로운 상식 퀴즈(HotpotQA)를 통해 이를 테스트했습니다. 결과는 다음과 같았습니다.

  • 인플레이션은 실재합니다: 어려운 상식 퀴즈에서 작은 모델(Qwen2.5-7B)의 인플레이션율은 4.25배였습니다. 이는 당신이 1달러를 쓰고 있다고 생각할 때마다, 로봇이 계속 실패하여 실제로 4.25달러를 쓰고 있었다는 것을 의미합니다.
  • 더 적은 비용으로 더 나은 결과: 고정된 예산(토큰 사용량의 엄격한 제한)을 설정했을 때, 새로운 시스템(InflationAgent)은 **94.7%**의 정답률을 기록했습니다. 기존의 인기 있는 방식(FrugalGPT)은 **91.0%**만을 기록했습니다.
  • 토큰 절약: 기존 방식이 달성한 91.0%의 정확도를 얻기 위해, 새로운 시스템은 31% 적은 토큰을 사용했습니다. 이는 엄청난 절약입니다.
  • "더 많은 재시도"의 위험성: 연구진은 작은 로봇에게 더 많은 기회(최대 10번)를 주는 것이 영원히 효과적이지 않다는 것을 발견했습니다. 특정 시점이 지나면 로봇은 자신의 과거 실패에 의해 혼란을 느끼게 되며, 오히려 정확도가 떨어집니다. 때로는 벽에 머리를 계속 부딪치는 것보다 더 똑똑한 로봇으로 교체하는 것이 낫습니다.

결론

이 논문은 AI의 세계에서 "저렴함"이 항상 저렴한 것은 아니라는 점을 보여줍니다. 만약 모델이 실패하여 계속 재시도를 해야 할 가능성이 높다면, 그것은 비싸고 비효효율적이 됩니다. 모델이 얼마나 막힐 가능성이 있는지(엔트로피를 통한 "직감 테스트")를 측정하고, 더 똑똑한 모델으로 전환할 때 새롭게 시작함으로써, 우리는 돈을 아끼고 더 나은 답변을 얻을 수 있습니다.

저자들은 특정 수학 및 상식 데이터셋을 통한 테스트를 바탕으로 이 결과에 자신감을 보이고 있습니다. 이 방식이 추론 작업에는 매우 효과적이지만, 더 개방적인 대화나 도구 활용에 어떻게 적용할지는 여전히 풀어야 할 숙제라고 제안합니다. 하지만 현재로서는, 약간의 스마트한 계획이 AI 예산이 통제 불능으로 치솟는 것을 막는 데 얼마나 큰 도움이 되는지를 입증해 냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →