← 최신 논문
💻 computer science

Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost

본 논문은 소규모 파인튜닝 모델의 가중치에 직접 에이전트 워크플로우를 컴파일하는 것("지하 에이전트")이 기존 외부 오케스트레이션 프레임워크에 비해 비용 효율적이고 사생활이 보호되며 컨텍스트 효율적인 대안을 제공하여 다양한 복잡한 작업에서 최첨단 수준의 품질을 달성하면서도 주요 채택 장벽을 극복한다고 주장한다.

원저자: Simon Dennis, Rivaan Patil, Kevin Shabahang, Hao Guo

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Simon Dennis, Rivaan Patil, Kevin Shabahang, Hao Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.

핵심 아이디어: 조리법을 셰프의 뇌에 굽기

복잡한 작업을 처리해야 한다고 상상해 보세요. 예를 들어 복잡한 여행을 예약하거나 고장 난 기계를 수리하는 경우입니다. 현재 대부분의 기업은"관리자와 작업자"시스템 (에이전트 오케스트레이션이라고 함) 을 사용합니다.

  • 현재 방식 (관리자): 매우 똑똑하고 비싼"관리자"(최첨단 AI 모델) 가 있습니다. '작업자'(사용자와 대화하는 AI) 가 결정을 내려야 할 때마다 관리자는 멈추고 거대한 규칙책을 읽은 후 작업자에게 다음에 무엇을 해야 하는지 지시한 다음 작업자의 답변을 기다립니다. 이 과정이 반복됩니다. 이는 느리고 비싸며, 관리자는 매번 규칙책 전체를 읽어야 합니다.
  • 새로운 방식 (지하 에이전트): 저자들은 다른 접근법을 제안합니다: 절차를 가중치에 컴파일하세요. 거대한 규칙책을 작업자의 뇌에 직접 굽는다고 상상해 보세요. 이제 작업자 자체가 전문가가 됩니다. 다음에 무엇을 해야 할지 관리자에게 지시를 받을 필요가 없으며, 흐름을 자연스럽게 알고 있습니다. 그들은 내부에서 외부로 작동하는 전문가인"지하 에이전트"가 됩니다.

이 논문은 다음과 같은 질문을 던집니다: 규칙을 작고 저렴한 AI 에 굽는 것이 거대하고 비싼 관리자를 사용하는 것과 실제로 동일한 효과를 낼 수 있을까요?

세 가지 장벽 (그리고 그들이 어떻게 극복했는지)

저자들은 사람들이 이를 수행하지 않는 이유가 세 가지 큰 두려움 때문이라고 생각했습니다. 그들은 여행 예약, Zoom 기술 지원, 보험 청구라는 세 가지 실제 시나리오에서 이러한 두려움을 테스트했습니다.

1. 품질에 대한 두려움:"작은 뇌가 큰 뇌만큼 똑똑할 수 있을까?"

  • 두려움: 사람들은 30 억 또는 80 억 개의 파라미터를 가진 작고 저렴한 AI 가 빅테크 기업에서 사용하는 거대하고 비싼 AI 만큼 복잡한 단계를 처리할 수 없다고 생각했습니다.
  • 결과: 놀랍게도 작은 AI 는 큰 AI 와 거의 동일한 성과를 냈습니다.
    • 여행 분야에서는 작은 AI 가 큰 AI 에 비해 약간 덜"정중하거나 우아"했지만, 작업을 올바르게 수행했습니다.
    • Zoom 지원보험(훨씬 더 어려운 분야) 에서는 작은 AI 를 약간 더 큰 버전 (80 억 파라미터) 으로 업그레이드했습니다. 이 버전은 거의 모든 지표에서 거대하고 비싼 AI 와 동일한 수준을 달성했습니다.
    • 비유: 거대하고 유명한 레이싱 팀 (큰 AI) 을 데려오는 대신, 현지에서 경험 많은 정비공 (작은 AI) 을 고용하는 것과 같습니다. 일상적인 자동차 고장을 수리하는 데 있어 현지 정비공은 90~98% 수준으로 훌륭하지만 비용은 그 일부에 불과합니다.

2. 비용에 대한 두려움:"실제로 운영 비용이 더 저렴할까?"

  • 두려움: 사람들은 작은 AI 를 훈련시키는 비용은 저렴할지라도, 컴퓨터 성능 비용을 지불해야 하므로 실행 비용은 여전히 비쌀 것이라고 생각했습니다.
  • 결과: 비용이 압도적으로 저렴합니다.
    • "관리자"시스템은 AI 가 말하는 문장 하나하나마다 매우 비싼 API 를 호출해야 합니다.
    • "굽기"시스템은 표준 컴퓨터 서버 (자체 호스팅) 에서 실행됩니다.
    • 수학: 새로운 방법은 대화당 128 배에서 462 배까지 저렴합니다.
    • 비유: 기존 방식은 택시 기사에게 핸들을 돌릴 때마다 50 달러를 지불하는 것과 같습니다. 새로운 방식은 1,000 달러에 차를 사서 직접 운전하는 것과 같습니다. 더 많이 운전할수록 (작업이 복잡해질수록) 더 많은 돈을 절약할 수 있습니다.

3. 유연성에 대한 두려움:"규칙이 바뀌면 어떻게 될까? 몇 달 동안 재훈련해야 하나?"

  • 두려움: 사람들은 보험 회사가 양식을 변경하거나 여행사가 정책을 변경하면 AI 를 재훈련하는 데 몇 주가 걸릴 것이라고 생각했습니다.
  • 결과: 빠릅니다.
    • 규칙을 변경하고 AI 를 재훈련하는 데 표준 하드웨어에서 30 분에서 50 분이 소요됩니다.
    • 비유: 집을 처음부터 다시 짓는 것이 아니라 스마트폰의 소프트웨어를 업데이트하는 것과 같습니다. 한 주전자를 끓이는 시간 안에 완료할 수 있습니다.

작동 원리 ("지하"파이프라인)

이 과정은 놀랍도록 단순합니다:

  1. 지도 그리기: 대화가 어떻게 흘러가야 하는지 흐름도를 그립니다 (예: "날짜 요청" -> "예산 확인" -> "옵션 표시").
  2. 시뮬레이션 실행: 매우 똑똑한 AI("교사") 가 이 흐름도를 수천 번 반복하여 가짜 대화를 생성합니다.
  3. 뇌 굽기: 작은 AI 에게 이 가짜 대화를 가르칩니다. AI 는 단어뿐만 아니라 대화의 패턴을 학습합니다.
  4. 실전 투입: 작은 AI 를 배포합니다. 더 이상 흐름도가 필요하지 않습니다. 흐름도는 이제 AI 의 기억의 일부가 되었기 때문입니다. AI 는 사용자와 직접 대화합니다.

결론

이 논문은 예약, 지원, 청구와 같이 명확한 단계가 있는 작업의 경우 관리자가 필요하지 않다고 결론 내립니다.

  • 지속적인 구조는 가중치에 속합니다: 게임의 규칙은 AI 의 뇌에 굽혀져야 합니다.
  • 일시적인 상태는 프롬프트에 속합니다: 귀하의 여행이나 귀하의 고장 난 Zoom 통화와 같은 구체적인 세부 사항은 대화 중에 AI 에게 알려야 합니다.

규칙을"관리자"에서"작업자의 뇌"로 이동시킴으로써, 규칙을 1 시간 이내에 업데이트할 수 있는 능력을 갖추면서 두 자릿수 (100 배) 적은 비용으로 거의 완벽한 품질을 얻을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →