← 최신 논문
💻 computer science

ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation

ClawTrace 는 비용 인식 추적 플랫폼을 도입하여 CostCraft 증류 파이프라인을 가능하게 하는 상세한 TraceCards 를 생성함으로써, 성공적인 행동을 유지하면서 비싸고 불필요한 단계를 표적적으로 제거하여 LLM 에이전트 비용을 32% 효과적으로 절감합니다.

원저자: Boqin Yuan, Renchu Song, Yue Su, Sen Yang, Jing Qin

게시일 2026-04-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Boqin Yuan, Renchu Song, Yue Su, Sen Yang, Jing Qin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 비싼 로봇 보조원 (LLM 에이전트) 이 스프레드시트 정리나 코드 작성과 같은 복잡한 문제를 해결하려 한다고 상상해 보세요. 때로는 이 로봇이 일을 완벽하게 처리하기도 하지만, 다른 경우에는 실패하거나 매우 비효율적인 경로를 택해 매 단계마다 돈을 낭비하기도 합니다.

이 논문은 로봇의 두뇌를 재학습시키지 않고도 이 로봇을 더 똑똑하고 저렴하게 만드는 새로운 시스템인 ClawTrace와 방법론인 CostCraft를 소개합니다.

간단한 비유를 사용하여 내용을 정리해 보겠습니다:

1. 문제: "눈먼" 교사

시험지를 보고 학생의 학습 습관을 개선하려는 교사를 상상해 보세요.

  • 기존 방법: 교사는 학생이 'A'를 받았는지 'F'를 받았는지만 봅니다.
    • 학생이 'A'를 받으면, 교사는 "잘했어, 지금과 똑같이 계속해!"라고 말합니다.
    • 학생이 'F'를 받으면, 교사는 "이 실수를 고쳐"라고 말합니다.
  • 결함: 이는 위험합니다.
    • 시나리오 A: 학생이 'A'를 받았지만, 1 시간짜리 시험을 위해 10 시간을 공부했습니다. 기존 교사는 결과가 좋았으므로 "계속해!"라고 말합니다. 학생은 시간을 낭비하며 계속합니다.
    • 시나리오 B: 학생이 이름을 쓰지 않아 'F'를 받았습니다. 교사는 "이름을 고쳐"라고 말합니다. 하지만 아마도 학생은 잘못된 수학 문제 해결에 5 시간을 낭비했을 수도 있습니다. 교사는 최종 성적만 보았기 때문에 그 낭비를 놓칩니다.

이 논문은 기존 AI 학습 도구들이 바로 이런 "눈먼" 교사라고 주장합니다. 이러한 도구들은 AI 가 성공했는지 실패했는지는 알지만, 각 단계가 얼마나 비용 (시간과 돈) 이 들었는지는 모릅니다. 그 비용 신호가 없으면 AI 는 비싸고 쓸모없는 단계를 제거하는 법을 배울 수 없습니다.

2. 해결책: "영수증" (ClawTrace)

저자들은 ClawTrace라는 도구를 개발했습니다. 이는 로봇의 두뇌를 위한 초정밀 영수증 프린터라고 생각하면 됩니다.

  • 로봇이 두뇌 (LLM 호출) 와 대화할 때마다, 도구 (파일 열기 등) 를 사용할 때마다, 또는 보조 로봇을 생성할 때마다 ClawTrace 가 이를 기록합니다.
  • 단순히 "작업 완료"라고 말하는 것이 아니라, 다음과 같은 TraceCard(간단한 요약) 를 출력합니다:
    • "단계 1: 파일 읽기. 비용: $0.02."
    • "단계 2: 같은 파일을 다시 읽기. 비용: $0.02. 중복!"
    • "단계 3: 답변 작성. 비용: $0.01."
  • 이 영수증은 간결하고 읽기 쉬워, 전체 messy 한 대화 기록 없이도 다른 시스템들이 해당 "영수증"을 분석할 수 있게 합니다.

3. 교사: CostCraft(세 가지 행동 시스템)

이러한 "영수증"을 사용하여 CostCraft라는 새로운 증류 파이프라인이 로봇을 위한 일련의 규칙 ("기술") 을 생성합니다. 이는 세 가지 구체적인 유형의 조언을 제공하는 코치처럼 행동합니다:

  1. 보존 (Keep Doing 규칙):
    • 비유: "A 를 받았고, 이 특정 일을 올바르게 했어. 계속해."
    • 출처: 성공적인 실행에서 가져옴.
  2. 제거 (Cut the Fat 규칙):
    • 비유: "A 를 받았지만, 같은 파일을 두 번 읽는 데 $5 를 낭비했어. 다음엔 한 번만 읽고 나머지는 아껴. 성적이 떨어지지는 않지만 돈을 아낄 수 있어."
    • 출처: 비싸고 불필요한 단계가 포함된 성공적인 실행에서 가져옴. 이것이 이 논문의 주요 혁신입니다.
  3. 수리 (Fix the Mistake 규칙):
    • 비유: "수학을 확인하지 않아서 실패했어. 다음엔 제출하기 전에 수학을 두 번 확인해."
    • 출처: 실패한 실행에서 가져오며, 정답을 확인하기 위한 "치트 시트 (oracle)"를 사용합니다.

4. 결과: 무슨 일이 일어났나요?

연구자들은 이 방법을 스프레드시트 작업 30 개 (로봇을 위한 수학 시험과 같음) 로 테스트했습니다.

  • 비용의 중요성: 영수증에서 "비용" 정보를 제거했을 때, 로봇은 비싼 실수를 하기 시작했습니다. 어떤 단계가 낭비적인지 알지 못해 아예 작동을 멈추거나 쓰레기 같은 결과를 내놓았습니다.
  • "제거"의 놀라운 발견: 가장 흥미로운 발견은 제거 규칙에 관한 것이었습니다.
    • 연구자들은 이 규칙이 단순히 돈을 아끼는 데 그칠 것이라고 생각했습니다.
    • 현실: 실제로는 로봇의 성능을 구했습니다. "제거" 규칙을 제거했을 때 로봇의 실패율이 훨씬 더 높아졌습니다.
    • 이유는? 로봇이 낭비할 수 있게 허용되면 (파일을 두 번 읽거나 불필요한 것을 확인하는 등), 종종 혼란을 겪고 최종 답변을 작성하는 것을 잊어버립니다. "제거" 규칙은 로봇이 추락하지 않도록 집중하게 만드는 가드레일 역할을 합니다.
  • 크로스 벤치마크 테스트: 스프레드시트에서 배운 규칙을 코드 작성이나 문서 분석과 같이 완전히 다른 작업에 적용해 보았습니다.
    • "제거" 규칙(낭비 제거)은 모든 곳에서 훌륭하게 작동했습니다. 관련 없는 작업에서도 돈을 절약했습니다.
    • "보존" 규칙(특정 습관 유지)은 새로운 작업에서는 오히려 상황을 악화시켰습니다. 이유는 로봇이 스프레드시트에 특화된 습관 (특정 포맷팅 스타일 등) 을 배웠기 때문인데, 이는 코딩에는 맞지 않기 때문입니다.

요약

이 논문은 AI 에이전트를 효율적으로 가르치려면 최종 성적 (성공/실패) 만 보면 안 된다고 주장합니다. 대신 각 단계가 얼마나 비용이 들었는지 정확히 보여주는 영수증(ClawTrace) 이 필요합니다.

이 영수증을 사용하면 AI 에게 세 가지를 가르칠 수 있습니다:

  1. 작동하는 것은 유지합니다.
  2. 비싸지만 쓸모없는 것은 잘라냅니다(놀랍게도 이는 AI 가 길을 잃지 않도록 도와줍니다).
  3. 고장 난 것은 수리합니다.

비용을 알지 못하면 AI 는 "비싸고" "서투른" 학습을 하게 되어, 단순히 시간을 낭비하지 않았더라면 쉽게 해결했을 작업을 실패하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →