← 최신 논문
🤖 AI

AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?

이 논문은 에이전트 워크플로우에서 소규모 오픈가중치 모델이 대부분의 일상적이고 단기간의 도구 사용 작업을 효과적으로 처리할 수 있음을 보여주는 계층형 벤치마크인 AgentFloor를 소개하며, 복잡한 장기 계획에는 대형 최첨단 모델을만 reserved 하고 전체적인 성능은 유지하면서 비용을 절감하는 방식을 제시합니다.

원저자: Ranit Karmakar, Jayita Chatterjee

게시일 2026-05-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ranit Karmakar, Jayita Chatterjee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

배송 회사가 바쁘게 운영된다고 상상해 보세요. 고객이 주문을 할 때마다 시스템은 수십 가지의 미세한 결정을 내려야 합니다. "주소를 확인하세요", "가격을 조회하세요", "창고에 전화를 걸어요", "라벨을 인쇄하세요" 같은 결정들입니다.

오랫동안의 규칙은 다음과 같았습니다: "매번의 단일 결정마다 가장 비싸고, 초지능적인 CEO 를 활용하세요." "주소를 확인하세요" 같은 간단한 작업조차도 CEO 를 고용해야 했습니다. 이는 작동하지만 천문학적인 비용이 들고 시간이 매우 오래 걸립니다.

AgentFloor라는 논문은 단순한 질문을 던집니다: 진짜로 모든 단일 작업에 CEO 가 필요한가요? 아니면 일상적인 업무에는 똑똑하고 빠르며 저렴한 인턴을 고용하고, 정말 어려운 문제에만 CEO 를 아껴 쓰는 것은 어떨까요?

이를 규명하기 위해 연구자들은 다양한 AI "근로자"들이 도구를 얼마나 잘 활용할 수 있는지 테스트하도록 설계된 30 단계로 구성된 거대한 장애물 코스(벤치마크) 를 구축했습니다. 그들은 다양한 크기의 16 개 AI 모델 (작은 "인턴"부터 거대한 "CEO"까지) 을 현재 최상위 AI(GPT-5) 와 비교하여 테스트했습니다.

그들이 발견한 바를 몇 가지 간단한 비유를 통해 설명해 드리겠습니다.

1. 난이도의 "사다리"

연구자들은 작업을 6 단의 사다리로 정리했습니다. 위로 올라갈수록 업무는 더 어려워집니다.

  • 1 단과 2 단 (지상층): 간단한 지시와 단일 도구 사용 (예: 전화번호 조회).
  • 3 단과 4 단 (중간층): 두 가지 도구를 연결하거나 결과에 기반하여 결정 내리기 (예: "가격이 높으면 관리자에게 전화하세요").
  • 5 단과 6 단 (정상): 장시간 규칙을 기억하고 길을 잃지 않고 여러 단계를 조율해야 하는 복잡한 계획 수립.

2. 결과: 누가 무엇을 오를 수 있는가?

이 연구는 작은 모델들이 더 이상 업무를 수행하지 못하는 명확한 "바닥"을 드러냈습니다.

  • 지상층 (1 단과 2 단): 작고 저렴한 모델들 ("인턴") 은 실제로 비싼 CEO 보다 더 좋거나 그와同等합니다. 그들은 간단한 지시를 따르고 단일 도구를 완벽하게 사용할 수 있습니다. 실제로 작은 모델들은 매우 빠르고 저렴하여 비용은 15 배 적게 들면서 속도는 2.5 배 더 빠르다는 같은 양의 작업을 수행할 수 있었습니다.
  • 중간층 (3 단과 4 단): 작은 모델들은 여전히 훌륭한 성과를 내고 있습니다. 그들은 CEO 의 성능과 매우 근접합니다. 연구는 100% 통계적 확실성으로 그들이 정확히 동등하다고 말할 수는 없었지만, 유용할 정도로 충분히 근접했습니다.
  • 정상 (5 단과 6 단): 여기서 격차가 나타납니다. 작업이 장기적인 계획 수립과 동시에 많은 규칙을 기억하는 것을 요구할 때, 작은 모델들은 비틀거리기 시작합니다. 그들은 혼란을 겪거나, "단계"를 다 써버리거나 (달리는 선수가 지치는 것처럼), 존재하지 않는 도구를 만들어내기 시작합니다. 거대한 CEO(GPT-5) 는 여전히 여기서 더 낫지만, CEO 라도 완벽하지는 않습니다. 가장 어려운 작업에서 여전히 상당히 자주 실패합니다.

3. "마법의 해결책"은 작동하지 않았다

연구자들은 작은 모델들이 더 높은 단계를 오를 수 있도록 돕기 위해 "요약지"(특별한 프롬프트) 를 제공해 보았습니다. 이것이 그들을 CEO 만큼 똑똑하게 만들기를 바랐습니다.

  • 결과: 그것은 보편적으로 작동하지 않았습니다. 특정 모델을 돕는 트릭이 때로는 다른 모델을 더 나쁘게 만들기도 했습니다. 마치 마라톤 선수에게 특정 조깅화를 주는 것과 같습니다. 그 선수는 도움이 될지 모르지만, 다른 사람을 넘어뜨릴 수도 있습니다. 복잡한 계획 수립을 위해 작은 모델을 즉시 거대한 모델만큼 똑똑하게 만들어 주는 단일 "마법 버튼"은 존재하지 않습니다.

4. 핵심 교훈: "스마트 라우팅" 전략

이 논문은 라우팅이라고 부르는 AI 시스템을 구축하는 새로운 방식을 제안합니다.

비싸고 느리며 초지능적인 AI 를 모든 것에 사용하는 대신, 똑똑한 관리자처럼 행동하는 시스템을 구축해야 합니다.

  1. 쉬운 일상적인 업무(데이터 확인, 간단한 조회) 는 작고 저렴한 모델에게 보내세요. 그들은 빠르고 저렴하며 이 작업에 있어서는 그다지 못하지 않습니다.
  2. 깊은 계획 수립과 장기 기억이 필요한 드물고 복잡한 업무에만 비싸고 거대한 AI를 아껴 사용하세요.

결론

식료품점에 가는 데 페라리가 필요하지 않습니다. 그 여행에는 신뢰할 수 있는 자전거가 더 빠르고 저렴합니다.

이 논문은 방대한 양의 "일상적인" AI 작업 (데이터베이스 확인이나 단일 도구 사용 등) 에 대해서는 작은 오픈소스 모델들이 이미 충분히 훌륭하다는 것을 증명합니다. 여러분은 매우 복잡한 계획 수립의 최상위 계층에만 거대하고 비싼 "프런티어" 모델이 필요할 뿐이며, 그 경우에도 아직 완벽하지는 않습니다.

올바른 "근로자"를 올바른 업무에 배치함으로써 기업들은 품질을 잃지 않으면서 막대한 비용을 절감하고 시스템을 가속화할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →