How Many Tools Should an LLM Agent See? A Chance-Corrected Answer
본 논문은 LLM 에이전트에게 제시되는 도구의 수를 동적으로 최적화하기 위해 무작위 보정 지표인 비트-오버-랜덤 (BoR) 을 소개하며, 강화 학습을 통해 다양한 벤치마크에서 고정 크기 접근법보다 적응형 단축 목록이 도구 선택 정확도와 커버리지를 크게 향상시킨다는 것을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 특정 요리를 하려는 셰프 (AI 에이전트) 라고 상상해 보세요. 당신은 수천 가지의 재료 (도구) 가 들어 있는 거대한 식료품 저장고 (도구 레지스트리) 를 가지고 있습니다. 요리를 시작하기 전에, 수석 셰프 (검색 시스템) 가 당신에게 어떤 재료를 건네줄지 결정해야 합니다.
이 논문이 제기하는 핵심 질문은 다음과 같습니다: 수석 셰프는 당신의 조리대에 몇 가지 재료를 올려야 할까요?
- 너무 많은 재료를 건네면: 당신은 압도당하고 혼란스러워지며, 잘못된 향신료를 집어 들 수 있습니다.
- 너무 적은 재료를 건네면: 실제로 필요한 특정 재료가 없을 수 있어 요리가 실패할 수 있습니다.
오늘날 대부분의 주방은 고정된 규칙을 사용합니다: "요리의 난이도와 상관없이 셰프에게 항상 정확히 5 가지 재료를 건네라." 이 논문은 이것이 나쁜 아이디어라고 주장하며, 더 똑똑하고 스스로 조정하는 시스템을 제안합니다.
다음은 그들의 해결책을 간단한 비유로 설명한 것입니다:
1. "고정된 규칙"의 문제점
특정 책 한 권을 찾아야 하는 도서관을 상상해 보세요.
- 고정된 규칙: 사서는 항상 당신에게 책 5 권을 한 무더기로 건넙니다.
- 쉬운 질문: 당신이 "사과"에 관한 책이 필요했습니다. 사서는 5 권을 건네고, 첫 번째 책이 사과에 관한 것입니다. 훌륭합니다! 하지만 나머지 4 권을 읽느라 시간을 낭비했습니다.
- 어려운 질문: 당신이 "18 세기의 희귀 버섯"에 관한 책이 필요했습니다. 사서는 5 권을 건네지만, 정답은 도서관의 12 번째 책에 있습니다. 당신은 올바른 책을 0 권 얻습니다.
이 논문은 사서가 얼마나 많은 책을 건네주는지뿐만 아니라, 무작위로 책을 집어 올 때보다 얼마나 더 잘하는지로 그 성과를 측정할 수 있는 방법이 필요하다고 말합니다.
2. 해결책: "무작위 대비 비트 (Bits-over-Random, BoR)"
저자들은 **Bits-over-Random (BoR)**이라는 지표를 도입했습니다. 이를 "운의 점수"라고 생각하세요.
- 무작위 기준: 사서가 선반에서 눈을 감고 책을 무작위로 집어 올렸을 때, 올바른 책을 찾을 확률은 얼마일까요?
- BoR 점수: 이는 사서가 그 무작위 운에 비해 얼마나 더 잘하고 있는지를 측정합니다.
- 사서가 책 1 권을 건네고 그것이 정답이라면, 이는 큰 승리입니다 (무작위 확률로 1 번 만에 정답을 찾을 가능성은 매우 낮기 때문입니다).
- 사서가 책 100 권을 건네고 그중에 정답이 있다면, 이는 더 작은 승리입니다 (무작위 확률로도 100 번 시도하면 정답을 찾을 가능성이 높기 때문입니다).
마법의 트릭: 이 논문은 이 "운의 점수"를 학습 로봇 (강화학습 에이전트) 에 대한 보상으로 사용합니다.
- 로봇이 일찍 멈추고 도구를 찾으면, 큰 보상을 받습니다 (확률을 쉽게 이겼기 때문입니다).
- 로봇이 목록에 더 많은 도구를 추가하면, 보상은 자연스럽게 줄어듭니다 (큰 더미에서 도구를 찾는 것은 덜 인상적이기 때문입니다. 운을 더 쉽게 볼 수 있기 때문입니다).
이는 로봇이 "5 개에서 멈추라"고 인간이 알려주지 않아도, 올바른 도구를 찾았다는 확신이 생기면 도구 추가를 멈추도록 학습하게 한다는 뜻입니다.
3. 결과: 똑똑한 수석 셰프
연구진은 이 "똑똑한 수석 셰프"를 세 가지 다른 테스트 주방에서 "고정된 규칙" (항상 도구 5 개) 과 비교하여 테스트했습니다:
작은 주방 (BFCL - 도구 370 개):
- 고정된 규칙: 안전을 위해 항상 도구 50 개를 보여줍니다. 올바른 도구를 찾을 확률은 90.8% 입니다.
- 똑똑한 셰프: 평균적으로 도구 7 개만 보여줍니다. 여전히 올바른 도구를 **90.3%**의 확률로 찾습니다.
- 결과: 똑똑한 셰프는 성공률에 거의 손실 없이 "조리대 공간" (토큰) 을 대폭 절약합니다.
거대한 창고 (ToolBench - 도구 3,251 개):
- 고정된 규칙: 항상 도구 5 개를 보여줍니다. 올바른 도구를 찾을 확률은 64.7% 입니다.
- 똑똑한 셰프: 평균적으로 약 4.4 개의 도구를 보여줍니다. 도구를 찾을 확률은 61.9% 입니다.
- 반전: 매우 어려운 질문 (올바른 도구가 창고 깊숙이 숨겨져 있는 경우) 에서는 고정된 규칙이 **0%**만 찾습니다. 반면, 똑똑한 셰프는 처음 몇 개의 도구가 작동하지 않는다는 것을 깨닫고 조금 더 깊이 파고들어서 (5.7 개의 도구를 보여줌) 그 어려운 질문 중 **16.7%**를 찾습니다. 고정된 규칙은 너무 일찍 포기합니다.
4. 왜 적은 것이 더 많은가 ("난잡함" 효과)
이 논문은 AI 가 실제로 도구를 선택할 때 어떤 일이 일어나는지도 테스트했습니다.
- 발견: AI 에게 도구 목록이 매우 많을 때 (예: 50 개), AI 는 혼란을 겪고 잘못된 것을 더 자주 선택합니다.
- 비유: 친구에게 "이 50 장의 사진 중 내 개는 어느 것인가요?"라고 물으면, 선택지가 너무 많아서 틀리게 추측할 수 있습니다. 하지만 사진 2 장만 보여준다면, 올바른 것을 선택할 가능성이 훨씬 높습니다.
- 증거: 똑똑한 셰프가 더 적은 도구를 보여줬을 때, AI 는 올바른 도구를 **93.1%**의 확률로 선택했습니다. 반면, 5 개의 도구를 보도록 강요받았을 때 (고정된 규칙), 올바른 선택률은 **87.1%**에 불과했습니다.
요약
이 논문은 AI 에게 보여줄 도구의 수에 대해 "일률적인" 숫자가 필요하지 않음을 증명합니다.
- 구식 방법: "도구 5 개를 보여라." (어려운 작업에는 너무 적고, 쉬운 작업에는 너무 많음).
- 새로운 방법: "운의 점수" (BoR) 를 사용하여 시스템이 성공할 확률이 높아지는 순간 도구 추가를 멈추도록 학습시킵니다.
- 이점: 컴퓨팅 파워를 절약하고, AI 의 혼란을 줄이며, 고정된 규칙이 놓치는 어려운 질문에서 올바른 답을 찾는 데 실제로 도움이 됩니다.
저자들은 이 아이디어를 테스트하기 위해 완전한 생산 시스템이 아닌 간단한 "프로브" 로봇을 구축했지만, 그 결과는 AI 에게 고정된 양을 보게 하는 것보다 AI 가 얼마나 찾아봐야 할지 스스로 결정하게 하는 것이 훨씬 더 똑똑함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.