Joint Optimization of Tool Creation and Use for Large Language Model Agents
이 논문은 다축 보상을 사용하여 단일 정책 내에서 도구 생성과 사용을 공동으로 최적화함으로써, 4B 모델이 시각적 또는 표 형식의 학습 데이터 없이도 더 큰 규모의 베이스라인 모델들을 능가하고 다양한 작업에 걸쳐 도구 증강 추론을 크게 개선할 수 있도록 하는 강화 학습 프레임워크인 SMITH를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인류의 진보는 항상 우리가 만드는 도구에 의존해 왔습니다. 새로운 문제를 매번 처음부터 해결하기보다는, 단순한 지레에서부터 현대 세계를 움직이는 복잡한 소프트웨어에 이르기까지 세대를 거쳐 정교해진 도구들에 의존합니다. 인간의 언어를 이해하고 생성할 수 있는 고급 컴퓨터 프로그램인 대규모 언어 모델 또한 유사한 한계에 직면해 있습니다. 이들은 내부 메모리에 방대한 양의 정보를 저장하고 있지만, 정확한 계산, 최신 사실에 대한 접근, 또는 신뢰할 수 있는 논리적 추론을 요구하는 작업에는 어려움을 겪습니다. 이를 극려하기 위해 연구자들은 이 모델들이 어려운 수학 문제를 풀기 위해 계산기를 집어 드는 사람처럼, 계산기나 검색 엔진과 같은 외부 도구를 사용하도록 가르쳤습니다. 그러나 현재의 시스템은 인간이 이미 작성하여 제공한 도구만을 사용할 수 있다는 점에서 한계가 있습니다. 만약 인간이 새로운 작업을 위한 특정 도구를 만들지 않았다면, 모델은 갇혀버리게 됩니다.
이러한 한계는 더 역동적인 접근 방식, 즉 모델에게 스스로 도구를 만들도록 가르치는 방향으로의 변화를 촉발했습니다. 아이디어는 모델이 문제를 보고, 이를 해결하기 위한 작은 코드 조각을 작성한 다음, 그 코드를 사용하여 답을 찾는 것입니다. 하지만 이를 수행하는 기존 방식에는 근본적인 결함이 있습니다. 일반적으로 강력하고 비싼 모델이 도구를 작성하고, 더 약한 모델이 그것을 사용하는 방식을 취합니다. 도구를 작성하는 모델은 스스로 그 도구를 사용할 필요가 없기 때문에, 실제로 명확하고 신뢰할 수 있으며 호출하기 쉬운 도구를 작성해야 할 동기가 없습니다. 이는 마치 망치를 만드는 목수가 직접 망치를 휘둘러볼 일이 없다면, 손잡이가 너무 미끄럽거나 머리 부분이 너무 무거운 망치를 만들 수도 있는 것과 같습니다. 설계가 잘못되었을 때 따르는 결과를 직접 경험하지 않기 때문입니다.
한 연구팀은 이러한 단절을 해결하기 위해 SMITH라고 불리는 새로운 프레임워크를 도입했습니다. 핵심 혁신은 단일 모델이 도구 제작자와 도구 사용자 모두의 역할을 하도록 강제하는 훈련 방법입니다. 이 시스템에서 모델은 일련의 예시 문제들을 부여받고, 코드 조각과 사용법에 대한 명확한 설명을 포함하는 도구를 작성하도록 요청받습니다. 그 직후, 동일한 모델은 그 정확한 도구를 사용하여 다른 미지의 문제를 해결해야 합니다. 만약 설명이 혼란스럽거나 코드가 고장 났다면, 모델은 문제를 해결하는 데 실패하게 되며, 이는 개선이 필요하다는 명확한 신호를 받게 됨을 의미합니다. 이를 통해 모델은 도구가란 그것을 사용하는 자기 자신에 의해 사용될 수 있을 때만큼 가치 있다는 것을 배우는 직접적인 피드백 루프가 형성됩니다.
연구진은 이 접근 방식을 40억 개의 파라미터를 가진 모델을 사용하여 테스트했는데, 이는 이 분야에서 흔히 사용되는 거대 모델들에 비하면 상대적으로 작은 크기입니다. 그들은 이 모델을 산술 퍼즐부터 논리 게임에 이르는 13가지 유형의 추론 작업에 대해 훈련시켰습니다. 결과는 놀라웠습니다. 훈련된 모델은 한 번도 본 적 없는 문제들에 대해 높은 정확도를 달ol 달성했으며, 복잡한 인간 설계 지침에 의존하거나 단순히 사용 시점에 도구를 작성하도록 유도하는 더 큰 모델들보다 뛰어난 성능을 보였습니다. 실제로 이 방식으로 훈련된 작은 모델은 새로운 작업을 위한 도구를 만드는 데 있어, 단순히 도구를 작성하도록 프롬프트를 준 300억 개의 파라미터를 가진 미학습 모델보다 더 나은 성능을 보였습니다. 이는 도구를 만드는 법을 배우는 능력이 단순히 더 많은 양의 원시 메모리를 보유하는 것보다 더 중요하다는 점을 시사합니다.
아마도 가장 놀라운 발견은 이 스스로 만든 도구들이 다른 모델로 어떻게 전이되는가 하는 점이었을 것입니다. 작고 훈련된 모델이 작성한 도구들은 3억 5천만 개의 파라미터만을 가진 훨씬 작은 모델이 훨씬 더 큰 미학습 모델만큼의 성능을 낼 수 있도록 도왔습니다. 반대로, 작은 모델이 작성한 도구가 매우 큰 모델에 주어졌을 때, 그 큰 모델은 스스로 도구를 작성하려고 할 때보다 더 나은 성능을 보였습니다. 이는 SMITH 프레임워크가 생성한 도구들이 특정 모델만을 위한 속임수가 아니라, 진정으로 고품질이며 재사용 가능하다는 것을 나타냅니다. 이 도구들은 매우 효과적이어서, 모델이 표(table)나 이미지와 관련된 데이터로 훈련되지 않았음에도 불구하고 복잡한 표를 해석하거나 이미지에 관한 질문에 답하는 것과 같은 완전히 새로운 유형의 문제에서도 성능을 향상시켰습니다.
또한 이 연구는 학습 과정이 어떻게 구조화되어야 하는지의 중요성을 밝혀냈습니다. 연구진은 단순히 모델에게 코드를 작성하라고 요청하는 것만으로는 부족하며, 모델이 도구의 설명이 코드와 일치하는지, 그리고 도구가 호출될 때 실제로 작동하는지에 따라 평가받아야 한다는 것을 발견했습니다. 품질의 서로 다른 측면을 분리하고 모델이 각 항목을 제대로 수행했을 때 보상을 줌으로써, 시스템은 모델이 보기에는 좋아 보이지만 사용할 수 없는 코드를 작성하거나, 설명은 명확하지만 코드와 일치하지 않는 경우와 같은 흔한 함정을 피하게 합니다. 이러한 세심한 균형 잡기는 모델이 견고한 기술, 즉 정확하면서도 사용 가능한 도구를 만드는 능력을 배우게 해주었습니다.
결국, 이 연구는 더 유능한 인공지능으로 가는 길이 더 큰 모델을 만드는 것이 아니라, 모델이 자신의 능력을 더 잘 구축하도록 가르치는 데 있음을 보여줍니다. 생성과 사용 사이의 루프를 닫음으로써, 연구진은 모델이 스스로 사용하기에 충분히 신뢰할 수 있는 도구를 설계할 수 있음을 입증했습니다. 이 접근 방식은 인공지능의 능력을 확장하는 확장 가능한 방법을 제시하며, 인간이 도구를 제공하기를 기다리는 대신, 모델이 필요한 특정 도구를 직접 만들어냄으로써 새로운 도전에 적응할 수 있게 합니다. 이 연구 결과는 도구가 보강된 지능의 미래가 미리 만들어진 정적인 도구 라이브러리에 있는 것이 아니라, 모델이 스스로 해결책을 만들어내는 역동적이고 자기 개선적인 능력에 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.