Looped Language Models Improve Compositional Tool Calling
이 논문은 루프형 언어 모델이, 특히 계산량을 동적으로 할당하는 적응형 추론을 채택할 때, 여러 API 호출을 효과적으로 조정하고 상태를 유지하며 의존성을 관리함으로써 구성적 도구 호출 시나리오에서 성능을 크게 향상시킨다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 급변하는 지형 속에서, 단순히 질문에 답하는 모델에서 행동을 취하는 시스템으로의 중대한 변화가 일어나고 있습니다. 흔히 '에이전트'라고 불리는 이 새로운 시스템들은 복잡한 문제를 해결하기 위해 소프트웨어 프로그램이나 데이터베이스와 같은 외부 도구를 사용하도록 설계되었습니다. 단순히 날씨를 알려주는 것을 넘어, 실제로 항공권을 예약하고, 일정을 확인하며, 여행을 확정하기 위해 이메일을 보내는 디지털 비서를 상상해 보십시오. 이러한 에이전트가 작동하려면 여러 단계를 하나로 엮을 수 있어야 하며, 한 작업의 결과를 기억하여 다음 작업에 반영할 수 있어야 합니다. 이는 시스템이 순서를 계획하고, 이를 실행하며, 문제가 발생했을 때 적응하는 일종의 구조화된 사고를 필요로 합니다. 연구자들의 과제는 이러한 대규모 언어 모델이 과정 중간에 길을 잃거나 오류를 범하지 않고, 어떻게 하면 이러한 다단계 워크플로우를 처리할 수 있을 만큼 충분히 신뢰할 수 있게 만드는가였습니다.
케임브리지 대학교의 한 연구팀은 이 문제를 해결하기 위해 '루프형(looped)' 언어 모델로 알려진 설계를 중심으로 특정 아키텍처 접근 방식을 조사했습니다. 입력을 출력으로 한 번에 처리하는 표준 모델과 달리, 이 루프형 모델은 시스템이 최종 답변을 내놓기 전에 내부적인 생각을 여러 번 다시 검토하고 정교화할 수 있도록 허용합니다. 이는 어려운 퍼즐을 푸는 사람이 결승선까지 단숨에 달려가는 대신, 몇 수마다 자신의 작업을 재확인하며 잠시 멈추는 것과 같습니다. 연구진은 이러한 추가적인 생각 시간, 즉 반복적인 정교화 과정이 모델이 여러 API를 올바른 순서로 호출하거나, 한 도구의 출력이 다른 도구의 입력이 되는 의존성을 관리하는 것과 같은 복잡한 도구 사용을 조율하는 능력을 향상시키는지 알고 싶었습니다.
이를 테스트하기 위해 연구팀은 도구 호출 능력을 측정하기 위해 설계된 세 가지 서로 다른 벤치마크를 사용하여 일련의 통제된 실험을 수행했습니다. 이 테스트는 질문에 답하기 위해 단일 함수를 선택하는 것과 같은 간단한 작업부터, 여러 개의 독립적인 호출을 생성하거나 하나의 호출 결과가 다음 호출에 반드시 필요한 중첩된 시퀀스를 관리해야 하는 매우 복잡한 시나리오에 이르기까지 다양했습니다. 그들은 표준 모델을 '네이티브(native)' 루프형 모델(처음부터 이러한 반복 능력을 갖추도록 구축된 모델) 및 기존 표준 모델에 루프 동작을 추가한 '레트로핏(retrofitted)' 모델과 비교했습니다. 연구진은 공정한 비교를 위해 동일한 데이터셋과 최적화 설정으로 모델을 훈련시켜, 루프 메커니즘 자체의 효과만을 분리해 냈습니다.
결과는 모델이 결정을 내리기 위해 생각하는 데 더 많은 시간을 할애하는 것이 복잡한 다단계 작업을 처리하는 능력을 크게 향상시킨다는 것을 시사합니다. 모델이 여러 도구 호출을 조정하거나 그들 사이의 의존성을 관리해야 하는 벤치마크에서, 루프형 모델은 비루프형 모델보다 일관되적으로 우수한 성능을 보였습니다. 이러한 개선은 첫 번째 도구 호출의 출력이 두 번째 호출의 인자로 전달되어야 하는 경우와 같이, 모델이 여러 결정에 걸쳐 구조화된 계획을 유지해야 하는 작업에서 가장 두드러졌습니다. 이러한 시나리오에서 작업에 대한 내부 표현을 정교화하는 능력은 모델이 함수 선택, 인자 그라운딩(argument grounding), 그리고 호출 순서의 오류를 수정할 수 있게 해주었습니다. 예를 들어, 한 관찰 사례에서 모델은 처음에 필수적인 의존성을 인식하지 못했으나, 몇 차례의 내부 정교화 과정을 거친 후 누락된 연결 고리를 성공적으로 식별하고 올로된 일련의 동작을 생성했습니다.
그러나 이러한 이점이 모든 유형의 작업에서 균일하게 나타난 것은 아니었습니다. 작업이 단일하고 고립된 도구 호출을 포함하는 경우, 루프형 방식의 이점은 훨씬 작았으며 특정 모델에 따라 차이가 있었습니다. 이는 추가적인 계산 노력이 단순한 정보 검색보다는 계획과 조정이 필요한 문제에서 가장 가치 있다는 것을 나타냅니다. 연구진은 또한 이 추가적인 생각 시간을 더 효율적으로 사용할 수 있는지 탐구했습니다. 그들은 모델이 멈추기 전까지 몇 번 루프를 돌아야 하는지를 동적으로 결정하도록 함으로써, 고정된 깊은 횟수의 루프를 사용하는 것과 거의 동일한 높은 성능을 달면서도 계산 비용을 현저히 줄일 수 있다는 것을 발견했습니다. 이 적응형 접근 방식은 모델이 어렵고 복잡한 문제에는 더 많은 시간을 할애하고, 간단한 문제에는 빠르게 진행할 수 있음을 의미합니다.
본 연구는 루프형 언어 모델이 더 신뢰할 수 있는 에이전트 시스템을 구축하기 위한 유망한 토대임을 결론짓습니다. 연구 결과는 잠재적 표현(latent representations)을 반복적으로 정교화하는 능력이 모델이 복잡한 워크플로우의 구조를 보존하는 데 도움을 주며, 이를 통해 구성적인 도구 사용을 계획, 조정 및 실행하는 능력을 향적으로 높여준다는 점을 시사합니다. 레트로핏 모델도 개선을 보였지만, 네이티브 루프형 모델이 깊게 중첩된 작업에서 일반적으로 더 나은 성능을 보였는데, 이는 모델이 어떻게 사전 훈련되는지가 이러한 유형의 재귀적 정교화로부터 얼마나 잘 혜택을 받을 수 있는지를 결정한다는 점을 암시합니다. 궁극적으로, 이 연구는 AI 에이전트가 작업의 복잡성에 따라 계산 자원을 동적으로 할당하여, 복잡성이 요구될 때만 더 깊이 생각함으로써 속도와 정확성 사이의 효율적인 균형을 달성하는 미래를 향하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.