Small Reasoning Models are Instruction Followers in Function Calling
이 논문은 지시 이행형 함수 호출(Instruction-Followed Function Calling, IFFC)을 소개하는데, 이는 추론 중심의 LLM에 대해 네이티브 방식이나 프롬프트 기반 방식보다 양자화 환경에서 더 우수한 정확도와 강건함을 달성하기 위해 함수 호출 로직을 더 작은 지시 이행 모델에 위임하는 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 진화하는 세상에서, 단순히 텍스트를 생성하는 컴퓨터에서 행동을 취할 수 있는 시스템으로의 변화가 일어나고 있습니다. 흔히 "에이전틱(agentic)" 모델이라 불리는 이 새로운 시스템들은 외부 세계에 손을 뻗어 문제를 해결하도록 설계되었습니다. 이들은 질문에 답하기 전 정보를 수집하기 위해 날씨 앱이나 계산기와 같은 도구를 선택하고 사용합니다. 오랫동안 가장 강력하고 비싼 컴퓨터 모델만이 이러한 작업을 수행할 수 있다고 신뢰받아 왔습니다. 이 모델들은 이러한 도구들과 대화하기 위해 '네이티브 함수 호출(native function calling)'이라고 알려진 특정하고 경직된 내부 언어로 구축되었습니다. 그러나 기술이 성숙해짐에 따라, 연구자들은 훨씬 더 작고 효율적인 컴퓨터 모델을 주목하기 시작했습니다. 이 압축된 모델들은 스마트폰이나 노트북 같은 일상적인 기기에서 실행하기 쉬워 프라이버시 보호와 비용 절감 측면에서 유리하지만, 외부 도구를 올바르게 사용하기 위해 요구되는 엄격하고 복잡한 규칙을 따르는 데는 역사적으로 어려움을 겪어 왔습니다.
이란의 대학 연구진은 이 작은 모델들이 이러한 작업을 수행하기 위해 거대 모델들과 동일한 경직된 규칙을 따라야 한다는 가설에 도전했습니다. 최근 연구에서 그들은 작은 모델들이 기술적인 명령 구조를 통하는 대신 단순한 대화를 통해 도구를 사용하도록 요청받을 때 훨씬 더 잘 작동한다는 사실을 발견했습니다. 연구진은 작은 모델이 특정한 기계 코드를 말하도록 강요받을 때보다, 명확한 지침을 따르는 유능한 조수처럼 다뤄질 때 실수가 훨씬 적다는 것을 발견했습니다. 이 통찰력은 작업의 역할을 두 가지 서로 다른 모델로 나누는 새로운 시스템을 만드는 데로 이어졌습니다. 작고 빠른 모델 하나가 결정권자로서 사용자의 말을 듣고 도구가 필요한지 판단합니다. 만약 도구가 필요하다면, 이 작은 모델은 자연어 지침을 사용하여 요청을 처리합니다. 그러면 메인 모델인 더 큰 모델이 그 정보를 받아 사용자에게 전달할 최종 답변을 구성합니다.
연구진은 이 접근 방식을 10억 개의 파라미터(모델의 크기와 복잡성을 측정하는 척도)만큼 적은 수의 다양한 작은 모델들을 사용하여 테스트했습니다. 그들은 이 새로운 방법론을 모델들에게 도구 사용을 가르치는 일반적인 방식과 비교했습니다. 결과는 놀라웠습니다. '지시 준수 함수 호출(Instruction-Followed Function Calling)'이라 명명된 이 새로운 시스템은, 40억 개의 파라미터를 가진 Qwen-3와 같은 더 큰 압축 모델이 일반적으로 골드 스탠다드로 간려지는 GPT-5.2나 Claude 4.5 Sonnet 같은 거대한 독점 모델들을 능가하게 했습니다. 예를 들어, 이 새로운 방법을 사용한 Qwen-3 4B 모델은 어려운 도구 사용 테스트의 비실시간(Non-Live) 평가 하위 집합에서 94.1%의 정확도를 달면서, 기존 방식을 사용한 동일 모델의 성능을 크게 앞질렀습니다. 테스트된 가장 작은 모델(0.6B)은 특정 카테고리에서 매우 큰 독점적 거대 모델들에 뒤처지기도 했지만, 이 프레임워크는 경직된 도구 정의라는 구조적 부담을 제거했을 때 전문화되고 추론 능력을 갖춘 작은 모델들이 거대한 시스템과 대등하거나 이를 능가할 수 있음을 입증했습니다.
그들의 발견 중 핵심적인 부분은 모델이 어떻게 생각하는지를 이해하는 것이었습니다. 연구진은 문제를 해결하기 위해 먼저 "생각"하도록 설계된 모델들이 즉각적인 응답을 생성하는 모델보다 훨씬 더 신뢰할 수 있다는 것을 발견했습니다. 이러한 추론 모델들은 어떤 도구를 사용할지 결정하는 과업을 부여받았을 때, 스스로 실수를 바로잡고 복잡한 지침을 높은 정밀도로 따를 수 있었습니다. 이는 모델이 압축되어 더 작은 기기에서 실행될 때 특히 두드러졌습니다. 보통 모델을 더 작게 만들거나 성능이 낮은 하드웨어에서 실행하면 성능이 급격히 떨어집니다. 그러나 연구진은 새로운 방법이 매우 견고하다는 것을 발견했습니다. 모델을 아주 적은 메모리를 사용하도록 축소하더라도, 자연어 지침 방식을 사용하는 모델들은 높은 정확도를 유지했습니다. 이는 추론하고 대화를 따르는 능력이 경직된 기술적 형식을 암기하는 것보다 도구 사용을 위한 더 안정적인 토대임을 시사합니다.
또한 이 연구는 현재 많은 시스템이 구축되는 방식의 결함을 강조했습니다. 종종 단일한 거대 모델이 사용자를 이해하고, 도구 사용을 결정하고, 최종 답변을 작성하는 모든 일을 수행하도록 요구됩니다. 연구진은 이러한 접근 방식이 모델을 혼란스럽게 만들며, 도구의 복잡한 세부 사항이 대화와 뒤섞이게 만든다는 것을 보여주었습니다. 작업을 분리함으로써 그들의 새로운 시스템은 대화를 깔끔하게 유지합니다. 작은 모델은 어떤 도구를 사용할지 파악하는 무거운 작업을 처리하고, 메인 모델은 오로지 사용자와 대화하는 데 집중합니다. 이러한 분리는 시스템이 너무 많은 정보에 압도당하는 것을 방지합니다. 연구진은 이 방법이 자동차 대시보드나 홈 어시스턴트처럼 속도와 프라이버시가 중요한 실제 시나리오에서도 잘 작동한다는 것을 입증했습니다. 이곳들은 데이터를 먼 곳의 서버로 보내는 것이 불가능한 환경입니다.
궁극적으로 이 연구는 일상적인 기기에서의 인공지능을 향한 새로운 길을 제시합니다. 우리는 복잡한 작업을 수행하기 위해 거대하고 에너지를 많이 소비하는 컴퓨터에 의존할 필요가 없다는 것을 보여줍니다. 대신, 우리가 작은 모델에게 일하는 방식을 바꾸는 것—즉, 코드를 실행하는 기계가 아니라 지침을 따르는 지능적인 조수로 대하는 것—을 통해 매우 정확하면서도 효율적인 결과를 얻을 수 있습니다. 이 발견은 개인적이고 프라이빗하며 반응성이 뛰어난 인공지능의 미래가 더 큰 모델을 만드는 데 있는 것이 아니라, 우리가 이미 가지고 있는 더 작은 모델들을 더 똑똑하게 사용하는 방법에 달려 있음을 나타냅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.