← 최신 논문
🤖 AI

MAVEN: Improving Generalization in Agentic Tool Calling

이 논문은 구조화된 분해, 적응형 오케스트레이션, 중간 검증을 가능하게 함으로써 에이전트 도구 호출의 일반화와 엔드 투 엔드 작업 성공률을 크게 향면시키는 경량 기호 추론 스캐폴드인 MAVEN을 소개하며, 이는 MAVEN이 폐쇄형 시스템과 비교하여 비용 경쟁력을 유지하면서도 새로운 스트레스 테스트 벤치마크에서 오픈 웨이트 모델의 성능을 높이는 능력을 통해 입증되었습니다.

원저자: Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "똑똑하지만 건망증이 있는" 비서

복잡한 퍼즐, 예를 들어 고장 난 자동차 엔진을 수리하거나 어려운 물리 문제를 해결해야 하는 상황에서, 당신은 아주 똑똑하지만 약간 정신없는 비서를 고용했다고 상상해 보세요. 당신은 그들에게 도구 목록(렌치, 계산기, 진단 스캐너)을 줍니다.

현재의 AI 모델들(이 "비서"들)은 매우 똑똑합니다. 단순한 질문을 하면 제대로 대답하죠. 하지만 "엔진을 진단하고, 부품을 교체한 다음, 속도를 테스트하라"와 같은 길고 다단계적인 과업을 시키면 종종 실수를 합니다. 그들은 다음과 같은 실수를 저지를 수 있습니다:

  • 세 단계 전에는 무엇을 했는지 잊어버립니다.
  • 작업에 맞지 않는 도구를 선택합니다.
  • 작은 수학적 오류를 범하고, 그 실수를 바탕으로 계속 작업을 진행하여 결국 전체 답을 틀리게 만듭니다.
  • 자신의 작업 내용을 확인하지 않고 서둘러 결론을 내립니다.

이 논문의 저자들은 이를 일반화(generalization) 능력의 부족이라고 부릅니다. AI는 특정 유형의 퍼즐은 잘 처리할 수 있지만, 규칙이 약간 바뀌거나 작업이 길어지면 무너져 버립니다.

해결책: MAVEN ("프로젝트 매니저"형 스캐폴드)

이를 해결하기 위해 연구진은 MAVEN(Modular Agentic Verification and Execution Network)을 구축했습니다.

MAVEN을 새로운 두뇌가 아니라, AI와 도구 사이에 앉아 있는 매우 체계적인 프로젝트 매니저라고 생각하세요. MAVEN은 스스로 사고하는 것이 아니라, 대신 AI가 엄격하고 안전한 워크플로우를 따르도록 강제합니다.

MAVEN은 공장의 조립 라인처럼 세 가지 간단한 단계로 작동합니다:

  1. 클립보드 (문맥 버퍼링 - Context Buffering): AI가 무엇인가를 하기 전에, MAVEN은 어지러운 대화 내용을 가져와 핵심 사실들을 클립보드에 적습니다. 이는 AI가 목표와 문제의 현재 상태를 기억하도록 보장합니다.
  2. 설계도 (액션 합성 - Action Synthesis): AI가 다음에 무엇을 할지 스스로 추측하게 두는 대신, MAVEN은 문제를 아주 작고 단일한 단계들로 나누도록 강제합니다. MAVEN은 "지금 당장 해야 할 딱 한 가지 구체적인 일은 무엇인가?"라고 묻고, AI가 앞으로 나아가기 전에 필요한 모든 도구를 갖추었는지 확인합니다.
  3. 안전 검사관 (호출 및 검증 - Invocation & Verification): 이것이 가장 중요한 부분입니다. AI가 도구(예: 계산기)를 사용하기 전에, MAV면은 AI를 멈춰 세워 "잠깐, 내가 계산을 확인했나? 이게 맞는 도구인가?"라고 말하게 합니다. 만약 AI가 실수를 하면, MAVEN은 오류가 쌓이도록 내버려 두는 대신 즉시 잡아내어 "다시 해봐"라고 말합니다.

테스트: MAVEN-Bench ("스트레스 테스트" 시험)

이 아이디어가 효과가 있다는 것을 증명하기 위해, 팀은 MAVEN-Bench라는 새로운 시험을 만들었습니다.

표준적인 AI 벤치마크가 AI가 단순히 정답 알파벳을 고르기만 하면 되는 객관식 퀴즈라면, MAVEN-Bench는 실전 장애물 경주와 같습니다.

  • 코스: 많은 단계를 거쳐야 하는 어려운 수학 및 물리 문제들을 사용합니다.
  • 함정: 문제들은 AI를 속이도록 설계되었습니다. 계산기를 망가뜨릴 수 있는 0에 아주 가까운 숫자나 혼란스러운 지시사항 같은 "적대적(adversarial)" 요소들이 포함되어 있습니다.
  • 규칙: AI는 단순히 최종 정답만으로 채점되지 않습니다. 어떻게 그 답에 도달했는지도 채점됩니다. 자신의 작업을 확인했나요? 올바른 도구를 사용했나요? 단계별 기록을 유지했나요?

결과: 작은 두뇌, 큰 개선

연구진은 표준 오픈 소스 AI 모델(GPT-OSS-120b)을 사용하여 MAVEN을 테스트했습니다.

  • MAVEN 없이: AI는 약 **48%**의 확률로 정답을 맞혔습니다. AI는 문제 중간에 길을 잃는 경우가 많았습니다.
  • MAVEN과 함께: 정확도가 **71%**로 급증했습니다.

비유: 수학 시험을 치르는 학생을 상상해 보세요. 튜터(과외 선생님)가 없으면 48점을 받지만, 모든 단계를 적고, 산수를 확인하고, 올바른 공식을 사용하도록 강제하는 튜터(MAVEN)가 있으면 71점까지 올라갑니다.

비용: 연구진은 이러한 개선이 엄청나게 비싸고 거대한 AI 모델을 필요로 하지 않는다는 점에 주목했습니다. 그들은 더 작은 오픈 소스 모델을 사용했음에도 불구하고, 훨씬 더 크고 유료인 독점 모델들과 경쟁할 만한 결과를 얻었으며, 비용은 약 1/10 수준이었습니다.

이것이 왜 중요한가

이 논문은 현재의 AI 테스트 방식에 결함이 있다고 결론짓습니다. 우리는 종-종 최종 결과만 봅니다. 만약 AI가 운 좋게 혹은 추측으로 정답을 맞히면, 우리는 그것이 똑똑하다고 생각합니다.

MAVEN은 만약 우리가 AI에게 과정 인식(process-aware) 능력을 부여한다면—즉, 자신의 작업을 확인하고, 단계를 기억하며, 도구를 검증하게 한다면—AI가 훨씬 더 신뢰할 수 있게 된다는 것을 보여줍니다. 이것은 AI의 순수한 지식 측면에서 "더 똑똑하게" 만드는 것이 아니라, AI가 무너지지 않고 자신이 아는 것을 사용할 수 있는 더 나은 시스템을 제공하는 것에 관한 것입니다.

요약하자면: MAVEN은 AI 비서가 길고 복잡한 산을 오르려 할 때 절벽 아래로 떨어지지 않도록 붙잡아주는 "안전 벨트"입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →