← 최신 논문
💬 NLP

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

이 논문은 다양한 추론 및 도구 사용 벤치마크에서 기존 베이스라인 및 더 큰 규모의 독점 모델들을 상회하는 상당한 성능 향상을 달야낸, 다회차 루프 내에서 특화된 플래너를 최적화하기 위해 새로운 Flow-GRPO 알고리즘을 채택한 학습 가능한 인-더-플로우(in-the-flow) 에이전트 프레임워크인 AgentFlow를 소개한다.

원저자: Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

게시일 2026-07-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 똑똑한 로봇에게 미스터리를 해결하는 법을 가르치려 한다고 상상해 보세요. 당신은 단순히 로봇이 추측하기만을 원하는 것이 아니라, 지도를 사용하고, 돋보기를 들고, 계산기를 두드려 진실을 찾아내길 원합니다. 이것이 바로 거대한 언어 모델(LL-LLM)의 세계입니다. LLM은 대화하고 추론할 수 있는, 아주 책을 많이 읽은 거대한 뇌와 같습니다. 최근 과학자들은 이 뇌를 더욱 날카롭게 만드는 방법을 발견했습니다. 바로 연습을 시키는 것입니다. 문제를 해결하게 한 뒤, 맨 마지막에 "잘했어" 또는 "다시 해봐"라는 신호를 주어 그 결과로부터 배우게 하는 방식입니다. 이것을 **강화 학습(Reinforcement Learning)**이라고 부릅니다.

하지만 문제가 하나 있습니다. 문제가 매우 길고 복잡해질 때—예를 들어 스무 개의 단서와 다섯 가지의 서로 다른 도구(검색 엔진, 코드 작성기, 사실 확인 도구)가 등장하는 탐정 소설 같은 경우—한꺼번에 이 모든 것을 가르치는 것은 엉망이 되기 쉽습니다. 이는 마치 눈을 가린 채 자동차 운전, 비행기 조종, 보트 항해를 동시에 배우려는 것과 같습니다. 로봇은 혼란에 빠지고, 초기에 실수를 저지르며, 어떤 구체적인 단계 때문에 사고가 났는지 파악하지 못하게 됩니다. 현재의 대부분의 시스템은 모든 것을 수행하려는 하나의 거대한 뇌를 사용하거나(이는 긴 작업에서 어려움을 겪습니다), 서로 배우지 못하는 로봇 팀을 사용합니다(이들은 원래의 변하지 않는 습관에 갇혀 있습니다).

이 논문은 이러한 AI 팀을 훈련하는 새로운 방법인 AGENTFLOW를 소개합니다. 이것을 전문화된 로봇 팀이 실시간으로 협력하여 일하는 역동적이고 살아있는 작업실이라고 생각해 보세요. 하나의 거대한 뇌가 모든 것을 하려고 하는 대신, AGENTFLOW는 업무를 분담합니다. **플래너(Planner)**는 다음 움직임을 결정하고, **실행자(Executor)**는 행동(웹 검색 등)을 수행하며, **검증자(Verifier)**는 결과가 타당한지 확인하고, **생성자(Generator)**는 최종 답변을 작성합니다. 이들은 매 단계마다 업데이트되는 하나의 "메모리 보드"를 공유합니다. 마법은 플래너가 일이 다 끝난 후가 아니라, 팀이 작업하는 도중에 학습한다는 점에서 일어납니다.

연구진은 Flow-GRPO라고 불리는 특별한 훈련 방법을 개발했습니다. 팀이 매 턴마다 단 하나의 "성공" 또는 "실패" 토큰을 모든 플레이어에게 전달하는 "뜨거운 감자" 게임을 상상해 보세요. 만약 팀이 마지막에 미스터리를 해결하면, 그들이 거친 모든 단계에 "잘했어!"라는 신호가 전달됩니다. 만약 실패하면, 모든 단계에 "다시 해봐"라는 신호가 전달됩니다. 이는 플래너가 초기에 내린 작은 결정조차도 최종 결과에 중요하다는 것을 이해하도록 돕습니다. 이런 방식으로 훈련함으로써, 시스템은 즉각적으로 적응하고, 스스로 실수를 바로잡으며, 목적에 맞는 적절한 도구를 선택하는 법을 배웁니다.

결과는 인상적입니다. 연구진은 이 시스템을 희귀한 사실 검색부터 복잡한 수학 문제 및 과학 질문에 이르기까지 열 가지 유형의 어려운 퍼즐에 테스트했습니다. 상대적으로 작은 "뇌"(70억 개의 파라미터를 가진 모델)를 사용했음에도 불구하고, AGENTFLOW는 훨씬 더 큰 규모의 유명한 모델인 GPT-4o(약 2,000억 개의 파라미터를 보유)와 다른 특화된 AI 시스템들을 이겼습니다. 예를 들어, 검색 중심의 작업에서는 정확도가 거의 15% 향상되었고, 수학 문제에서는 14% 이상 뛰어올랐습니다. 이 연구는 AI 팀이 고립되어 학습하는 것이 아니라 대화의 흐름 속에서 함께 학습하게 함으로써, 계획을 세우고, 도구를 사용하며, 여러 단계가 필요한 문제를 해결하는 능력이 훨씬 더 좋아진다는 것을 보여줍니다. 이것은 단순히 더 큰 뇌를 갖는 문제가 아니라, 팀이 어떻게 효과적으로 협력하는지를 가르치는 문제입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →