← 최신 논문
🤖 machine learning

Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment

본 논문은 희소한 최종 보상 또는 지연된 보상 방식에 비해 우수한 신용 할당, 훈련 안정성 및 성능을 달성하기 위해 밀집된 턴별 보상 구조를 활용하는 맞춤형 GRPO 및 PPO 알고리즘을 도출함으로써, 멀티 턴 시나리오에서 거대 언어 모델 에이전트를 향상시키기 위한 프레임워크를 제안하고 검증한다.

원저자: Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

게시일 2026-08-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 오늘날 가장 진보된 인공지능 시스템의 엔진 역할을 하며, 인간과 유사한 텍스트를 생성하고, 복잡한 문제를 해결하며, 심지어 코드를 작성하는 능력까지 갖추고 있습니다. 하지만 이 모델들에게 웹 검색, 계산기 사용, 또는 다단계 게임 수행과 같이 긴 추론 과정을 요구하는 작업을 시키면 종종 어려움을 겪습니다. 핵심적인 어려움은 이들이 실수를 통해 학습하는 방식에 있습니다. 머신러닝 분야에서 이러한 시스템은 흔ert히 '강화 학습'이라 불리는 방법을 통해 훈련되는데, 여기서 모델은 다양한 행동을 시도하고 그 결과로 보상을 받습니다. 최종 답이 맞으면 모델은 보상을 받고, 틀리면 보상을 받지 못합니다. 이 방식은 단순한 작업에는 효과적이지만, 복잡한 다단계 상호작용의 경우, 마지막 단계가 끝날 때까지 피드백을 기다리는 것은 마치 대화 전체를 마친 후에야 자신이 맞았는지 틀렸는지만 듣고 새로운 언어를 배우려는 것과 같습니다. 학습자는 어떤 특정 단어나 문장이 성공이나 실패를 초래했는지 알 수 없기에, 개선하기가 매우 어렵습니다.

한 연구팀은 AI 에이전트가 상호작용하는 동안 피드백을 받는 방식을 변경함으로써 이 문제를 해결하고자 했습니다. 그들은 에이전트가 취하는 매 단계마다 작고 구체적인 보상을 제공하는 시스템을 설계하여, 최종 결과가 나올 때까지 기다리는 대신 즉각적인 피드백을 주도록 했습니다. 에이전트가 정보를 찾기 위해 웹을 검색하는 상황을 상상해 보십시오. 기존 방식에서는 에이전트가 잘못된 검색어를 입력하고, 관련 없는 결과들을 읽은 뒤, 결국 틀린 답을 내놓으면 마지막에 가서야 '실패' 신호를 받게 됩니다. 새로운 방식은 각 검색 쿼리 직후에 에이-전트에게 즉각적인 피드백을 줍니다. 즉, 관련 있는 정보를 찾아내면 작은 보상을 주고, 부적절한 쿼리를 사용하면 벌점을 주는 식입니다. 이를 통해 에이전트는 어떤 단계가 도움이 되었고 어떤 단계가 도움이 되지 않았는지 정확히 학습하여, 훨씬 더 정밀하게 자신의 행동을 다듬을 수 있습니다.

연구진은 두 가지 대중적인 훈련 알고리즘을 사용하여 이 아이디어를 테스트했습니다. 하나는 여러 번의 시도를 하나로 묶어 서로 비교하는 방식이고, 다른 하나는 연속적인 행동의 흐름으로부터 학습하는 방식입니다. 그들은 이 방법들을 위키피디아 데이터베이스를 사용하여 질문에 대한 답을 찾아야 하는 검색 에이전트와, 격자 위에서 상자를 특정 목표 지점으로 밀어야 하는 소코반(Sokoban) 퍼즐을 풀어야 하는 게임 에이전트라는 매우 다른 두 가지 유형의 작업에 적용했습니다. 소코반 게임에서는 단 한 번의 잘못된 움직임으로도 플레이어가 막다른 길에 갇혀 레벨을 완료할 수 없게 될 수 있습니다. 이는 에이전트가 몇 단계 앞을 계획하는 법을 배울 수 있는지 테스트하기에 완벽한 환경입니다. 연구진은 이 '단계별' 보상 시스템을 기존의 최종 결과 대기 방식 및 보상을 지연시켜 결합하는 중간 단계 방식과 비교했습니다.

결과는 두 가지 작업 모두에서 명확하고 일관되었습니다. 조밀한 단계별 보상으로 훈련된 에이전트들은 기존 방식들보다 더 빠르게 학습했으며 훨씬 더 안정적이었습니다. 검색 작업에서 새로운 방식은 에이전트가 정답을 더 자주 찾을 수 있게 도왔을 뿐만 아니라, 검색 엔진과 상호작용하는 데 필요한 엄격한 형식 규칙을 따르는 데에도 도움을 주었습니다. 소코반 게임에서 단계별 피드백으로 훈련된 에이전트들은 막다른 길을 피하고 훨씬 더 높은 비율로 퍼즐을 해결하는 법을 배웠습니다. 연구진은 최종 답변만을 기다리는 전통적인 방식이 에이전트의 성능이 급격히 변동하거나 개선되지 못하는 불안정한 훈련을 초래한다는 것을 발견했습니다. 반면, 단계별 접근 방식은 에이전트에게 꾸준한 가이드 역할을 하여, 에이전트가 길을 잃지 않고 복잡한 추론 능력을 구축할 수 있게 해주었습니다.

이 연구는 인공지능이 복잡한 다회차 상호작용을 숙달하기 위해서는 단순히 수행 결과에 대한 최종 성적만으로는 부족하다는 것을 보여줍니다. 그것은 진행 과정 중에 무엇을 잘하고 있는지, 무엇을 잘못하고 있는지에 대한 지속적인 대화를 필요로 합니다. 본 연구는 학습 과정을 더 작고 관리 가능한 단위로 나누고 각 행동에 대해 즉각적이고 구체적인 피드백을 제공함으로써, AI 에이전트가 훨씬 더 유능하고 신뢰할 수 있게 될 수 있음을 보여줍니다. 이러한 발견은 단순한 텍 тексту 생성을 넘어, 진정한 다단계 추론을 수행하며 현실 세계를 탐색하고, 복잡한 문제를 해결하며, 도구와 자연스럽고 효과적으로 상호작용할 수 있는 더 똑똑한 비서를 구축하기 위한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →