← 최신 논문
🤖 AI

TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents

이 논문은 행동에 의해 유도된 전이를 증거(Evidence), 실행(Execution), 무효성(Invalidity) 루브릭에 따라 평가함으로써, 학습된 평가자에 의존하지 않고도 성공적인 궤적의 부족 문제를 극복하고 WebShop 및 SearchQA와 같은 벤치마크에서의 성능을 향상시키는, 장기 지평(long-horizon) LLM 에이전트를 위한 세밀한 단계별 보상을 생성하는 방법인 전이별 루브릭 신용 할당(Transition-wise Rubric Credit Assignment, TRCA)을 제안한다.

원저자: Huan Zhang, Mingju Chen, Dongxu Zhou, Can Lv, Heng Chang, Sen Cui, Faguo Wu, Shiji Zhou

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Huan Zhang, Mingju Chen, Dongxu Zhou, Can Lv, Heng Chang, Sen Cui, Faguo Wu, Shiji Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급속도로 발전하는 인공지능 분야에서 연구자들은 컴퓨터 프로그램이 장기간에 걸쳐 계획을 세우고, 탐색하며, 세상과 상호작용할 수 있는 에이전트로서 행동하도록 가르치고 있습니다. 방대한 온라인 상점에서 특정 아이템을 찾아내거나 복잡한 가사 노동의 연속을 정리하는 임무를 맡은 디지털 비서라고 상상해 보십시오. 이러한 작업들은 단 한 번의 빠른 답변보다는 많은 작은 결정들의 연속을 필요로 합니다. 이러한 에이전트를 가르치기 위해 과학자들은 흔히 강화 학습이라고 불리는 방법을 사용하는데, 여기서 컴퓨터는 행동을 시도하고 피드백을 받으며 학습합니다. 전통적인 방식은 작업이 끝난 아주 마지막 시점에 "예" 또는 "아니오"라는 단순한 결과에 크게 의존합니다: 즉, 에이전트가 성공했는가 아니면 실패했는가 하는 것입니다. 이는 에이전트에게 어떤 구체적인 단계가 도움이 되었고 어떤 단계가 해로웠는지에 대한 안내를 전혀 제공하지 않기 때문에 매우 어려운 학습 환경을 만듭니다. 이는 마치 학생이 숙제에 대한 채점을 한 번도 받아보지 못한 채 기말고사만 치르는 것과 같습니다.

이러한 중간 피드백의 부재는 작업이 복잡하고 성공적인 시도가 드물 때 주요한 장애물이 됩니다. 만약 훈련 초기 단계에서 에이전트가 95%의 확률로 실패한다면, 오직 최종 결과만을 바라보는 시스템은 활용할 수 있는 유용한 데이터가 거의 없게 됩니다. 시스템은 어떤 단계가 좋은 아이디어였으나 막다른 길로 이어졌는지, 아니면 단순히 잘못된 단계였는지를 구분할 수 없습니다. 이로 인해 에이전트는 빈번한 실수로부터 학습하지 못한 채 갇혀버리게 되는데, 그 이유는 피드백 루프가 정보를 전달하기에는 너무 거칠기 때문입니다. 따라서 과제는 다음과 같습니다: 전체 미션이 결국 실패하더라도 작은 올바른 행동들에 대해 어떻게 공로를 인정해 줄 것인가 하는 점입니다.

한 연구팀은 이 문제를 해결하기 위해 '전이별 루브릭 신용 할당(Transition-wise Rubric Credit Assignment)', 즉 TRCA라고 불리는 새로운 방법을 제안했습니다. 성공적인 결과가 나올 때까지 기다리거나 모든 단계를 평가하기 위해 비용이 많이 드는 사전 학습된 판사(judge)에 의존하는 대신, 이 시스템은 행동이 환경에 일으키는 즉각적인 변화를 직접 관찰합니다. 연구진은 실패한 시도 중에서도 에이전트가 적절한 정보를 수집하거나 유효한 명령을 실행하는 것과 같이 논리적으로 타당한 행동을 수행하는 경우가 많다는 점을 관찰했습니다. 비록 최종 목표에 도달하지 못하더라도 말입니다. TRCA는 이러한 순간들을 가치 있는 학습 기회로 취급합니다. 이 시스템은 에이전트가 수행하는 모든 움직임을 세 가지 특정 기준에 따라 평가합니다: 해당 행동이 새로운 관련 정보를 드러냈는가, 필수적인 작업을 성공적으로 수행했는가, 혹은 무효하거나 고장 난 행동을 초과했는가 하는 점입니다.

이 과정을 통해 에이전트의 여정을 세밀한 점검 단위로 나눔으로써, 시스템은 최종 결과와 무관하게 각 단계에 점수를 부여할 수 있습니다. 만약 에이전트가 과제에 필요한 증거를 수집했다면 긍정적인 점수를 받습니다. 만약 과제를 진전시키는 유효한 행동을 수행했다면 더 많은 점수를 받습니다. 만약 환경이 이해하거나 실행할 수 없는 일을 시도한다면 벌점을 받습니다. 결정적으로, 시스템은 '돌파구(breakthroughs)'를 보상합니다. 이는 에이전트가 이전에는 충족하지 못했던 조건, 예를 들어 제품의 정확한 색상을 찾거나 올바른 사이즈를 선택하는 것과 같은 순간을 의미합니다. 이를 통해 에이전트는 최종 구매나 과제 완수가 아직 이루어지지 않았더라도 진행이 이루어지고 있음을 배울 수 있습니다.

연구진은 시뮬레이션된 온라인 쇼핑 환경과 에이전트가 가사 업무를 완수해야 하는 텍스트 기반 세계를 포함한 여러 도전적인 벤치마크에서 이 접근 방식을 테스트했습니다. 그들은 TRCA가 다른 선도적인 방법들과 비교했을-때 에이전트의 성능을 일관되게 향상시킨다는 것을 발견했습니다. 온라인 쇼핑 테스트에서 특정 모델 크기를 사용할 때, 이 새로운 방법은 경쟁 베이스라인보다 작업 점수를 6.0%에서 12.6% 사이로 개선했습니다. 검색 기반 질의응답 작업에서는 개선 폭이 1.9%에서 18.3%에 달했으며, 평균 점수가 크게 상승했습니다. 이러한 성과는 많은 수의 성공 사례를 시작 단계에서 필요로 하지 않고도 달성되었으며, 이는 시스템이 실패한 시도들 속에 풍부하게 존재하는 데이터를 통해 효과적으로 학습할 수 있음을 입증했습니다.

이 연구는 장기적 목표를 가진 에이전트를 가르치는 핵심이 실패를 백지 상태로 간주하지 않는 데 있다는 점을 시사합니다. 에이전트가 미션을 완수하지 못하더라도, 그 과정은 무엇이 옳았고 무엇이 틀렸는지에 대한 명확한 신호를 담고 있는 경우가 많습니다. 최종 결과가 나올 때까지 기다리는 대신 즉각적이고 관찰 가능한 변화에 집중함으로써, 이 새로운 방법은 에이전트가 훨씬 더 빠르게 개선될 수 있도록 돕는 꾸준한 안내의 흐름을 제공합니다. 이 접근 방식은 시스템이 훨씬 더 넓은 범위의 경험으로부터 학습할 수 있게 하여, 실패한 시도의 방대한 양을 낭비되는 데이터가 아닌 풍부한 교육의 원천으로 바꾸어 놓습니다. 결과는 복잡한 다단계 과제의 경우, 단계를 밟아 나가며 진행 상황을 평가하는 능력이 최종 판결을 기다리는 것보다 훨씬 더 효과적이라는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →