TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
TRACE는 로그 비율 상태 가치의 시간차 변화로부터 턴당 보상을 도출함으로써, 지도 미세 조정이나 실시간 웹 데이터 없이도 순수 강화 학습을 통해 복잡한 검색 벤치마크에서의 도구 사용 성능을 크게 향상시킬 수 있는, 장기 호흡 에이전트를 위한 밀집된 비판자 없는(critic-free) 신용 할당 방법을 도입한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 거대하고 다단계적인 미스터리를 해결하는 법을 가르치고 있다고 상상해 보세요. 인공지능의 세계에서 이것은 "에이전틱 강화 학습(agentic reinforcement learning)"이라고 불립니다. 이 로봇을 탐정이라고 생각해 봅시다. 이 탐정은 단순히 한 번에 답을 추측하는 것이 아니라, 도서관을 뒤지고, 파일을 열고, 질문을 던지고, 단서를 모으기 위해 몇 시간을 보낸 뒤 마침내 "범인을 찾았다!"라고 외칩니다. 까다로운 점은 이 탐정을 어떻게 가르치느냐 하는 것입니다. 만약 탐정이 마지막 단계에서 오답을 냈을 때, 단순한 스승은 그저 "잘못했어"라고 말하며 0점을 줄 수도 있습니다. 하지만 그것은 불공평합니다! 탐정이 첫 한 시간 동안은 올바른 단서들을 찾아냈는데, 마지막 1분에 우연히 삐걱거리는 바닥판에 걸려 넘어졌을 수도 있기 때문입니다. 마지막 실수 때문에 지난 한 시간 동안의 모든 노력을 처벌한다면, 탐정은 혼란에 빠져 더 이상 단서를 모으려는 시도를 멈추게 될 것입니다. 이것이 바로 "신용 할당(credit assignment)"의 문제입니다. 즉, 보상이 맨 마지막에만 주어질 때, 어떻게 각 단계에 공로를 돌리고 잘못된 단계에 책임을 물을 것인가의 문제입니다.
TRACE라는 제목의 이 논문은 여러 단계를 거쳐 문제를 해결해야 하는 AI 에이전트들이 겪는 바로 이 골칫거리를 다룹니다. 연구진은 탐정에게 매 단계마다(예: 매 검색이나 파일 열기마다) "엄지 척" 또는 "엄지 아래"를 주는 영리한 방법을 제안합니다. 그들은 인간이 모든 단계를 채점하거나, 영화 전체를 지켜보는 초지능적인 심판을 필요로 하지 않고도 이 일을 해냅니다. 대신 그들은 "동결된 참조 모델(frozen reference model)"을 사용합니다. 이것은 정답지를 알고 있는, 변하지 않고 차분한 사서와 같습니다. 탐정이 움직임을 보일 때마다 사서는 확인합니다. "이 새로운 단서가 최종 정답을 맞히기 더 쉽게 만드는가?" 만약 그렇다면, 탐정은 작은 보상을 받습니다. 만약 그렇지 않다면, 아주 작은 벌점을 받습니다. 이 방법인 TRACE는 AI가 마지막 성적표를 기다리는 것보다 훨씬 더 빠르고 효과적으로 학습하도록 돕습니다.
탐정의 딜레마
당신이 "엘레나 크루즈(Elena Cruz)"라는 가상의 작가의 출생지를 찾는 로봇을 훈련시킨다고 상상해 봅시다. 로봇은 브라우저를 사용하여 검색하고, 페이지를 열고, 텍스트를 읽어야 합니다. 목표에 도달하기까지 20번의 클릭이 필요할 수도 있습니다. 기존의 로봇 훈련 방식(이를 "결과 전용(outcome-only)" 훈련이라 부릅니다)에서는 로봇이 20번의 클릭을 모두 수행하고 아마도 오답을 낸 뒤, 컴퓨터가 "실패"라고 말하게 됩니다. 그러면 로봇은 다시 시도하겠지만, 그 20번의 클릭 중 어떤 것이 도움이 되었는지는 알 수 없습니다. 아마도 처음 15번의 클릭은 올바른 책을 찾아냈지만, 16번째 클릭에서 다른 엘레나에 관한 페이지를 여는 바람에 오답으로 이어졌을 수도 있습니다. 기존 방식은 유익했던 첫 15번의 클릭과 쓸모없었던 16번째 클릭을 똑같이 취급합니다. 즉, 둘 다 처벌받는 것입니다. 이는 수학 시험에서 마지막에 작은 산수 실수를 했다는 이유로, 앞선 어려운 대수학 문제는 모두 맞혔음에도 불구하고 나쁜 성적을 받는 것과 같습니다.
연구진은 이러한 "전부 아니면 전무(all-or-nothing)" 방식이 로봇이 복잡하고 긴 과제를 학습하는 것을 매우 어렵게 만든다는 것을 발견했습니다. 로봇은 혼란을 느끼고, 훈련은 너무 오래 걸리며, 마지막에 실수를 할까 봐 두려워 새로운 아이디어를 탐색하는 것을 포기하곤 합니다.
TRACE 솔루션: 매 단계마다 부여되는 성적표
저자들은 TRACE(Turn-level Reward Assignment via Credit Estimation)를 고안해 냈습니다. 로봇의 결과가 나올 때까지 기다려 채점하는 대신, TRACE는 매번 도구를 호출할 때마다(매 검색, 매 열기, 매 클릭마다) 로봇에게 점수를 줍니다.
작동 방식은 다음과 같습니다(탐정 비유 사용):
- 동결된 사서: 시스템은 "동결된 참조 모델"을 사용합니다. 이미 정답지를 읽었으며 결코 마음을 바꾸지 않는 사서를 상상해 보세요. 이 사서는 "동결"되어 있습니다. 즉, 배우거나 혼란을 느끼지 않고, 그저 일정한 측정 기준 역할을 합니다.
- 진행 상황 체크: 로봇이 움직임(예: "엘레나 크루즈" 검색)을 보이면, 사서는 로봇의 현재 기록을 확인합니다. 사서는 묻습니다. "로봇이 지금까지 찾아낸 내용을 바탕으로 볼 때, 정답을 맞히기가 얼마나 쉬워졌는가?"
- 점수의 변화: 로봇의 새로운 검색이 정답을 맞히기 더 쉽게 만든다면, 로봇은 양(+)의 점수를 받습니다. 만약 검색이 막다른 길이나 혼란스러운 페이지로 이어진다면, 점수는 내려갑니다.
- "텔레스코핑(Telescoping)"의 마법: 이 논문은 "시간차(Temporal-Difference, TD)"라는 수학적 기법을 사용합니다. 이것은 사다리와 같습니다. 사다리의 한 칸을 올라가면 그 칸에 대한 공로를 인정받습니다. 만약 올라갔다가 실수로 미끄러져 내려오면, 공로를 잃게 됩니다. 시스템은 이러한 미세한 변화들을 합산합니다. 만약 로봇이 10번의 차례 동안 좋은 단서를 모으다가 단 한 번의 잘못된 움직임을 보였다면, 시스템은 10번의 좋은 단계는 긍정적으로 보고, 단 한 번의 잘못된 단계는 부정적으로 봅니다. 최종 답이 틀렸다고 해서 그 10번의 좋은 단계까지 처벌하지는 않습니다.
이 방법은 특별합니다. 왜냐하면 매 단계마다 "잘했어"라고 적어줄 인간도 필요 없고, 로봇을 지켜보며 채점할 또 다른 초지능적인 AI도 필요 없기 때문입니다. 그저 "동결된 사서"를 통해 로봇이 진실에 가까워지고 있는지를 확인할 뿐입니다.
연구 결과
연구진은 매우 어려운 과제, 즉 방대한 문서 집합 속에 숨겨진 특정 사실을 찾아내는 작업("폐쇄형 웹(closed-web)" 검색)에 대해 TRACE를 테스트했습니다. 그들은 두 가지 크기의 AI 모델을 사용했습니다: 작은 모델(Qwen3-4B)과 더 큰 모델(Qwen3-30B-A3B)입니다.
결과는 인상적이었습니다. TRACE를 사용하기 전, 작은 모델은 어려운 검색 질문의 약 **7.2%**만을 해결할 수 있었습니다. 하지만 TRACE로 훈련한 후, 이 수치는 **35.6%**로 뛰어올랐습니다. 더 큰 모델은 **8.4%**에서 **42.6%**로 상승했습니다. 이는 "콜드 스타트(cold-start)" 훈련(완벽한 예시로 먼저 로봇을 가르치는 방식)이나 실시간 인터넷 데이터를 사용하지 않고도 달성한 엄청난 향상입니다. 그들은 단지 원본 모델에 TRACE 방식만을 적용했을 뿐입니다.
또한, 논문은 TRACE가 훈련 시 사용했던 연습용 라이브러리가 아닌, 개방형 인터넷에서도 작동한다는 것을 보여주었습니다. 로봇은 검색하고 읽는 일반적인 기술을 학습하여 새로운 환경으로 전이되었습니다. 예를 들어, 더 큰 모델은 BrowseComp 벤치마크에서 12.9점, GAIA에서 52.0점, 그리고 중국의 딥서치 테스트에서 45.0점을 기록했습니다.
의의 및 한계점
이 논문은 이 방법이 학습 속도를 훨씬 빠르게 만든다는 점을 시사합니다. 실험에서 TRACE로 훈련받은 로봇들은 기존의 "끝날 때까지 기다리는" 방식의 로봇들보다 훨씬 더 일찍 성능이 좋아지기 시작했고, 최고 성능에 더 빨리 도달했습니다. 학습 곡선은 로봇들이 증거를 수집하고 탐색하는 법을 더 효과적으로 배우고 있음을 보여주었습니다.
하지만 저자들은 자신들의 연구가 가진 한계점도 명확히 짚고 있습니다. 이 방법은 최종 정답이 이름, 날짜, 숫자처럼 짧고 명확할 때 가장 잘 작동합니다. 만약 로봇의 임무가 길고 복잡한 이야기를 쓰거나, "정답"이 개방적이고 정의하기 어려운 고장 난 컴퓨터 프로그램을 고치는 것이라면, 이 방법은 잘 작동하지 않을 수 있습니다. "동결된 사서"는 대조할 수 있는 명확한 정답지가 필요하기 때문입니다. 정답이 모호하다면 사서는 로봇이 진실에 가까워지고 있는지 판단할 수 없습니다.
요약하자면, TRACE는 AI 에이전트에게 훌륭한 탐정이 되는 법을 가르치는 새로운 방법입니다. 사건이 끝날 때까지 기다려 "잘했어" 혹은 "못했어"라고 말하는 대신, 발견된 매 단서마다 성적표를 부여합니다. 이는 최종 추측이 완벽하지 않더라도 증거를 수집하는 행위 자체가 가치 있다는 것을 AI가 이해하도록 도와, 더 똑똑하고 빠르며 신뢰할 수 있는 검색 에이전트를 만들어 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.