← 최신 논문
🤖 AI

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

이 논문은 작업 해결과 다음 도구 호출 예측을 단일 모델 내에서 통합하는 자기 추측 에이전트 프레임워크를 소개하며, 추측 정확도를 크게 향상시키고 작업 성능을 저하시키지 않으면서 지연 시간을 줄이기 위해 공동 강화 학습 방법을 활용합니다.

원저자: Jiabao Ji, Yujian Liu, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiabao Ji, Yujian Liu, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 미스터리를 해결하려는 아주 똑똑한 탐정이라고 상상해 보세요. 당신은 단서들을 통해 생각할 수 있는 명석한 두뇌를 가졌지만, 최종 답을 얻으려면 도서관 사서에게 책을 확인해 달라고 요청하거나 기상 캐스터에게 일기예보를 묻는 것처럼 외부 세계에 몇 가지 질문을 던져야 합니다. 문제는, 질문을 할 때마다 전화를 끊고 상대방이 전화를 받을 때까지 기다렸다가, 그들의 답변을 듣고 나서 다음 단서를 생각하기 위해 다시 전화를 끊어야 한다는 점입니다. 이 "대기 시간" 동안 당신의 명석한 두뇌는 아무것도 하지 못한 채 그냥 가만히 앉아 있게 됩니다. 이 "대기 시간"은 기본적으로 복잡한 문제를 해결하기 위해 도구(tool)를 사용하는 컴퓨터 프로그램인 AI 에이전트들에게 거대한 병목 현상입니다.

이를 해결하기 위해 과학자들은 "추측(speculation)"이라는 기술을 시도했습니다. 이것은 마치 당신이 문장을 다 마치기도 전에 당신이 사서에게 무엇을 물어볼지 미리 짐작하는 조수와 같습니다. 만약 조수가 올바르게 추측한다면, 당신이 아직 생각하고 있는 동안에도 사서는 이미 책을 읽기 시작할 것이고, 당신이 질문을 던지는 순간 답변이 준비되어 있을 것입니다. 하지만 여기에는 함정이 있습니다. 보통 조수는 당신과 같은 사람이 아닙니다(더 작고 별개인 AI 모델입니다). 그래서 그들은 당신의 사고 스타일을 잘 알지 못합니다. 그들은 자주 틀리거나, 자신만의 특별한 노트와 전화기가 필요하며, 이는 추가적인 공간과 에너지를 소모합니다. 큰 질문은 이것입니다. 과연 탐정이 서투른 조수를 필요로 하지 않고, 자신의 다음 움직임을 완벽하게 스스로 추측하도록 배울 수 있을까요?

이 논문은 AI 에이전트가 정확히 그렇게 할 수 있도록 가르치는 영리하고 새로운 방법을 소개합니다. 연구진은 에이전트가 다음에 할 행동을 추측하는 데 가장 적합한 사람은 바로 에이전트 자신이라는 것을 발견했습니다. 그들은 하나의 AI가 두 가지 모드, 즉 "사고 모드(Thinking Mode, 실제 과업 해결)"와 "추측 모드(Guessing Mode, 자신의 다음 도구 호출 예측)" 사이를 전환하도록 훈련시켰습니다. 이들은 "결합 에이전트-추측기 강화 학습(Joint Agent–Speculator RL)"이라는 특별한 훈련 방법을 사용했습니다. 이것은 캐릭터가 레벨을 플레이하는 동시에 다음 적의 움직임을 예측하는 연습을 하는 비디오 게임과 같습니다. AI는 실제로 게임에서 이기는 법을 잊지 않으면서도, 더 잘 추측하기 위해 자신의 최근 게임으로부터 배웁니다.

결과는 상당히 유망합니다. 연구진이 이 "자기 추측(self-guessing)" 에이전트를 까다로운 질문에 대한 답을 찾거나 항공권 예약을 관리하는 등의 과업에 테스트했을 때, 이 AI는 자신의 다음 움직임을 예측하는 능력이 훨씬 좋아졌습니다. 40억 개의 파라미터를 가진 Qwen3-4B 모델의 경우, 올바른 다음 도구 호출을 추측하는 정확도가 44.1%에서 61.2%로 뛰어올랐습니다. 약간 더 최신 버전인 Qwen3.5-4B의 경우, 48.9%에서 66.3%로 상승했습니다. 결정적으로, 에이전트가 추측을 더 잘하게 되었음에도 불구하고, 실제로 과업을 해결하는 능력이 저하되지는 않았습니다. 성공률은 안정적으로 유지되거나 오히려 약간 개선되었습니다.

또한 논문은 더 작은 별개의 AI 모델이 더 나은 추측기라는 아이디어를 반박합니다. 연구진은 이들을 "조수"로 테스트했는데, 그들은 메인 에이전트의 스타일과 일치하지 않기 때문에 자주 틀린다는 것을 발견했습니다. 또한 별도의 추측기를 사용하는 것은 더 많은 컴퓨터 메모리를 요구하고 모델 간의 전환에 시간이 더 걸리게 하여, 시간을 절약하려는 목적 자체를 무색하게 만든다는 점도 보여주었습니다. "생각하는 자"와 "추측하는 자"를 동일한 뇌로 유지함으로써, 시스템은 메모리를 절약하고 서로 다른 컴퓨터 간의 전환으로 인한 지연을 피할 수 있습니다.

하지만 저자들은 이 방법이 "읽기 전용(read-only)" 도구, 즉 정보를 검색하거나 데이터를 찾아보는 작업에 가장 효과적이라는 점을 주의 깊게 언급합니다. 만약 도구가 주문을 넣거나 파일을 삭제하는 것처럼 현실 세계의 무언가를 변경하는 것이라면, 잘못된 추측은 위험할 수 있습니다. 그런 경우에는 추가적인 안전 점검이 필요할 것입니다. 하지만 AI가 단순히 정보를 수집하기 위해 필요한 대다수의 과업에서, 이 자기 추측 기술은 AI가 더 빠르고 효율적으로 작동할 수 있는 방법을 제시하며, 생각하는 시간 뒤에 대기 시간을 숨겨줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →