← 최신 논문
🤖 AI

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

본 논문은 상호작용 흔적에서 구조화된 프록시 상태를 추론함으로써 다중 턴 도구 호출 에이전트의 확장 가능하고 신뢰할 수 있으며 확장 가능한 평가를 가능하게 하는 LLM 기반 시뮬레이션 프레임워크인 프록시 상태 기반 평가를 소개하며, 이를 통해 비용이 많이 드는 결정론적 백엔드에 대한 실용적인 대안을 제공하면서도 모델 순위 매기기 및 온-정책 훈련을 모두 지원합니다.

원저자: Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새 직원을 (AI 에이전트) 복잡한 고객 요청, 예를 들어 완벽한 신발 한 켤레를 찾거나 은행 계좌를 관리하는 방법을 가르치려 한다고 상상해 보세요. 이를 위해 그들을 테스트할 방법이 필요합니다.

구식 방법: 완벽하지만 비싼 시뮬레이션 구축
전통적으로 이러한 AI 에이전트를 테스트하기 위해 기업들은 '완벽한 세상' 시뮬레이션을 구축했습니다. 이는 실제 돈, 실제 재고, 엄격한 규칙을 갖춘 은행이나 상점의 전체 규모 작동 모델을 구축하는 것과 같습니다.

  • 문제점: 이러한 '완벽한 세상'을 구축하는 것은 매우 비싸고 느립니다. 배달 기사를 테스트하기 위해 엔지니어 팀을 고용해 가짜 도시를 건설하는 것과 같습니다. 테스트를 변경하고 싶다면 (예: "고객에게 돈이 없다면 어떻게 될까?") 가짜 도시 전체의 코드를 다시 작성해야 합니다. 해당 논문은 엔진을 가동하기만 하더라도 한 시스템이 거의 10 만 줄의 코드와 1 년 이상의 작업이 필요했다고 지적합니다.

새로운 방법: '프록시 상태' (스마트 스크립트)
이 논문의 저자들은 프록시 상태 기반 평가 (Proxy State-Based Evaluation) 라는 더 똑똑하고 빠른 방법을 제안합니다. 가짜 도시를 건설하는 대신, 연극을 진행하는 매우 똑똑한 AI '감독' 팀을 활용합니다.

이 비유는 다음과 같이 작동합니다:

  1. 시나리오 (스크립트):
    데이터베이스 대신 상세한 스크립트를 작성합니다. 이 스크립트는 다음과 같이 명시합니다:

    • 고객은 누구인가? (예: 흰색 신발을 좋아하는 사라).
    • 목표는 무엇인가? (예: 사라가 감당할 수 있는 신발을 찾는다).
    • 최종 결과는 어떻게 보여야 하는가? (예: 사라의 계좌에는 300 달러가 있지만 아직 아무것도 구매하지 않았다).
  2. 배우 (AI 시뮬레이터):

    • 사용자 시뮬레이터: 한 AI 가 고객 역할을 맡아 에이전트와 대화합니다.
    • 도구 시뮬레이터: 다른 AI 들은 은행이나 상점을 가장합니다. 이들은 실제로 은행 계좌를 가진 것이 아니라 스크립트에 기반해 그냥 그렇게 행동할 뿐입니다.
    • 상태 추적기 (기억 관리자): 이것이 가장 중요한 새로운 부분입니다. 대화가 진행되는 동안 특수 AI 가 모든 것을 지켜보며 '정신적 점수판 (프록시 상태)'을 업데이트합니다. 이는 다음을 추적합니다: 에이전트가 돈을 요청했는가? '은행'은 승인했는가? 현재 잔고는 얼마인가? 이는 실제 데이터베이스가 필요 없이 상황을 단계별로 그림으로 그려냅니다.
  3. 심사위원 (감독):
    대화 끝에 최종 AI 심사위원이 '정신적 점수판'과 대화 기록을 살펴봅니다. 그리고 묻습니다: "에이전트가 스크립트에 정의된 목표를 달성했는가?"

    • 에이전트가 신발을 찾고 '정신적 점수판'에서 잔고를 올바르게 업데이트했다면 합격입니다.
    • 에이전트가 사실을 왜곡하거나 (환각) 잔고를 확인하는 것을 잊었다면 불합격입니다.

왜 이것이 더 나은가?

  • 속도 및 유연성: 가짜 은행을 구축할 필요가 없습니다. 새로운 스크립트만 작성하면 됩니다. 다른 시나리오를 테스트하고 싶다면 코드가 아닌 텍스트만 변경하면 됩니다.
  • 신뢰성: 저자들은 인간 전문가들이 AI 의 채점을 확인하도록 하여 이를 테스트했습니다. 그들은 90% 이상의 경우 AI 심사위원의 판단에 동의했습니다.
  • 학습: 이 시스템이 빠르기 때문에 수천 개의 연습 대화를 생성할 수 있습니다. AI 에이전트는 이러한 연습 세션 (자신이 참여할 때뿐만 아니라 더 나은 에이전트가 플레이하는 것을 관찰할 때) 에서 학습하여 훨씬 더 빠르게 똑똑해질 수 있습니다.

결과
이 논문은 다양한 AI 모델을 사용하여 이 시스템을 테스트했습니다. 그 결과 다음과 같은 사실을 발견했습니다:

  • 더 똑똑한 AI 모델 (또는 답변하기 전에 더 오래 생각하는 모델) 이 더 높은 점수를 받았습니다.
  • 이 시스템을 사용하여 AI 를 학습시키면 이전에 본 적이 없는 시나리오에서도 문제 해결 능력이 크게 향상되었습니다.
  • 이 시스템은 AI 가 거짓말을 하거나 실수를 할 때를 매우 잘 파악했으며, 시뮬레이션 자체에서 발생한 '가짜' 오류는 거의 없었습니다.

요약
이 논문은 방대하고 비싼 현실 세계 시뮬레이션을 구축하는 대신 AI 배우와 기억 관리 AI 가 포함된 '스크립트화된 연극'을 사용하여 AI 에이전트를 테스트하고 학습시키는 방법을 소개합니다. 이는 더 빠르고, 저렴하며, 정확도도 동일하여 기업들이 AI 에이전트를 훨씬 더 빠르게 개선하고 발전시킬 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →