← 최신 논문
🤖 AI

Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning

본 논문은 도구 미사용 궤적(tool-free trajectories), 난이도 인지 보상 형성(difficulty-aware reward shaping), 그리고 신뢰도 인지 토큰 재가중치 부여(confidence-aware token reweighting)를 통해 선택적 도구 사용을 학습함으로써 강화 학습에서의 도구 남용을 완화하는 효율적인 에이전트 정책 최적화 프레임워크인 EAPO를 제안하며, 이를 통해 여러 모델과 벤치마크에 걸쳐 추론 정확도를 향상시키는 동시에 불필요한 도구 호출을 크게 줄인다.

원저자: Liuji Chen, Dianxing Tang, Xing Shi, Dingshuo Chen, Qiang Liu, Shu Wu, Liang Wang

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Liuji Chen, Dianxing Tang, Xing Shi, Dingshuo Chen, Qiang Liu, Shu Wu, Liang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑한 학생이 한 명 있다고 상상해 보세요. 이 학생은 방금 강력한 도서관(인터넷)과 첨단 계산기(Python 코드)를 사용하는 법을 배웠습니다. 당신은 이 학생에게 수학 문제를 풀거나 상식 질문에 답하도록 시키고 싶습니다.

처음에 이 학생은 의욕이 너무 앞선 나머지, 당신이 "1 + 1은 뭐야?"라고 물었을 때조차도 즉시 덧셈에 관한 책을 찾으러 도서관으로 달려가거나 숫자를 계산하기 위해 계산기를 가동합니다. 결과적으로 정답은 맞히지만, 머릿속으로 충분히 할 수 있는 일에 시간, 에너지, 그리고 비용을 낭비하고 만 것입니다. 이것이 바로 이 논문에서 말하는 **"도구 남용(Tool Abuse)"**입니다.

이 논문의 연구자들은 EAPO라는 방법을 통해 이 학생에게 더 나은 교훈을 주고자 했습니다. 바로 **"언제 행동하지 말아야 하는지 배우는 것"**입니다.

그 방법은 다음과 같이 간단한 개념들로 나누어 설명할 수 있습니다.

1. 문제점: "도구에 과하게 의존하는" 학생

과거에 강화 학습(RL)으로 훈련된 AI 모델들은 단순히 정답을 맞히는 것만으로 보상을 받았습니다. 만약 도구를 사용하는 것이 정답을 맞히는 데 도움이 된다면, 모델은 아주 사소하고 쉬운 질문에도 매번 도구를 사용하도록 학습되었습니다. 이는 마치 요리사가 마늘 한 쪽을 다지기 위해 칼을 쓰는 게 훨씬 빠르고 공짜임에도 불구하고, 효과가 있다는 이유만으로 푸드 프로세서를 사용하는 것과 같습니다.

2. 해결책: "효율적인" 훈련 캠프 (EAPO)

저자들은 EAPO(Efficient Agentic Policy Optimization)라는 새로운 훈련법을 만들었습니다. 이것은 세 단계의 코칭 전략이라고 생각하면 됩니다.

단계 A: "도구 없는" 연습 (효율성을 고려한 롤아웃)

보통 이러한 AI 학생들을 훈련할 때는 모든 연습 문제에 도구를 사용할 수 있도록 허용합니다. 하지만 EAPO는 규칙을 바꿉 수 있습니다. 매 연습 묶음(batch)마다 코치는 학생에게 도구를 전혀 사용하지 않고 일부 문제를 풀도록 강제합니다.

  • 비유: 운전 강사가 가끔 이렇게 말하는 것과 같습니다. "자, 오늘은 GPS 없이 이 쉬운 경로를 운전해 보세요."
  • 결과: 이를 통해 AI는 "어, 나 이거 스스로도 풀 수 있네! GPS가 꼭 필요하지 않구나"라는 것을 깨닫게 됩니다. 이는 "도구 없이 풀었을 때와 도구를 써서 풀었을 때 중 어느 쪽이 더 나았는가?"라는 명확한 비교를 만들어냅니다.

단계 B: "난이도" 성적표 (난이도를 고려한 보상 설계)

코치는 어려운 문제를 풀 때 도구를 사용하는 학생을 벌하지 않습니다. 오직 학생이 이미 알고 있어야 할 쉬운 문제에 도구를 사용할 때만 벌점을 부여합니다.

  • 비유: 만약 수학 천재에게 "1+1"을 물었는데 계산기를 사용한다면, 코치는 "그건 시간 낭비야, 감점이야"라고 말합니다. 하지만 복잡한 물리 방정식을 풀 때 계산기를 사용한다면, 코치는 "잘했어! 그 도구는 꼭 필요했어"라고 말합니다.
  • 결과: AI는 단순히 전체적으로 도구를 덜 사용하는 법이 아니라, 언제 도구를 집어 들어야 하는지에 대해 영리하게 판단하는 법을 배웁니다.

단계 C: "확신"의 스포트라이트 (확신도를 고려한 가중치 재설정)

코치는 학생이 확신이 없는 순간에 특별히 주목합니다.

  • 비유: 만약 학생이 확신에 차 있었는데 틀렸다면, 코치는 "너 자신만만했구나, 다시 한번 살펴보자"라고 말합니다. 만약 학생이 확신이 없었지만 정답을 맞혔다면, 코치는 "위험을 감수했고 성공했구나, 그 느낌을 기억해둬"라고 말합니다.
  • 결과: AI는 자신의 "직관"(내부 추론)이 맞았을 때는 그것을 더 신뢰하고, 추측할 때는 더 주의를 기울이는 법을 배웁니다.

3. 결과: 더 똑똑하고 더 빠르게

논문은 이 방법을 세 가지 다른 AI 모델(Qwen 및 Llama)을 대상으로 어려운 수학 문제부터 복잡한 상식 퀴즈까지 아홉 가지 유형의 챌린지에 테스트했습니다.

  • 더 높은 정확도: 모델들이 전반적으로 더 많은 문제를 맞혔습니다.
  • 더 적은 도구 사용: 도구 호출 횟수가 눈에 띄게 줄었습니다 (약 18%에서 24% 감소).
  • 트레이드오프(Trade-off): 이들은 어려운 문제를 풀 때 성능이 떨어지거나 느려지는 일 없이, 단지 쉬운 문제에서 도구 사용을 멈춤으로써 이 결과를 달성했습니다.

요약

이 논문은 진정으로 똑똑한 AI 에이전트는 도구를 사용하는 법뿐만 아니라, 언제 도구를 내려놓아야 하는지도 알아야 한다고 주장합니다. 도구 없이 문제를 푸는 연습을 시키고, 불필요한 도구 사용에 대해서만 벌점을 줌으로써, EAPO는 AI가 문제를 더 잘 해결하면서도 시간과 자원을 아끼며 효율적으로 작동하도록 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →