← 최신 논문
💬 NLP

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

이 논문은 보상 가중치를 동적으로 조정하고 파레토 순위 기반의 신용 할당을 활용함으로써 기존 방법들보다 우수한 정확도-효율성 트레이드오프를 달로하기 위해 도구 통합 언어 에이전트를 정렬하는 2단계 다목적 최적화 프레임워크인 ParetoPO를 소개한다.

원저자: Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑한 로봇 비서에게 어려운 수학 문제나 까다로운 상식 퀴즈와 같은 복잡한 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 이 문제를 해결하기 위해 로봇은 "도구"(계산기나 검색 엔진 같은 것)를 사용할 수 있습니다.

문제는 로봇에게 두 가지 상충하는 목표가 있다는 점입니다:

  1. 정답을 맞히는 것 (정확도).
  2. 도구를 최대한 적게 사용하는 것 (효율성).

만약 당신이 로봇에게 정확도에만 집중하라고 말한다면, 로봇은 간단한 문제를 풀면서도 계산기를 50번이나 호출하여 시간과 에너지를 낭비할 수 있습니다. 반대로 도구를 적게 쓰는 데만 집중하라고 하면, 로봇은 답을 추측해 버리고 틀릴 수도 있습니다.

현재 대부분의 방법은 이를 해결하기 위해 *"정답은 60%의 확률로 맞히고, 도구 사용은 40%의 비중으로 한다"*와 같이 고정된 레시피를 제공합니다. 하지만 이는 마치 핸들이 한 위치에 고정된 자동차를 운전하려는 것과 같습니다. 제대로 작동하지 않습니다. 왜냐냐하면 "적절한" 균형은 상황에 따라 변하기 때문입니다. 때로는 신중해야 하고, 때로는 빨라야 합니다.

"ParetoPO": 스마트한 코치

저자들은 ParetoPO라고 불리는 새로운 훈련법을 만들었습니다. 이것은 단순히 로봇에게 고정된 레시피를 주는 것이 아니라, 코치가 매 상황에 딱 맞는 완벽한 균형을 찾도록 돕는 "스마트한 코치" 역할을 합니다.

1단계: "지도 제작자" (지형 탐색)

로봇이 경치는 멋지지만(정확도) 하이킹 거리는 짧은(효율성) 산맥의 최적의 지점을 찾으려 한다고 상상해 보세요.

  • 기존 방식: 코치는 특정 경로 하나를 찍어서 "이 길로 가라"고 말합니다. 로봇은 보기에는 좋아 보이지만 실제로는 최선이 아닌 골짜기에 갇힐 수 있습니다.
  • ParetoPO 방식: 코치는 로봇을 수많은 경로로 내보냅니다. 코치는 로봇이 얼마나 새로운 영역을 개척하고 있는지 "하이퍼볼륨(Hypervolume)"이라는 "점수판"을 통해 끊임없이 확인합니다.
    • 만약 로봇이 정확도는 약간 낮지만 훨씬 빠른 경로를 찾아낸다면, 코치는 "좋아! 이것도 새로운 종류의 성공이야!"라고 말합니다.
    • 만약 로봇이 매우 정확하지만 느린 경로를 찾아낸다면, 코치는 "이것도 좋아!"라고 말합니다.
    • 코치는 로봇이 무엇을 발견하느냐에 따라 게임의 규칙을 동적으로 변경하며, 로봇이 모든 가능한 "스윗 스팟(한 쪽을 개선하면 다른 쪽이 나빠질 수밖에 없는 지점들)"을 찾아낼 수 있도록 전체 산맥을 탐험하게 합니다.

2단계: "토너먼트 심판" (기술 연마)

로봇이 산을 다 탐험했다면, 이제 현재 순간에 가장 좋은 수를 선택하는 법을 배워야 합니다.

  • 기존 방식: 코치는 로봇에게 단 하나의 점수(예: "너는 85점을 받았어")를 줍니다. 로봇은 그 숫자를 높이는 데 집중합니다.
  • ParetoPO 방식: 코치는 토너먼트를 개최합니다. 로봇의 시도들을 모아 서로 비교합니다.
    • "시도 A"와 "시도 B"를 비교합니다.
    • 만약 "시도 A"가 정확도도 더 높고 도구도 더 적게 사용한다면, A가 승리합니다.
    • 만약 "시도 A"가 정확도는 높지만 도구를 더 많이 사용한다면, 코치는 그 구체적인 절충안(trade-off)을 살펴봅니다.
    • 로봇은 순위를 부여받습니다. 로봇은 다음과 같이 배웁니다: "나는 단순히 높은 점수를 얻는 것이 아니라, '지배되지 않는(undominated)' 상태, 즉 다른 어떤 시도가 모든 면에서 나보다 확실히 낫지 않은 상태가 되어야 한다."

이를 통해 로봇은 미세한 결정을 내리는 법을 배웁니다. 예를 들어, *"이 특정 수학 문제의 경우, 계산기를 세 번 확인할 필요 없이 한 번만 확인하는 것이 가장 효율적인 방법이다"*라는 식입니다.

결과

연구진은 이 방법을 어려운 수학 문제와 다단계 질문에 테스트했습니다. 그 결과:

  • 기존 방식은 진자 운동과 같았습니다. 매우 정확하지만 도구를 너무 많이 쓰거나, 혹은 매우 효율적이지만 실수를 저지르는 극단적인 모습을 보였습니다.
  • ParetoPO는 "골디락스(Goldilocks)" 존을 찾아냈습니다. 이 방법은 다른 어떤 방법보다 더 적은 도구를 사용하면서도 더 높은 정확도를 일관되게 달성했습니다.

이것이 왜 중요한가 (쉬운 설명)

식사를 주문하는 상황을 생각해 보세요.

  • 기존 방식은 "무한 리필(맛은 좋지만 배가 불러서 음식을 낭비함)"만 제공하거나, 혹은 "아주 작은 양(효율적이지만 배가 고픈 채로 떠남)"만 제공하는 식당과 같습니다.
  • ParetoPO는 당신이 먹는 모습을 지켜보며 실시간으로 접시를 조절하는 셰프와 같습니다. 그들은 당신이 배를 채우면서도(정확도) 단 한 톨의 음식도 낭비하지 않도록(효율성) 정확히 어느 정도의 음식이 필요한지 학습합니다.

이 논문은 이 방법이 AI 에이전트가 새로운 작업마다 규칙을 수동으로 조정할 필요 없이, 지능과 효율성을 동시에 갖추도록 돕는다고 주장합니다. 이는 AI에게 천재적이면서도 동시에 미니멀리스트가 되는 법을 가르치는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →