← 최신 논문
🤖 AI

Reward-Free Evolving Agents via Pairwise Validator

이 논문은 비용이 많이 드는 스칼라 보상 신호를 동결된 LLM 기반의 쌍체 비교 검증기로 대체하여 에이전트의 개선을 유도함으로써, 레이블이 지정된 데이터나 추가 학습 없이도 여러 엔진과 기질에 걸쳐 경쟁력 있는 성능을 달성하는 비용 효율적인 자기 진화 에이전트 프레임워크를 제안한다.

원저자: Minghao Liu, Yu Wang, Jiayun Wang, Wei Wei

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Minghao Liu, Yu Wang, Jiayun Wang, Wei Wei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 명령을 따르는 것을 넘어, 스스로 자신의 지침을 작성하는 법을 배우는 세상을 상상해 보십시오. 이것이 바로 **AI 에이전트(AI Agents)**의 영역입니다. AI 에이전트는 복잡한 퍼즐을 해결하기 위해 문제를 단계별로 나누고, 도구를 사용하며, 문제를 깊이 고민하는 똑똑한 프로그램입니다. 보통 이러한 에이전트를 더 발전시키기 위해서는 인간이 엄격한 코치 역할을 해야 합니다. 에이전트가 새로운 사고 방식을 시도할 때마다, 코치는 마치 선생님이 시험 성적을 매기듯 구체적인 점수로 채점해야 합니다. 하지만 여기에는 함정이 있습니다. 완벽한 테스트와 채점 기준표를 만드는 것은 매우 어렵고 비용이 많이 들며, 깊은 인간의 전문 지식을 필요로 한다는 점입니다. 이는 마치 로봇에게 양파 써는 법을 가르치기 위해 양파 써는 법에 대한 100페이지짜리 매뉴얼을 작성했는데, 정작 다른 채소를 만날 때마다 새로운 매뉴얼이 필요한 상황과 같습니다.

**자기 진화형 에이전트(Self-Evolving Agents)**라는 개념이 등장했습니다. 이 에이전트들은 인간 코치가 모든 시도를 채점하기를 기다리는 대신, 스스로를 개선하는 루프를 수행합니다. 즉, 작은 변화를 주고, 테스트를 하고, 만약 그것이 더 나아 보인다면 그 변화를 유지하는 방식입니다. 과학자들이 던진 핵심 질문은 이것입니다. 우리가 비싼 인간의 채점을 완전히 건너뛸 수 있을까? 만약 에이전트가 완벽한 점수 없이도 자신의 '과거 모습'과 '현재 모습'을 비교하여 어떤 것이 더 나은지 스스로 결정할 수 있다면 어떨까요? 이 논문은 바로 이 질문을 파고들며, 무거운 비용이 드는 채점 시스템을 단순하고 빠른 비교로 대체하는 영리한 지름길을 제안합니다.


문제점: 값비싼 "성적표"

똑똑한 AI 에이전트를 만드는 과정을 강아지에게 재주를 가르치는 것에 비유해 봅시다. 기존 방식에서는 강아지가 새로운 동작을 시도할 때마다 인간 훈련사가 개입하여 주의 깊게 관찰한 뒤, "방금 동작은 10점 만점에 7.5점이야"라고 정밀한 점수를 주어야 합니다. 신뢰할 수 있는 점수를 얻으려면 훈련사는 비교 대상이 될 완벽한 예시들을 담은 거대한 라이브러리를 가지고 있어야 합니다. AI에서 이 "성적표"는 **스칼라 보상(scalar reward)**이라고 불립니다. 이는 에이전트가 얼마나 잘했는지를 알려주는 단일 숫자입니다.

문제는 이 성적표를 만드는 것이 악몽 같다는 점입니다. 전문가를 고용해야 하고, 수천 개의 예시에 라벨을 붙여야 하며, 엄청난 비용이 듭니다. 때로는 작업이 너무 기이하거나 복잡해서 인간조차 무엇이 "좋은" 점수인지 합의를 보지 못할 때도 있습니다. 이는 꿈속의 그림을 채점하려는 것과 같습니다. 정답이 없기에 숫자를 부여하는 것 자체가 불가능합니다.

해결책: "누가 더 나은가?" 게임

이 논문의 저자인 밍하오 리우(Minghao Liu)와 그의 팀은 간단한 질문을 던졌습니다. 우리가 "이것이 얼마나 좋은가?"라고 묻는 대신 "어느 쪽이 더 나은가?"라고 묻는다면 어떨까?

단일 시도에 대해 어려운 숫자를 할당하려고 노력하는 대신, 그들은 **쌍체 검증기(Pairwise Validator)**를 도입했습니다. 권투 링 위의 두 선수를 상상해 보십시오. 한 명은 '부모'(에이전트의 현재 버전)이고, 다른 한 명은 '자식'(새롭게 수정된 버전)입니다. 동결된(frozen) 사전 학습된 대규모 언어 모델(LLM)이 심판 역할을 합니다. 심판은 정확한 점수를 알 필요가 없습니다. 그저 두 모습을 보고 "자식이 더 낫다"거나 "부모가 이겼다"라고 말하기만 하면 됩니다.

이는 AI 심판에게 훨씬 쉬운 일입니다. 친구에게 "초콜릿 맛과 바닐라 맛 중 무엇을 더 좋아해?"라고 묻는 것이, 두 맛을 1점에서 100점 사이의 정밀한 척도로 평가하라고 요구하는 것보다 훨씬 쉬운 것과 같습니다. 논문은 이 "누가 더 나은가?" 게임이 더 안정적이며, 심판을 위한 추가 학습이 전혀 필요하지 않음을 보여줍니다.

두 가지 새로운 플레이북

연구팀은 이 아이디어를 두 가지 방식으로 테스트하여 두 가지 새로운 "플레이북"을 만들었습니다.

  1. 적응형 집중(Adaptive Focus): 이것은 "스마트 코치" 접근 방식입니다. 에이전트는 여전히 다음 라운드의 '부모'로 삼을 버전을 선택하기 위해 인간이 채점한 작은 규모의 예시들을 사용합니다. 하지만 새로운 변화를 수용할지 결정하는 순간에는, 값비싼 성적표를 건너뛰고 오직 "누가 더 나은가?"를 따지는 심판만을 사용합니다 장기적인 계획을 위해 인간의 안전망은 유지하되, 일상적인 결정에서는 비용을 절감하는 하이브리드 방식입니다.
  2. 소프트 엘로(Soft Elo): 이것은 "순수 토너먼트" 접근 방식입니다. 여기서 에이전트는 인간의 성적표를 완전히 버립니다. 에이전트는 심판의 "누가 더 나은가?"라는 판결을 사용하여 레이팅 시스템(체스 선수들의 순위를 매기는 방식과 유사함)을 실행합니다. 만약 자식이 부모를 이기면, 자식의 레이팅이 올라갑니다. 시간이 흐름에 따라 에이전트는 인간이 숫자를 부여할 필요 없이, 오직 이 헤드 투 헤드(head-to-head) 전투를 통해 진화합니다.

결과: 정말 효과가 있는가?

연구팀은 까다로운 상식 퀴즈 답변부터 데이터 정리 코딩 작성에 이르기까지 다양한 도전 과제에 걸쳐 이 방법들을 테스트했습니다. 그들은 새로운 "쌍체(Pairwise)" 방식들을 기존의 "전체 보상(Full-Reward)" 방식(비싼 인간 채점 방식)과 비교했습니다.

결과는 놀라울 정도로 강력했습니다. 대부분의 테스트에서 "누가 더 나은가?" 심판을 사용하는 에이전트들은 값비싼 인간 성적표를 사용하는 에이전트만큼, 혹은 그보다 더 뛰어난 성능을 보였습니다.

  • 상식 및 지침 관련: 문서 세트에서 질문에 답하는 작업과 같은 과제에서, "소프트 엘로" 방식은 에이펜트가 단순히 연습 문제를 암기하는 것이 아니라 실제 논리를 학습하게 하여 일반화 능력을 높여주었습니다.
  • 수학 관련: 어려운 수학 문제에서도 새로운 방식들은 기존 방식들과 동일한 수의 문제를 해결해 냈으며, 이는 완벽한 점수가 없어도 좋은 해답을 찾아낼 수 있음을 입증했습니다.
  • 코드 관련: 컴퓨터 프로그램을 진화시킬 때, 쌍체 게이트(pairwise gate)는 전체 보상 베이스라인만큼 잘 작동하여 코드가 더 효율적으로 변하도록 성공적으로 유도했습니다.

한계와 미래

논문은 이 방법이 모든 상황에 적용되는 마법의 지팡이는 아니라는 점을 주의 깊게 언급합니다. 이 방법은 에이전트가 개선될 여지가 남아 있을 때 가장 잘 작동합니다. 만약 에이전트가 이미 최고 수준에 도달했거나, 심판(LLM)이 과제를 혼동한다면 시스템이 정체될 수 있습니다. 또한, "테스트" 규모가 너무 작으면(예: 문항이 15개뿐인 수학 퀴즈), 동전 던지기를 몇 번 해서는 공정성을 알 수 없는 것처럼 결과가 다소 불안정할 수 있습니다.

하지만 핵심적인 발견은 게임 체인저입니다. 똑똑한 AI를 진화시키기 위해 완벽하고 값비싼 성적표가 필요한 것은 아닙니다. 동결된 AI 심판에게 두 버전을 비교하여 승자를 고르게 하는 것만으로도, 우리는 인간 전문가를 동원한 모델만큼 유능하면서도 데이터 라벨링에 드는 막대한 비용과 노력을 들이지 않는 자기 진화형 에이전트를 구축할 수 있습니다. 이는 "모든 시험지에 점수를 매기는 것"에서 "그저 최고의 에세이를 뽑는 것"으로의 전환이며, 결과적으로 그것만으로도 기계에게 생각하는 법을 가르치기에 충분하다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →