← 최신 논문
💬 NLP

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

본 논문은 벡터 보상 값을 활용하여 언어 모델이 다양한 해법을 생성하도록 훈련하는 강화 학습 알고리즘인 벡터 정책 최적화 (VPO) 를 소개하며, 이를 통해 표준 스칼라 보상 최적화보다 테스트 시간 검색 절차에서의 성능을 크게 향상시킵니다.

원저자: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 매우 까다로운 음식 평론가를 위해 요리하는 새로운 견습생을 훈련시키는 셰프입니다. 이 평론가는 단순히 "맛있는 한 끼"를 원하지 않습니다. 그들은 특정한 욕망들로 구성된 복잡한 메뉴를 가지고 있습니다: 아마도 스테이크는レア로, 소스는 매콤하게, 야채는 바삭하게, 그리고 플레이팅은 예술적으로 원할지도 모릅니다.

구식 방법: "일률적" 셰프

과거에 인공지능 (대규모 언어 모델과 같은) 을 훈련시킬 때, **스칼라 보상 최적화 (Scalar Reward Optimization)**라는 방법을 사용했습니다 (이 방법은 GRPO 논문에 등장합니다).

이는 견습생에게 다음과 같이 말하는 것과 같습니다: "너의 목표는 단일 숫자를 기반으로 가능한 한 높은 점수를 얻는 것이다: 스테이크 품질 50% + 소스 품질 50%."

견습생은 곧 최고 점수를 얻으려면 실험을 멈춰야 한다는 사실을 깨닫습니다. 그들은 완벽한 "스테이크 - 소스" 조합을 계속해서 똑같이 요리할 것입니다. 그들은 단 하나의 특정 요리에 능숙한 마스터가 됩니다.

  • 문제점: 실제로 평론가가 나타나면, 그들은 "사실 오늘 나는 스테이크를 미디엄 - 레어로, 소스를 달콤하게 원해"라고 말할 수 있습니다. 견습생은 오직 하나의 특정 레시피만 연습했기 때문에 무엇을 해야 할지 모릅니다. 그들에게는 하나의 답변만 있을 뿐이며, 그것은 오늘의 특정 기분에 맞는 잘못된 답변입니다.

새로운 방법: 벡터 정책 최적화 (VPO)

이 논문은 **벡터 정책 최적화 (Vector Policy Optimization, VPO)**라는 새로운 훈련 방법을 제안합니다.

단일 점수를 주는 대신, 훈련자는 다음과 같이 말합니다: *"나는 너에게 서로 다른 목표들의 목록을 줄 것이다. 때로는 스테이크에, 때로는 소스에, 때로는 야채에 집중하도록 해. 나는 너가 한 번에 서로 다른 조합의 마스터피스인 다양한 요리들로 구성된 접시를 만들기를 원해."*

견습생은 다양한 해결책들의 집합을 만드는 법을 배웁니다:

  1. 요리 A: 완벽한 스테이크, 간단한 소스.
  2. 요리 B: 순한 스테이크, 복잡한 매콤한 소스.
  3. 요리 C: 바삭한 야채, 예술적인 플레이팅.

그들은 단 하나의 최고의 요리를 찾으려 하지 않습니다. 그들은 가능한 모든 맛있는 조합의 "지도" 전체를 커버하려 합니다 (논문의 용어로 파레토 프론티어).

"테스트 시간 검색" (평론가가 도착하다)

여기서 마법이 일어납니다. 이 논문은 현대 AI 시스템에서 AI 가 단순히 하나의 답변을 내뱉고 최선의 결과를 기대하는 것이 아니라, 대신 사용 (추론) 순간에 검색 엔진처럼 행동한다고 주장합니다.

평론가가 "스테이크는 레어로 하지만 소스는 달콤하게"와 같은 구체적이고 독특한 요청을 가지고 도착하면, 시스템은 AI 에게 처음부터 새로운 요리를 만들라고 요청하지 않습니다. 대신, 견습생이 훈련 중에 준비한 다양한 요리들의 접시를 살펴봅니다.

  • 구식 셰프 (GRPO): 평론가가 접시를 봅니다. 그것은 100 개의 동일한 "스테이크 - 소스 #1" 요리로 가득 차 있습니다. 평론가는 원하는 것을 찾을 수 없습니다.
  • VPO 셰프: 평론가가 접시를 봅니다. 레어로 스테이크와 달콤한 소스가 있는 요리가 있습니다! 시스템이 그것을 선택합니다.

이것이 중요한 이유

이 논문은 네 가지 다른 "주방" (논리 퍼즐 해결, 미로 탐색, 코드 작성과 같은 작업) 에서 이를 테스트했습니다.

  1. 더 많은 후보 = 더 나은 결과: 시스템이 더 많은 요리 (더 큰 "검색 예산") 를 볼 수 있도록 허용됨에 따라, VPO 셰프는 완벽한 매칭을 찾아내는 데 점점 더 능숙해졌습니다. 구식 셰프의 성능은 제공할 수 있는 요리 종류가 하나뿐이었기 때문에 한계에 부딪혔습니다.
  2. 불가능을 해결하다: 매우 어려운 코딩 도전 과제 (LiveCodeBench) 에서 구식 셰프는 몇 번 시도해 보아도 문제를 전혀 해결하지 못했습니다. 반면, VPO 셰프는 검색 도구와 결합되었을 때 문제를 해결할 수 있었던 다양한 "시도" 집합을 가지고 있었습니다.
  3. "다양성 함정": 논문은 목표들이 본질적으로 모두 같다면 (예: "빨간색으로 만들어"와 "파란색으로 만들어"에서 빨간색과 파란색이 같은 것이라면), VPO 는 도움이 되지 않는다고 지적합니다. 목표들이 truly 다르며 트레이드오프가 필요할 때만 빛을 발합니다.

결론

이 논문은 여러 옵션을 검색하여 최선의 것을 찾는 시스템 내에서 AI 를 사용하려는 경우, AI 를 하나의 완벽한 답변에 특화된 "전문가"로 훈련해서는 안 된다고 주장합니다. 대신, AI 를 고품질 옵션들의 다양한 포트폴리오를 생산하는 일반인으로 훈련해야 합니다.

훈련 동안 AI 가 서로 다른 "맛"의 해결책들을 탐색하도록 허용함으로써, 테스트 시간의 검색 시스템이 선택할 수 있는 훨씬 더 풍부한 메뉴를 제공하게 되어, 더 지능적이고 적응력 있는 결과로 이어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →