← 최신 논문
💻 computer science

GraphPO: Graph-based Policy Optimization for Reasoning Models

GraphPO는 추론 롤아웃을 유향 비순환 그래프로 표현하여 의미론적으로 동일한 경로를 병합하고 브랜치 간에 정보를 공유함으로써 중복된 탐색과 어드밴티지 추정 분산을 줄이고, 기존의 체인 및 트리 기반 방식보다 추론 벤치마크에서 더 뛰어난 성능을 보이는 새로운 그래프 기반 강화 학습 프레임워크를 도입한다.

원저자: Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 약간 반복적인 습관이 있는 학생에게 복잡한 수학 문제를 풀거나 코드를 작성하는 법을 가르치고 있다고 상상해 보세요. 당신은 단계별 지침을 주는 대신, 학생이 다양한 접근 방식을 시도하도록 내버려 둡니다. 그리고 맨 마지막에만 "정답!" 또는 "오답."이라고 말해줍니다.

이것이 현재의 AI 모델(Large Reasoning Models라고 불리는)이 학습하는 방식입니다. 그들은 정답을 맞힐 때까지 추측하고, 또 추측하고, 또 추측합니다. 하지만 이 방법에는 두 가지 큰 문제가 있으며, 이 논문은 GraphPO가 이를 해결하고자 하는 목표를 설명합니다.

문제점: "외로운 탐험가"와 "가지치기 나무"

1. 낭비되는 노력 (Chain 방식)
100명의 학생을 미로 속으로 보낸다고 상상해 보세요. 각 학생은 완전히 별개의 경로를 걷습니다.

  • 문제점: 학생들은 서로 다른 경로를 걷고 있음에도 불구하고, 50명은 정확히 똑같은 막다른 길에 갇히거나 똑같이 혼란스러운 복도를 지나갈 수 있습니다. 그들은 시간과 에너지를 계속해서 똑같은 일을 반복하며 낭비하고 있는 것입니다. AI 용어로는 이를 "중복된 탐색(redundant exploration)"이라고 합니다.

2. "나무(Tree)" 방식 (개선되었으나 완벽하지 않음)
이 낭비를 해결하기 위해 연구자들은 "나무" 방식을 시도했습니다. 학생들이 함께 출발하여 첫 번째 갈림길에서 갈라진다고 상상해 보세요. 만약 두 학생이 같은 첫 번째 방향을 선택했다면, 그들은 잠시 동안 함께 걷습니다.

  • 문제점: 이것은 도움이 되지만, 두 번째 갈림길에서 다시 갈라지면 그들은 다시 각자 도생하게 됩니다. 만약 두 개의 서로 다른 가지가 결국 (비록 경로는 달랐을지라도) 동일한 혼란스러운 복도로 이어진다면, 학생들은 자신들이 같은 장소에 있다는 사실을 알지 못합니다. 그들은 그 복도를 각자 따로 탐색하며 시간을 더 낭비하게 됩니다. 또한, 한 학생이 그 복도에서 출구를 찾더라도 다른 학생들에게 "좋은 소식"을 공유할 수 없습니다. 다른 학생들은 계속해서 혼자서 추측을 이어갈 뿐입니다.

해결책: "스마트 지도" (GraphPO)

저자들은 GraphPO를 제안하는데, 이는 학생들에게 단순히 나무 형태의 경로를 주는 대신 살아있는 공유 지도를 주는 것과 같습니다.

작동 방식:

  1. 지도 (그래프): AI는 단순히 선(가지)을 그리는 대신, 모든 "방"(추론의 한 단계)이 노드(node)가 되는 지도를 그립니다.
  2. 쌍둥이 찾기 (의미적 병합): AI가 탐색을 진행하면서, 서로 다른 경로들이 도달한 "방"들을 살펴봅니다. 만약 두 개의 서로 다른 경로가 (비록 그곳에 도달하기 위해 사용한 단어는 약간 다를지라도) 느낌상 같은 방에 도착했다면, AI는 "헤이, 너희 둘은 같은 곳에 있어!"라고 말하며 그들을 하나의 지점으로 병합합니다.
  3. 좋은 소식 공유하기 (접미사 공유): 두 경로가 병합되면, 그들은 그 지점 이후의 모든 것을 공유합니다. 만약 한 경로가 병합된 지점에서 정답을 찾아내면, 다른 경로 역시 나머지 길을 다시 걸을 필요 없이 즉시 그 성공에 대한 공로를 인정받게 됩니다.
  4. "효율성" 보너스: AI는 또한 특정 "방"에 도달하기 위한 가장 짧은 경로를 선호하도록 학습합니다. 경로 A가 좋은 지점에 도달하는 데 10단계를 거쳤고, 경로 B가 같은 지점에 도달하는 데 15단계를 거쳤다면, AI는 경로 A를 선호하도록 학습합니다. 이는 마치 지름길을 찾아낸 학생에게 보상을 주는 것과 같습니다.

결과: 더 똑똑하고, 빠르고, 덜 낭비함

"스마트 지도" 접근 방식을 사용함으로써, GraphPO는 세 가지 주요 성과를 달로 이뤄냈습니다.

  • 더 이상의 낭비되는 단계 없음: AI가 똑같은 막다른 길을 두 번 탐색하는 것을 막아줍니다. 이는 AI의 "예산"(컴퓨팅 파워)을 새로운 영역을 탐색하는 데 재배치합니다.
  • 실수를 통한 더 나은 학습: 경로를 병합하기 때문에, 최종 답이 완벽하지 않더라도 "이 특정 단계가 좋았다"라는 것을 훨씬 더 빨리 AI에게 알려줄 수 있습니다. 이는 막연한 "결국엔 맞혔다"를 명확한 "이 특정 움직임이 영리했다"로 바꾸어 놓습니다.
  • 더 짧은 답변: 솔루션에 도달하는 가장 짧은 경로를 보상하기 때문에, AI는 불필요한 잡담을 줄이고 더 간결하고 효율적으로 답변하는 법을 배웁니다.

핵심 요약

이 논문은 세 가지 서로 다른 AI 모델을 대상으로 수학 문제, 코딩, 검색 작업에서 테스트를 진행했습니다. 결과는 GraphPO가 기존 방식들(외로운 탐험가 방식과 가지치기 나무 방식 모두)을 일관되게 앞질렀음을 보여주었습니다. GraphPO는 동일한 컴퓨팅 파워를 사용하면서도 더 많은 문제를 풀었고, 더 적은 단어를 사용했으며, 더 빠르게 학습했습니다.

요약하자면, GraphPO는 AI에게 원을 그리며 걷는 것을 멈추고 지도를 공유하는 법을 가르쳐서, 학습 과정을 훨씬 더 똑똑하고 덜 낭비되도록 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →