← 최신 논문
💻 computer science

One-Way Policy Optimization for Self-Evolving LLMs

본 논문은 비대칭 재가중치와 반복적 참조 업데이트를 통해 최적화 방향과 업데이트 크기를 분리함으로써 대규모 언어 모델의 자기 진화를 안정화하고 향상시키는 새로운 방법인 원방향 정책 최적화 (OWPO) 를 소개하며, 이를 통해 기존 토큰 수준 제약의 비효율성을 극복하고 외부 참조 모델 없이도 지속적인 개선을 가능하게 합니다.

원저자: Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"자기 진화형 LLM 을 위한 일방향 정책 최적화"라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어냅니다.

큰 문제: "중간에 갇힌" 딜레마

복잡한 수학 문제를 해결하도록 로봇 (AI) 을 가르친다고 상상해 보세요. 여기 해답의 끝부분에서만 "맞다" 또는 "틀리다"라고만 말할 수 있는 심사관(검증자)이 있습니다.

  • 문제점: 심사관은 끝부분에서만 말하기 때문에 로봇은 종종 길을 잃습니다. 어느 단계가 틀렸는지 알 수 없으므로 학습이 느리고 혼란스러워집니다.
  • 옛날 해결책: 도움을 주기 위해 연구자들은 참조 모델(선생님)을 도입했습니다. 그들은 로봇에게 "선생님의 스타일에 가깝게 지내라"고 말했습니다. 이로 인해 학습이 안정화되었지만, 새로운 문제가 생겼습니다.
  • 새로운 문제: 때로는 로봇이 선생님보다 문제를 해결하는 더 나은 방법을 찾아냅니다. 하지만 로봇이 선생님에게서 멀어지지 않도록 강요받기 때문에, 시스템은 로봇이 다르다는 이유로 처벌합니다. 마치 학생이 정답으로 가는 더 빠른 지름길을 발견했는데, 선생님이 "안 돼! 내가 가르쳐 준 긴 길을 걸어야 해!"라고 소리치는 것과 같습니다. 로봇은 갇혀서 선생님의 수준을 넘어서 개선할 수 없게 됩니다.

해결책: 일방향 정책 최적화 (OWPO)

저자들은 OWPO라는 새로운 방법을 제안합니다. 이를 방향속도를 분리하는 똑똑한 코치라고 생각하세요.

1. 코치의 규칙:

  • 방향: 심사관이 갈 방향을 결정합니다. 심사관이 "이 길은 좋다"고 말하면 로봇은 그 방향으로 갑니다. "이 길은 나쁘다"고 말하면 로봇은 방향을 바꿉니다. 선생님은 절대 방향을 결정하지 않습니다.
  • 속도: 선생님이 얼마나 빠르게 움직일지 결정합니다.

2. 비대칭 재가중 (양방향 거리):
OWPO 는 로봇의 시도가 선생님보다 "나쁨"인지 "더 좋음"인지에 따라 다르게 처리합니다.

  • 상황 A: 로봇이 뒤처질 때 (열등한 편차)
    • 상황: 로봇이 불확실하거나 실수를 하는 반면, 선생님은 확신하는 부분입니다.
    • 행동: 코치는 학습 속도를 가속합니다. "여기서는 선생님보다 뒤처졌어! 빨리 움직여서 따라잡아!"라고 말합니다. 이를 가속 정렬이라고 합니다.
  • 상황 B: 로봇이 앞서갈 때 (우월한 편차)
    • 상황: 로봇이 선생님보다 더 나은 해답을 찾거나 더 확신할 때입니다.
    • 행동: 코치는 변화를 늦춥니다. "여기서는 아주 잘하고 있어! 너무 많이 바꾸면 실수로 이 좋은 아이디어를 잃을 수 있어"라고 말합니다. 이를 이득 잠금이라고 합니다. 이는 로봇의 새롭고 더 나은 아이디어가 무작위 잡음에 의해 씻겨 나가는 것을 보호합니다.

"라쳇 효과": 천장 깨기

과거에는 로봇이 선생님만큼 잘하게 되면, 선생님이 한계였기 때문에 더 이상 나아갈 수 없었습니다.

OWPO 는 라쳇 메커니즘(한 방향으로만 돌아가고 절대 미끄러지지 않는 도구와 같은)을 도입합니다.

  • 몇 단계마다 로봇은 휴식을 취하고 자신의 가장 좋은 작업을 돌아보며 "좋아, 이제 가 선생님이다"라고 말합니다.
  • 참조 모델을 자신의 현재 최선으로 업데이트합니다.
  • 이는 사다리를 만듭니다. 로봇은 올라가고, 발판을 잠그고, 더 높이 오르기 위해 그 새로운 높이를 기반으로 삼습니다. 로봇은 결코 낡고 약한 선생님 수준으로 다시 미끄러지지 않습니다.

왜 중요한가 (결과)

이 논문은 수학 문제 (AIME 대회 등) 로 이를 테스트했습니다.

  • 옛날 방법: 로봇은 선생님의 수준 근처에 갇혔습니다. 선생님이 37% 수준이었다면, 로봇은 37% 나 38% 부근을 맴돌았습니다.
  • OWPO: 로봇은 천장을 깨뜨렸습니다. 30% 에서 시작해 선생님을 지나쳐 40% 이상의 정확도에 도달했습니다.
  • 안정성: 너무 창의적이 되려고 할 때 추락하거나 불안정해질 수 있는 다른 방법들과 달리, OWPO 는 좋은 아이디어를 "잠금"으로 고정시켜 로봇을 안정적으로 유지합니다.

요약 비유

산 정상을 오르는 등산객 (AI) 을 상상해 보세요.

  • 심사관은 정상으로 가리키는 나침반입니다.
  • 옛날 선생님은 "이 특정 등산로에 머무르라"고 말하는 지도였습니다. 등산객이 지름길을 발견해도, 그 지도는 그를 다시 옛날 등산로로 되돌려 보냈습니다.
  • OWPO는 똑똑한 가이드입니다. 가이드는 말합니다. "등산로에서 벗어나 길을 잃었다면, 제자리로 돌아오기 위해 빨리 달려라. 하지만 더 높은 곳으로 이어지는 지름길을 발견했다면, 미끄러지지 않도록 천천히 조심스럽게 걸으되, 그 새로운 길을 계속 걸어라. 새로운 고지에 도달하면, 이제 가 전문가임을 보여주는 지도로 업데이트하고, 그곳에서 다음 지름길을 찾기 시작하라."

이를 통해 AI 는 영원히 외부의 "초선생님"이 손을 잡아줄 필요 없이 지속적으로 진화하며 점점 더 나아질 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →