← 최신 논문
🤖 AI

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

이 논문은 수학이나 코딩과 같은 전통적인 검증 가능 영역을 넘어 대규모 언어 모델의 확장 가능하고 편향 없는 자기 개선을 가능하게 하기 위해, 사회적 추론 게임에서 영감을 받은 SpyRL 방법론으로 예시되는 바와 같이 개방형 과업을 검증 가능한 프록시 환경으로 변환하는 패러다임인 자기 검증 가능 보상을 통한 강화 학습(RLSVR)을 제안한다.

원저자: Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

게시일 2026-08-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 수학 문제를 풀거나 코드를 작성할 때 명확한 정답지가 있어 완벽한 정밀도로 수행해내는, 마치 명석한 학생과 같은 세상이 있다고 상상해 보십시오. 만약 학생이 답을 틀리면, 선생님은 즉시 그 사실을 알게 되고 학생은 실수를 통해 배웁니다. 오늘날 가장 똑똑한 AI 모델 중 상당수가 바로 이렇게 '정답'이 명확하고 확인 가능한 작업들을 연습하며 훈련됩니다. 하지만 선생님이 시나, 재미있는 이야기, 혹은 긴 뉴스 보고서의 요약을 요구한다면 어떻게 될까요? 창의성에는 단 하나의 정답이 존재하지 않습니다. 컴퓨터는 인간 교사가 모든 답안지를 일일이 채점하지 않는 상황에서, 자신의 이야기가 "좋다"는 것을 어떻게 알 수 있을까요? 이것이 바로 연구자들이 해결하려고 노력 중인 거대한 퍼즐입니다. 즉, 매번 옆에서 지켜보는 인간 없이도 AI가 개방형 창의적 과업을 더 잘 수행하도록 가르치는 방법입니다.

여러분이 곧 읽게 될 논문은 "자기 지도 학습(self-supervised learning)"이라는 다른 과학 분야의 기법을 빌려와 이 문제를 다룹니다. 이것은 마치 학생이 선생님이 퀴즈를 내주기를 기다리는 대신, 스스로 연습을 위한 작은 게임을 만들어내는 것과 같습니다. 문장에서 단어 하나를 가려놓고 그것이 무엇이었는지 추측하는 식이죠. 비록 이 게임이 최종 시험은 아닐지라도, 이 게임을 플레이하는 행위 자체가 언어를 더 잘 이해하도록 도와줍니다. 이 논문의 연구자들은 다음과 같이 질문합니다. "정답지가 없는 상황에서도 AI가 글쓰기와 추론 능력을 향상시키기 위해 이와 유사한 게임을 수행하게 만들 수 있을까?" 그들은 RLSVR(Reinertforcement Learning with Self-Verifiable Rewards, 자기 검증 가능한 보상이 있는 강화 학습)이라 불리는 새로운 AI 훈련 방식을 제안합니다. AI에게 이야기가 "좋다"인지 아닌지를 추측하게 하는 대신(이는 어렵고 주관적인 일입니다), 엄격하고 내장된 규칙을 사용하여 AI가 자신의 작업을 스스로 확인할 수 있는 게임으로 과업을 변환하는 것입니다.

스파이 게임: AI가 더 나은 글쓰기를 배우는 법

연구자들은 이 아이디어를 구체화한 SpyRL이라는 버전을 구축했습니다. 이를 이해하기 위해, 다섯 명의 친구가 원형으로 둘러앉아 "스파이를 찾아라!"(유명한 파티 게임인 'Who Is the Spy?'에서 영감을 얻음) 게임을 하고 있다고 상상해 보십시오.

AI 세계에서의 게임 방식은 다음과 같습니다:

  1. 설정: 그룹에게 "사랑에 빠진 로봇에 대한 이야기를 써라"와 같은 글쓰기 프롬프트가 주어집니다. 네 명의 플레이어("시민")는 완전하고 전체적인 프롬프트를 받습니다. 한 명의 플레이어("스파이")는 깨지거나 불완전한 버전의 프롬프트를 받습니다. 예를 들어 단어의 절반이 누락되었거나 뒤섞여 있는 형태입니다.
  2. 수행: 모두는 자신이 본 것을 바탕으로 글을 써야 합니다. 시민들은 모든 정보를 가지고 있으므로 훌륭하고 상세한 이야기를 쓸 수 있습니다. 반면, 스파이는 정보가 부족합니다. 들키지 않기 위해서, 스파이는 누락된 부분이 무엇이었는지 추측해야 하며, 비록 눈을 가린 채로 진행하더라도 주제에 부합하는 것처럼 보이는 이야기를 써내야 합니다.
  3. 탐지: 모두가 글쓰기를 마친 후, 그룹은 모든 이야기를 읽고 누가 스파이라고 생각하는지 투표합니다.
  4. 보상: 여기가 마법 같은 부분입니다. 게임을 실행하는 컴퓨터는 (누가 스파이였는지 역할을 할당했으므로) 즉시 누가 스파이였는지 알고 있습니다. 따라서 투표 결과를 즉각 확인할 수 있습니다.
    • 만약 그룹이 스파이를 정확히 찾아냈다면, 투표자들은 보상을 받습니다.
    • 만약 스파이가 투표로 탈락했다면, 스파이는 "벌점"(낮은 점수)을 받습니다.
    • 만약 시민들이 실수로 투표를 당했다면, 그들은 더 낮은 점수를 받게 됩니다.

이것은 완벽한 자기 검증 루프를 생성합니다. AI는 인간에게 "그 이야기는 지루해"라는 말을 들을 필요가 없습니다. 대신, 게임 규칙이 피드백을 제공합니다. 만약 스파이의 이야기가 너무 모호하거나 주제와 맞지 않는다면, 다른 플레이어들이 이를 알아차리고 스파이를 투표로 탈락시킬 것입니다. 만약 시민들이 쓴 이야기가 혼란스럽거나 주제에서 벗어났다면, 그들은 실수로 투표를 당할 수 있으며, 이는 그들에게 더 명확하게 글을 쓰도록 가르칩니다.

연구 결과

연구자들은 이 "스파이 게임"을 세 가지 매우 다른 유형의 과업에 대해 테스트했습니다:

  • 긴 보고서 요약 (예: 20페이지 분량의 정부 문서를 짧은 요약본으로 만드는 것).
  • 창의적 글쓰기 (프롬프트를 바탕으로 이야기 쓰기).
  • 수학적 추론 (복잡한 수학 문제 풀기).

결과는 꽤 놀라웠습니다. 보통 창의적인 결과물이 얼마나 좋은지 "추측"하는 데 의존하는 방식(다른 AI 모델을 심판으로 사용하는 방식)은 크게 개선되지 못하고 고전합니다. 하지만 SpyRL은 과업을 명확한 규칙이 있는 게임으로 변환함으로써, AI가 더 나은 이야기와 요약문을 쓰도록 가르치는 데 성공했습니다.

실험에서 SpyRL로 훈련된 AI는 다른 고급 자기 개선 방식들을 앞질렀습니다. 예를 들어, 창의적 글쓰기 과업에서 SpyRL로 훈련된 모델은 동일한 모델의 훈련되지 않은 버전과 비교했을 때 약 **77.3%**의 승률을 기록했습니다. 정답이 보통 확인 가능한 수학 문제에서도 SpyRL은 점수를 유의미하게 높였으며, 일부 어려운 벤치마크에서 모델의 수학 정확도를 거의 9% 가까이 끌어올렸습니다.

이 논문은 이 접근 방식이 효과적인 이유가 AI로 하여금 자신의 출력물의 품질에 집중하게 만들기 때문이라고 시사합니다. 게임에서 이기기 위해서(혹은 최소한 지지 않기 위해서), AI는 일관성 있고 창의적이며 논리적으로 타당한 이야기를 써야 합니다. 만약 약하거나 혼란스러운 내용을 쓴다면, 게임 속 다른 플레이어들에게 "들키게" 됩니다.

이것이 중요한 이유

핵-결론은 AI에게 창의성을 가르치기 위해 인간 교사나 완벽한 정답지가 반드시 필요하지는 않다는 것입니다. 모호한 과업(예: "좋은 이야기를 써라")을 숨겨진 역할과 명확한 승패 조건이 있는 구조화된 게임으로 변환함으로써, AI는 스스로를 개선하는 법을 배울 수 있습니다. 연구자들은 이 방법이 수학(답을 확인하기 쉬운 분야)뿐만 아니라, "옳음"이 대개 의견의 문제인 글쓰기와 요약에서도 작동한다는 것을 보여주었습니다.

그들은 게임에 참여하는 플레이어가 많아질수록(특정 지점까지는) 훈련 신호가 더 좋아진다는 것을 발견했는데, 이는 AI들의 "군중"이 토론하고 투표하는 과정이 나쁜 아이디어를 걸러내는 데 도움이 된다는 것을 암시합니다. 이 논문이 AI의 모든 문제를 해결한다고 주장하는 것은 아니지만, 인간 창의성의 무질서하고 주관적인 세계를 컴퓨터가 스스로 플레이하고, 이기고, 배울 수 있는 게임으로 바꾸는 유망한 새로운 길을 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →