AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
이 논문은 참조 궤적으로부터 조밀한 단계별 보상을 추론하기 위해 적대적 역강화학습(Adversarial Inverse Reinforcement Learning)과 그룹 상대적 정책 최적화(Group Relative Policy Optimization)를 결합하여, 레이블이 지정된 프로세스 데이터의 필요성을 제거하는 동시에 수학, 과학 및 코드 생성 벤치마크 전반에서 GPT-4o 수준의 성능을 달성하는 강력하고 비용 효율적인 테스트 시간 스케일링을 가능하게 하는 통합 프레임워크인 AIRL-S를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델은 현대 인공지능 시스템의 강력한 엔진으로서, 텍스트 생성, 문제 해결, 코드 작성 등을 수행할 수 있습니다. 수년 동안 연구자들은 모델에게 문제를 단계별로 생각하도록 가르치는 "사고의 사슬(chain of thought)"이라는 방법을 통해 이러한 시스템을 더 똑똑하게 만들고자 노력해 왔습니다. 그러나 모델에게 논리적으로 추론하는 법을 가르치는 것은 매우 어려운데, 이는 컴퓨터가 최종 정답이 맞는지 틀린지만 알 뿐, 그 정답에 이르는 과정의 단계들이 논리적이었는지는 알지 못하기 때문입니다. 이를 해결하기 위해 과학자들은 두 가지 주요 접근 방식을 시도했습니다. 하나는 작업의 맨 마지막 단계에서만 보상을 주는 방식으로 모델을 훈련시키는 것인데, 이는 불안정하고 비효율적일 수 있습니다. 다른 하나는 별도의 가이드를 사용하여 추론 과정의 모든 단계를 점검하는 것이지만, 이 가이드를 만드는 데는 대개 수천 개의 사례를 라벨링할 값비싼 전문가가 필요하며, 모델이 새로운 방식으로 생각하기 시작하면 이 가이드가 제대로 작동하지 않는 경우가 많습니다.
연구팀은 이 두 가지 접근 방식을 하나의 자기 개선 루프로 통합한 AIRL-S라는 새로운 시스템을 선보였습니다. 매 단계마다 인간의 라벨에 의존하는 대신, 이 시스템은 고품질의 추론 사례를 관찰함으로써 스스로 내부 가이드를 만드는 법을 배웁니다. 그런 다음 이 가이드를 사용하여 모델을 훈련시키고, 실제 사용 시 최적의 답을 찾는 데 도움을 줍니다. 수학, 과학, 코딩을 포함한 8가지 벤치마크 테스트에서 연구진은 이 방법이 기존 버전보다 평균 9%의 성능 향상을 가져왔음을 발견했습니다. 결과적으로 이 시스템은 막대한 비용이 드는 인간의 감독 없이도 GPT-4o와 같은 가장 진보된 상용 모델만큼의 성능을 보여주었습니다.
핵심 혁신은 시스템이 자신의 작업을 판단하는 법을 배우는 방식에 있습니다. 전통적으로 모델에게 단계별 추론을 가르치기 위해 연구자들은 인간이 모든 단계의 정오답을 표시한 데이터로 훈련된 별도의 프로그램인 "과정 보상 모델(process reward model)"이 필요했습니다. 이는 느리고 비용이 많이 듭니다. 새로운 방법은 적대적 학습(adversarial learning)이라 불리는 기술을 사용하여 이 문제를 우회합니다. 시스템이 한쪽에서는 추론 단계를 생성하고, 다른 한쪽에서는 생성된 단계와 고품질의 참조 사례를 구별하려고 노력하는 게임을 한다고 상상해 보십시오. 이러한 경쟁을 통해 시스템은 인간에게 명시적으로 배우지 않고도 무엇이 좋은 추론 단계인지 인식하는 법을 배웁니다. 이렇게 학습된 가이드, 즉 보상 모델은 조밀하고 상세해져서, 단순히 최종 결과만을 제공하는 것이 아니라 추론 과정의 모든 단계에 대해 피드백을 제공합니다.
시스템이 이 내부 가이드를 학습하고 나면, 이를 두 가지 방식으로 동시에 사용합니다. 첫째, 학습 단계에서 더 나은 단계를 밟도록 장려하기 위해 메인 모델을 훈련시키는 데 이 가이드를 사용합니다. 둘째, 실제 문제 해결 단계에서 검증 도구로 사용하기 위해 동일한 가이드를 유지합니다. 모델이 어려운 문제를 풀도록 요청받으면, 시스템은 여러 가지 가능한 해결책을 생성할 수 있습니다. 이때 학습된 가이드는 이러한 잠재적 해결책들의 각 단계를 점수화하여 시스템이 가장 논리적인 경로를 선택할 수 있도록 돕습니다. 이는 모델을 가르치는 도구와 모델이 테스트 중에 생각하는 것을 돕는 도구가 동일하게 되는 통합된 파이프라인을 만듭니다. 연구진은 이 가이드가 견고하다는 것을 입증했는데, 이는 서로 다른 모델이나 서로 다른 탐색 전략에 적용했을 때도 효과적으로 작동하며, 이는 학습된 지식이 일반적이고 전이 가능하다는 것을 시사합니다.
이 접근 방식의 결과는 광범위하고 도전적인 과제들을 통해 측정되었습니다. 연구진은 복잡한 수학 경시 대회, 과학적 추론 질문, 코딩 챌린지를 포함한 8가지 표준 벤치마크에서 모델을 테스트했습니다. 표준 오픈 소스 언어 모델로 시작한 이 모델은 이 새로운 방법으로 훈련한 후 평균 정확도가 9% 향상되었습니다. 특정 수학 및 과학 과제에서는 그 향상 폭이 13%에 달할 정도로 더 높았습니다. 값비싼 인간 라벨링 데이터나 다른 고급 강화 학습 기술으로 훈련된 다른 모델들과 비교했을 때, 이 새로운 시스템은 일관되게 더 나은 성능을 보였습니다. 심지어 훨씬 적은 파라미터를 가지고 있음에도 불구하고 최고 수준의 상용 모델인 GPT-4o의 성능에 필적했습니다. 이는 단순하게 모델의 크기를 키우는 것보다, 스스로 학습된 보상 시스템에 의해 유도되는 추론 과정의 질이 더 중요하다는 것을 시사합니다.
본 연구의 핵심 발견은 두 가지 서로 다른 유형의 학습 신호가 어떻게 함께 작-용하는지에 관한 것입니다. 시스템은 스스로 학습한 가이드의 상세한 단계별 피드백과 전통적인 방식의 최종 결과 보상을 결합합니다. 연구진은 한 가지 유형의 신호에만 의존하는 것이 덜 효과적이라는 것을 발견했습니다. 단계별 가이드는 모델이 더 나은 추론 경로를 탐색하도록 도왔고, 최종 결과 신호는 모델이 정답을 맞히는 데 집중하도록 유지했습니다. 이 두 신호가 적절히 균형을 이룰 때, 이들은 서로를 강화하여 더 안정적인 훈련과 더 나은 결과를 이끌어냈습니다. 또한, 시스템은 한 번에 많은 해결책을 시도하거나 가능성의 트리를 구축하는 것과 같은 다양한 탐색 방법을 개선하는 데 이 학습된 가이드를 사용할 수 있음을 보여주었습니다. 이 가이드는 모델이 최선의 선택을 하기 위해 중간 단계의 가치를 평가해야 하는 복잡한 탐색 시나리오에서 특히 효과적이었습니다.
이 연구의 함의는 단순히 테스트 점수를 높이는 것을 넘어섭니다. 단계별 추론을 위한 값비싼 인간 주석에 대한 의존성을 제거함으로써, 이 방법은 인공지능을 개선할 수 있는 더 확장 가능하고 비용 효율적인 방법을 제시합니다. 이는 모델이 고품질의 사례를 관찰하고 스스로와 경쟁함으로써 자신의 추론 능력을 정교화하는, 스스로의 스승이 되는 법을 배울 수 있음을 시사합니다. 연구진은 이 접근 방식이 수학이나 코딩처럼 최종 정답을 자동으로 검증할 수 있는 작업에 특히 적합하다고 언급했습니다. 이 방법은 강력하지만, 저자들은 현재 검증 가능한 결과물에 의존하고 있으며, 단일 정답이 존재하지 않는 개방형 과제를 다루기 위해서는 추가적인 개발이 필요할 수 있음을 인정했습니다. 그럼에도 불구하고, 훈련과 추론 시의 탐색을 하나의 효율적인 시스템으로 통합한 것은 대규모 언어 모델을 더 신뢰할 수 있고 유능한 추론가로 만드는 데 있어 중요한 진전을 의미합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.