← 최신 논문
🤖 machine learning

Maximum Likelihood Reinforcement Learning

이 논문은 기대 보상 강화 학습과 최대 가능도 사이의 간극을 메우기 위해 기존 방법론들을 파레토 우위(Pareto-dominate)에 서게 하고 테스트 시점의 스케일링 효율성을 크게 향상시키는 계산 인덱스 기반의 목적 함수를 제공하는 새로운 프레임워크인 최대 가능도 강화 학습(MaxRL)을 소개한다.

원저자: Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

게시일 2026-08-21
📖 5 분 읽기🧠 심층 분석

원저자: Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 컴퓨터가 생각하는 법을 가르치는 두 가지 지배적인 방법이 있습니다. 첫 번째는 모든 질문에 대해 정답을 제공하여 학생이 자신의 작업물을 정답지와 비교하고 그에 따라 이해도를 조정할 수 있게 하는 엄격한 교사와 같습니다. 이 방법은 강화 학습(supervised learning)이라고 알려져 있으며, 오늘 우리가 사용하는 가장 인상적인 이미지 인식기와 언어 도구들을 발전시켜 왔습니다. 두 번째 접근 방식은 아이가 걷는 법을 배우는 것과 더 비슷합니다. 여기에는 정답지가 없으며, 오직 환경만이 존재합니다. 학습자는 한 걸음을 내디뎌 보고, 넘어지고, 다시 시도하며, 결국 행동의 결과를 느낌으로써 균형을 잡는 법을 배웁니다. 이것이 강화 학습(reinforcement learning)이며, 해결책으로 가는 경로가 데이터의 직선 형태가 아니라 최종 결과로 이어지는 일련의 선택들로 이루어진 상황을 위해 설계된 방법입니다. 수년 동안 AI 시스템이 문제의 끝에서 단순히 "예" 또는 "아니오"라는 피드백만을 받는 상황, 예를 들어 수학 문제를 풀거나 미로를 탐색하는 상황에 직면했을 때, 연구자들은 이 두 번째 방법에 의존해 왔습니다. 그들은 이 문제를 보상을 극대화하는 게임으로 취급하며, AI가 충분한 "예" 신호를 얻을 수만 있다면 성공하는 법을 배울 것이라고 가정했습니다.

한 새로운 연구는 이러한 오랜 가설에 도전하며, 이 시스템들을 가르치는 표준적인 방식이 사실 훨씬 더 강력하지만 이전에는 접근할 수 없었던 원리의 거친 근사치에 불과하다는 점을 시사합니다. 여러 대학에 걸쳐 진행된 이 연구에서 연구진은 AI 모델이 정답을 생성할 때, 암묵적으로 성공의 확률을 생성한다는 사실을 발견했습니다. 완벽한 세상이라면 모델이 이 확률을 직접적으로 극대화하는 것이 최선의 방법일 것입니다. 이를 '최대 우도(maximum likelihood)' 개념이라고 합니다. 그러나 답을 생성하는 과정은 종-종 컴퓨터의 내부 수학으로는 쉽게 측정할 수 없는 예측 불가능한 단계들을 포함하기 때문에, 과학자들은 대신 강화 학습이라는 "게임" 접근 방식을 사용해야만 했습니다. 새로운 연구는 이 표준적인 접근 방식이 진정한 목표에 대한 1차적인 추측일 뿐이라는 것을 증명합니다. 이는 모델이 고군분투하면서도 결국 성공하는 드문 순간들에 숨겨진 미묘하고 결정적인 정보를 놓치고 있습니다. '최대 우도 강화 학습(Maximum Likelihood Reinforcement Learning)', 즉 MaxRL이라는 새로운 훈련 프레임워크를 개발함으로써, 연구팀은 시스템이 이전에는 불가능했던 정밀도로 성공으로부터 학습할 수 있도록 이 간극을 메우는 방법을 찾아냈습니다.

이 발견의 핵심은 컴퓨터가 실수와 승리를 어떻게 가중치로 다루느냐에 있습니다. 전통적인 방식에서는 모델이 정답을 낼 때마다 보상을 받으며, 시스템은 해당 결과가 더 발생할 가능성이 높도록 내부 설정을 조정합니다. 그러나 이 방법은 정답의 난이도와 상관없이 정답을 동일하게 취급합니다. 만약 모델이 간단한 퍼즐과 복잡한 퍼즐을 똑같이 쉽게 푼다면, 전통적인 시스템은 두 경우에 똑같은 공로를 부여합니다. 새로운 연구는 이것이 비효율적임을 보여줍니다. 진정한 목표는 정답을 맞힐 가능성(likelihood)을 극대화하는 것이며, 수학적으로 이는 성공이 드문 어려운 문제들에 훨씬 더 많은 주의를 기울일 것을 요구합니다. 표준적인 방식은 평균 성공률만을 바라보기 때문에 이를 수행하지 못합니다. 새로운 프레임워크인 MaxRL은 시도의 전체 이력을 살펴봄으로써 계산 방식을 바꿉니다. 이 시스템은 다음과 같이 묻습니다. "만약 이 문제를 여러 번 시도한다면, 얼마나 자주 맞힐 수 있을까?" 많은 시도에 걸친 성공 빈도를 분석함으로써, 시스템은 문제의 실제 난이도를 추론하고 그에 따라 학습을 조정할 수 있습니다.

이 아이디어를 테스트하기 위해 연구진은 이 더 정교한 학습 과정을 시뮬레이션할 수 있는 시스템을 구축했습니다. 그들은 다이얼처럼 조절할 수 있는 일련의 목적 함수들을 만들었습니다. 다이얼의 한쪽 끝에서 시스템은 오늘날 사용되는 표준적인 강화 학습 방식과 똑같이 작동합니다. 다른 쪽 끝에서는 이론적으로는 완벽하지만 보통 실행하기 불가능한 이상적인 최대 우도 훈련기처럼 작동합니다. 중간 지점에서 다이얼을 통해 시스템은 더 많은 컴퓨팅 파워를 사용하여 그 이상에 대한 더 정확한 근사치를 얻을 수 있습니다. 연구팀은 각 문제에 대해 여러 번의 시도를 생성하는 데 할당되는 컴퓨팅 파워를 늘림에 따라 시스템의 성능이 극적으로 향상된다는 것을 발견했습니다. 단순히 시스템이 더 안정적이 된 것뿐만 아니라, 학습하는 내용의 본질 자체가 변했습니다. 시스템은 기존 방식이 무시했던 어려운 문제들에 집중하기 시작했고, 이는 과업에 대한 훨씬 더 깊은 이해로 이어졌습니다.

이 접근 방식의 결과는 다양한 테스트에서 놀라웠습니다. 연구진이 새로운 방법과 이론적 이상향을 직접 비교할 수 있는 통제된 환경에서, 새로운 시스템은 컴퓨팅 파워를 추가함에 따라 완벽한 훈련기의 성능에 밀접하게 근접했습니다. 반면, 표준적인 방식은 엄청난 양의 데이터를 제공하더라도 유의미한 진전을 이루지 못한 채 한계에 부딪혔습니다. 연구진이 미로 탐색이나 수학 문제 풀이와 같은 더 복나로운 현실 세계의 시나리오로 이동했을 때, 그 우위는 더욱 명확해졌습니다. 수학적 추론이 포함된 과업에서 새로운 방법은 현재의 최첨단 방식보다 최대 20배 더 효율적인 성능 향상을 달고했습니다. 이는 새로운 시스템이 동일한 수준의 숙련도에 도달하기 위해 훨씬 적은 시도와 적은 컴퓨팅 시간을 필요로 했음을 의미합니다. 아마도 가장 중요한 점은, 새로운 방법이 이러한 시스템을 괴롭히는 흔한 문제인 '과적합(overfitting)' 문제를 겪지 않았다는 것입니다. 과적합이란 모델이 훈련 데이터를 너무 잘 암기하여 새로운 미지의 문제에 실패하는 현상을 말합니다. 다른 방식들이 시간이 지남에 따라 다양하고 올바른 솔루션을 생성하는 능력이 저하되는 반면, 새로운 프레임워크는 건강한 다양성을 유지했으며, 이는 시스템이 단순히 패턴을 암기하는 것이 아니라 근본적인 논리를 진정으로 학습하고 있음을 시사합니다.

이 연구의 함의는 단순히 AI를 더 똑똑하게 만드는 것을 넘어, 머신러닝의 한계를 생각하는 방식을 바꿉니다. 오랫동안 복잡한 추론 과업에서 이러한 시스템을 훈련하는 데 따르는 어려움은 알고리즘 자체나 데이터의 부족 때문이라고 여겨져 왔습니다. 이 연구는 병목 현상이 실제로 '목적 함수(objective function)', 즉 시스템이 달성하고자 하는 수학적 목표에 있었다는 점을 시사합니다. 단순히 평균 보상을 극대화하는 것에서 정답의 가능성(likelihood)을 극대화하는 것으로 목표를 전환함으로써, 연구진은 새로운 수준의 효율성을 열었습니다. 시스템은 더 이상 정답을 추측하는 것이 아니라, 인간이 드물고 어렵게 얻은 승리로부터 배우는 방식과 유사하게 성공의 확률을 이해하는 법을 배우고 있습니다. 연구진은 이 접근 방식이 수학이나 코딩처럼 정답 여부를 명확히 검증할 수 있는 방법이 있을 때 가장 효과적이지만, 그 원리가 이진 결과(binary outcome)를 갖는 다른 분야에도 잠재적으로 적용될 수 있다고 언급했습니다. 인공지능이 점점 더 복잡하고 추상적인 문제를 해결해 나감에 따라, 희소한 피드백으로부터 효율적으로 학습하는 능력은 매우 중요해질 것입니다. 이 새로운 프레임워크는 성공을 정의하는 방식을 정교하게 다듬음으로써, 기계가 단순히 더 빠르게 학습하는 것이 아니라 더 잘 학습하도록 가르칠 수 있다는 길을 제시하며 앞으로 나아갈 방향을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →