← 최신 논문
🤖 machine learning

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

이 논문은 작업 관련 토큰 수준의 신호를 주입하기 위한 특권 가치 함수(Privileged Value Functions, PVF)와 그룹 상대적 기준과 가치 기준 사이를 적응적으로 보간하는 TETHER를 결합함으로써, 표준 가치 함수 기준보다 우수한 성능을 달고 GRPO와 경쟁할 만한 결과를 달성하는 동시에 스트래글러 롤아웃(straggler rollouts) 및 높은 분산 문제를 완화하는 대규모 언어 모델 강화 학습 프레임워크인 "Le Critique"를 소개한다.

원저자: Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 컴퓨터 프로그램이 더 잘 생각하는 법을 가르치기 위한 끊임없는 투쟁이 존재합니다. 학생이 시험을 치는 상황을 상상해 보십시오. 만약 최종 정답을 맞히면 좋은 점수를 받습니다. 틀리면 나쁜 점수를 받습니다. 이것이 바로 많은 현대 AI 시스템이 학습하는 방식입니다. 이들은 문제를 해결하기 위해 수많은 다양한 방법을 시도하며, 최종 결과가 성공이었는지 실패였는지에 따라 자신의 뇌를 조정합니다. 이 방법을 '강화 학습(reinforcement learning)'이라고 부릅니다. 하지만 여기에는 함정이 있습니다. 만약 학생이 길고 복잡한 에세이를 썼는데 최종 성적이 나쁘게 나왔다면, 컴퓨터는 어떤 특정 문장이 오류를 일으켰는지 알지 못합니다. 그저 에세이 전체가 나빴다는 것만 알 뿐입니다. 이는 마치 도구도 없이 자동차 엔진의 어느 부품이 고장 났는지 추측하며 고치려는 것처럼 느리고 비효울적인 과정입니다.

이를 해결하기 위해 연구자들은 오랫동안 AI를 위한 '비평가(critic)'를 구축하려고 노력해 왔습니다. 이것은 두 번째 컴퓨터 프로그램으로, 학생이 글을 쓰는 과정을 문장 단위로 지켜보며 최종 답변이 어떻게 나올지 예측합니다. 만약 비평가가 초기에 최종 성적을 예측할 수 있다면, 학생이 잘못된 방향으로 갈 때 즉시 알려줄 수 있어 훨씬 빠르고 정밀한 학습이 가능해집니다. 오랫동안 이 방식은 두 번째 프로그램을 구축하고 훈련시키는 것이 어렵고 종종 신뢰할 수 없었기 때문에 선호도가 떨어졌습니다. 최근에는 이 비평가를 아예 건너뛰고, 대신 답변 그룹들을 서로 비교하는 방식에 의존하는 방법들이 주류가 되었습니다. 하지만 이 새로운 논문은 과거의 비평가라는 아이디어가 죽은 것이 아니라, 단지 세상을 보는 새로운 방식이 필요했을 뿐이라고 제안합니다.

Mistral AI와 다른 기관의 연구진은 비평가가 실패하는 이유가 아이디어 자체가 나빠서가 아니라, 종종 불가능한 일을 요구받기 때문이라는 것을 발견했습니다. 그들은 만약 비평가에게 메인 AI 학생에게는 허용되지 않는 약간의 추가 정보를 제공한다면, 비평가가 믿기 힘들 정도로 정확해질 것이라는 사실을 발견했습니다. 그들은 이를 '특권적 가치 함수(privileged value function)'라고 부릅니다. 이 원리를 이해하기 위해, 수학 시험을 치르는 학생을 상상해 보십시오. 학생은 문제를 단계별로 풀고 있습니다. 비평가는 이를 지켜보고 있습니다. 보통 비평가는 학생이 지금까지 쓴 내용만을 바탕으로 최종 점수를 추측해야 합니다. 하지만 이 새로운 설정에서는 비평가에게 몰래 '정답지'가 전달됩니다. 비평가는 학생에게 정답을 보여주지는 않지만, 그 비밀스러운 지식을 사용하여 학생의 현재 진행 상황을 훨씬 더 정확하게 판단합니다. 만약 학생의 현재 단계가 정답 경로에서 멀리 떨어져 있다면, 비평가는 즉시 이를 알아차리고 경로를 수정하라는 명확한 신호를 보냅니다. 이 신호는 비평가가 맹목적으로 추측해야 할 때보다 학생이 훨씬 더 빠르게 학습하도록 돕습니다.

연구팀은 논리 퍼즐 풀기와 컴퓨터 코드 작성 등 몇 가지 어려운 추론 과제에 이 아이디어를 테스트했습니다. 한 실험에서는 AI가 격자에 숫자를 하나씩 채워 넣는 스도쿠 퍼즐을 사용했습니다. 메인 AI는 자신이 이미 배치한 숫자들만 볼 수 있었습니다. 그러나 특권적 비평가는 완전히 풀린 격자를 보여받았습니다. 이를 통해 비평가는 AI가 단 몇 번의 움직임만 수행했더라도, 현재의 움직임이 막다른 길로 이어지는지를 즉각적으로 알려줄 수 있었습니다. 결과는 놀라웠습니다. 그들이 시도한 모든 과제에서, 이 '특권적' 비평가를 사용하는 것은 AI가 더 빠르게 학습하고 더 높은 점수에 도달하도록 도왔습니다. AI는 단순히 운이 좋았던 것이 아니라, 자신이 어디로 가고 있는지에 대한 더 명확한 지도를 가짐으로써 더 나은 결정을 내리는 법을 배웠습니다.

연구진은 또한 때때로 비평가가 여전히 학습 중이며 완벽하지 않을 수 있다는 점을 깨달았습니다. 만약 비평가가 너무 자신만만하지만 틀렸을 경우, AI를 혼란스럽게 만들 수 있습니다. 이를 해결하기 위해 그들은 '테더(Tether)'라고 불리는 두 번째 도구를 만들었습니다. 이 시스템은 스마트한 스위치 역할을 합니다. 훈련 초기, 즉 비평가가 새롭고 신뢰할 수 없을 때는 시스템이 답변 그룹들을 비교하는 방식에 주로 의존합니다. 이는 안전하지만 느린 방법입니다. 비-평가가 더 나아지고 정확한 조언을 주기 시작하면, 테더 시스템은 신뢰를 비평가 쪽으로 서서히 옮깁니다. 이 시스템은 두 방법을 자연스럽게 혼합하여, 인간 엔지니어가 설정을 미세하게 조정할 필요 없이 한 방식에서 다른 방식으로 매끄럽게 이동합니다. 이를 통해 비평가가 초보자이든 전문가이든 상관없이 AI가 항상 최선의 가이드를 받을 수 있도록 보장합니다.

이 연구는 적절한 도구가 주어진다면, 학습을 가이드하기 위해 두 번째 프로그램을 사용하는 오래된 아이디어가 유효할 뿐만 아니라 더 우월하다는 것을 보여줍니다. 비평가가 메인 AI가 볼 수 없는 것을 볼 수 있게 허용함으로써, 연구진은 학습 과정에서 추측을 제거했습니다. 또한 이 접근 방식이 견고하고 자동화될 수 있으며, 비평가의 숙련도에 따라 적응할 수 있음을 보여주었습니다. 이 작업에는 상당한 컴퓨팅 능력과 세심한 엔지니어링이 필요했지만, 결과는 명확한 방향을 제시합니다. 비평가를 포기하는 대신, AI에게 추론하는 법을 가르치는 미래는 비평가에게 해결책에 대한 더 나은 시야를 제공하여, 이전에는 도달할 수 없었던 명확함으로 실수로부터 배우게 하는 데 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →