← 최신 논문
🤖 AI

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

본 논문은 지도 미세 조정(Supervised Fine-Tuning)과 온-폴리시 증류(On-Policy Distillation) 사이를 보간하여 학생 모델이 생성한 궤적에 대해 완전한 단계별 교정을 제공함으로써, 추론 및 에이전트 작업에서 두 가지 기존 방식 모두를 실질적으로 능가하는 새로운 방법론인 단계별 온-폴리시 증류(Step-Level On-Policy Distillation, SOPD)를 제안한다.

원저자: Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 거대 언어 모델은 종종 교사로부터 배워야 하는 학생에 비유되곤 합니다. 수년 동안 이 디지털 학생들을 가르치는 표준적인 방식은 전문가가 작성한 완벽한 예시를 보여주고 그 순서를 암기하도록 요구하는 것이었습니다. '지도 미세 조정(supervised fine-tuning)'이라고 알려진 이 방법은 효과적이지만 경직되어 있습니다. 이는 학생이 항상 전문가의 경로를 완벽하게 따를 것이라고 가정하며, 정작 학생이 실제로 저지르기 쉬운 실수들은 무시합니다. '온폴리시 증류(on-policy distillation)'라고 불리는 더 새로운 접근 방식은 학생이 스스로 답변을 생성하게 한 뒤, 진행 과정에서 토큰 단위로 교정해 줌으로써 이 문제를 해결하고자 합니다. 하지만 이 방식은 또 다른 문제를 야기합니다. 교정이 너무 파편화되어 있어서 학생이 정답으로 가는 완전하고 일관된 경로를 결코 볼 수 없다는 점입니다. 이는 마치 곡선을 어떻게 통과해야 하는지 전체적인 방법을 배우는 대신, 핸들을 만질 때마다 단어 하나 수준의 지시를 받는 것과 같습니다.

연구진은 이제 이 간극을 메울 수 있는, 두 방식의 장점을 결end한 새로운 훈련 방법을 개발했습니다. '단계별 온폴리시 증류(Step-Level On-Policy Distillation)'라는 기술을 도입함으로써, 연구진은 학생이 스스로 하나의 완전한 생각이나 행동 시퀀스를 완료할 수 있게 하고, 그 여정의 각 주요 단계마다 교사가 하나의 일관된 교정을 제공하도록 했습니다. 이 접근 방식은 어려운 수학 문제를 푸는 것부터 가상 가계 환경을 탐색하는 것에 이르기까지 복잡한 과제들에 대해 테스트되었습니다. 결과에 따르면, 이 방법은 학생이 이전 기술들보다 훨씬 더 빠르고 정확하게 학습하도록 도와주며, 해당 크기의 모델로는 도달하기 어려웠던 성공률을 달성했습니다. 핵심적인 발견은 학습 과정을 개별 단어가 아닌 자연스럽고 의미 있는 덩어리로 나눔으로써, 모델이 단순히 정답이 무엇인지뿐만 아니라 자신이 저지른 특정한 실수로부터 어떻게 정답에 도달할 수 있는지까지 이해할 수 있게 되었다는 점입니다.

이 새로운 방법의 핵심은 학생 모델과 교사 사이의 상호작용을 처리하는 방식에 있습니다. 기존의 온폴리시 증류 방식에서는 교사가 학생의 작업물을 보고 생성되는 모든 단어마다 아주 작은 교정을 제공합니다. 만약 학생이 초기에 실수를 하면, 교사는 이를 단어 단위로 고치려 들지만, 학생은 여전히 혼란스러운 상태에 머물며 끊어진 경로를 따라가려고 애쓰게 됩니다. 새로운 방법인 단계별 온리폴시 증류는 이러한 상호작용의 리듬을 바꿉니다. 먼저, 학생은 방해받지 않고 완전한 응답이나 전체 행동 시퀀스를 생성할 수 있도록 허용됩니다. 학생이 생성을 마치면, 시스템은 그 응답을 수학적 증명의 완전한 문장이나 게임에서의 전체 대화 차례와 같은 자연스러운 단계로 나눕니다.

이 시점에서 교사가 개입하지만, 이야기 전체를 다시 쓰는 것은 아닙니다. 대신, 교사는 각 특정 단계에 대한 학생의 시작점을 확인하고, 해당 단계에 대한 단 하나의 올바른 버전을 생성합니다. 그러면 학생은 자신의 원래 맥락을 유지하면서 이 올바른 단계를 맞추도록 학습합니다. 즉, 교사가 전체 과정을 장악하는 것이 아니라, 학생이 자신의 궤적을 스스로 수정하는 법을 배우게 됩니다. 교사는 여정의 각 부분에 대해 명확하고 국소적인 가이드를 제공하여, 학생이 잘못된 지점으로부터 정확히 어디로 나아가야 할지에 대한 완전하고 논리적인 경로를 볼 수 있도록 보장합니다. 이는 학생이 실수를 경험하는 과정을 보존하면서도, 그 실수를 바로잡을 수 있는 구조적인 방법을 제공합니다.

연구진은 이 접근 방식이 압박 속에서도 잘 작동하는지 확인하기 위해 매우 다른 두 가지 환경에서 테스트를 진행했습니다. 첫 번째 테스트는 시뮬레이션된 집을 탐색하는 에이전트인 ALFWorld라는 과제를 포함했습니다. 이 환경에서 모델은 텍text 기반의 세계와 상호작용하며 열쇠를 찾거나 방을 청소하는 등의 과업을 수행해야 했습니다. 연구팀은 작은 규모의 학생 모델을 안내하기 위해 강력한 교사 모델을 사용했습니다. 이 새로운 방법을 기존의 토큰 단위 교정 방식과 비교했을 때, 결과는 놀라웠습니다. 새 방법으로 훈련된 학생은 이미 본 적이 있는 과제에서는 성공률이 18%포인트 이상 향상되었고, 처음 접하는 과제에서는 21%포인트 이상 향상되었습니다. 더욱이, 이들은 더 적은 시도로 과제를 완수했는데, 이는 모델이 단순히 더 잘 추측하는 것이 아니라 문제를 해결하는 더 효율적인 방법을 배우고 있음을 보여줍니다.

두 번째 테스트는 논리적 일관성이 매우 중요한 영역인 수학적 추론에 집중되었습니다. 여기서 모델들은 경시대회 수준의 수학 문제들을 풀도록 요청받았습니다. 연구진은 이 새로운 방법이 학생이 자신의 사고를 더 명확하고 구조적인 단계로 조직할 수 있게 해준다는 것을 발견했습니다. 훈련이 진행됨에 따라 학생은 더 뚜렷하고 구조적인 추론 단계를 생성하기 시작했고, 교사의 교정 또한 더 풍부하고 상세해졌습니다. 네 가지 서로 다른 수학 벤치마크에서, 이 새로운 방법으로 훈련된 학생은 이전의 최고 접근 방식보다 큰 폭으로 앞서며 평균 정확도를 거의 10%포인트 향상시켰습니다. 이는 이 방법이 단순한 과제를 위한 기술이 아니라, 복잡한 추론을 개선하는 강력한 방법임을 입증했습니다.

이 새로운 기술의 가장 실용적인 장점 중 하나는 교사가 자신의 내부 계산 과정을 드러낼 필요가 없다는 것입니다. 기존의 많은 방식에서는 학생이 교사의 모든 단어에 대한 원시 확률 점수에 접근할 수 있어야 했으나, 이는 교사가 폐쇄적인 블랙박스 시스템일 경우 흔히 불가능한 일입니다. 새로운 방법은 교사가 텍스트만을 생성하면 되므로, 최고의 모델들이 완전히 공개되지 않은 실제 환경에 적용하기 훨씬 쉽습니다. 또한, 교사가 학생의 기존 작업에 기반하여 한 번에 한 단계씩만 생성하기 때문에, 프로세스가 더 빠르고 환경이 매 움직임에 반응하기를 기다리며 발생하는 지연을 피할 수 있습니다.

본 연구는 학습의 구조를 어떻게 잡느냐가 교사의 질만큼이나 중요하다는 것을 확인시켜 줍니다. 파편화된 단어 단위의 교정에서 벗어나 일관된 단계별 가이드로 나아감으로써, 연구진은 학생의 고유한 경로를 존중하면서도 교정을 위한 명확한 지도를 제공하는 학습 역학을 만들어냈습니다. 이 접근 방식은 자신의 실수로부터 배우는 유연성과 전문가의 가이드가 주는 명확성을 성공적으로 결합했습니다. 이러한 결과는 인공지능이 특히 복잡하고 상호작적인 과제에서 더 유능하고 신뢰할 수 있게 되기 위해서는, 모델이 자신의 오류에 대한 전체적인 그림을 보고 단 한 번의 논리적인 동작으로 이를 복구하는 법을 배울 수 있도록 하는 훈련 방법을 설계해야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →