← 최신 논문
🤖 machine learning

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

Post-Training 박사는 업데이트 방향을 실현 가능 집합에 투영하여 희소한 목표 데이터에 대한 과적합을 방지하기 위해 풍부한 일반 학습 데이터를 데이터 유도 정규화자로 재개념화하는 새로운 프레임워크를 제시함으로써, SFT, RLHF, RLVR 작업에서 기존 데이터 선택 방법들을 최소한의 계산 오버헤드로 능가합니다.

원저자: Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 매우 똑똑하지만 약간 고집이 센 학생 (대형 언어 모델) 에게 매우 구체적인 기술, 예를 들어 완벽한 법적 계약을 작성하는 기술을 가르치려 합니다.

그들이 학습하는 데 도움이 되는 두 가지 유형의 자원이 있습니다:

  1. "골드" 데이터: 완벽한 법적 계약 예시들의 아주 작고 완벽한 집합입니다. 이것이 바로 모델이 배우기를 원하는 내용이지만, 그 수가 매우 적습니다.
  2. "일반" 데이터: 일반적인 글쓰기, 뉴스 기사, 일상적인 채팅이 담긴 거대한 도서관입니다. 양은 엄청나지만 법적 계약과 완벽하게 일치하지는 않습니다. 도움이 되지만, 모델에게 이 자료 만을 읽게 한다면 혼란을 겪거나 변호사 대신 시인처럼 글을 쓰기 시작할지도 모릅니다.

구식 방법: 선별과 선택

전통적으로 연구원들은 엄격한 사서처럼 행동하여 이 문제를 해결하려 했습니다. 그들은 거대한 "일반 데이터" 도서관을 살펴보고 "골드" 데이터와 가장 유사해 보이는 "최고"의 책 몇 권을 골라내려 했습니다. 나머지는 버리고 오직 선별된 책들만으로 모델을 가르쳤습니다.

이 접근법의 문제는 마치 몇 개의 짚만 보고 마른 풀더미에서 바늘을 찾으려 하는 것과 같습니다. 좋은 정보를 놓치거나, 비슷해 보이지만 실제로는 오해의 소지가 있는 것을 선택할 수 있습니다.

새로운 방법: 박사 포스트-트레이닝 (정규화자 접근법)

이 논문은 Dr. Post-Training(데이터 정규화 포스트-트레이닝)이라는 새로운 프레임워크를 소개합니다. 책들을 선별하는 사서 대신, 저자들은 안전 harness처럼 행동할 것을 제안합니다.

간단한 비유를 통해 핵심 아이디어를 설명해 보겠습니다:

"목표"는 목적지입니다:
작은 "골드" 데이터는 모델이 정확히 어디로 가야 하는지 (이상적인 업데이트 방향) 알려줍니다. "이쪽으로 가라!"라고 말합니다.

"일반" 데이터는 지형입니다:
거대한 "일반" 데이터는 모델이 어디로 가야 하는지 알려주지 않습니다. 대신 그것은 지형의 지도 역할을 합니다. "네가 원하는 방향으로 갈 수 있지만, 너의 아래에 있는 땅이 지지해 주는 경로 위에 머물러야 한다"고 말합니다.

기술적으로 말해, "일반" 데이터는 정규화자 (regularizer) 역할을 합니다. 그것은 목표를 정의하지 않습니다. 단지 모델이 작은 양의 "골드" 데이터를 바탕으로 격렬하고 불안정한 도약을 하지 못하도록 막을 뿐입니다. 이는 모델이 광범위한 일반 지식에 의해 지지되는 안정된 방향으로 이동하도록 강제하면서도, 여전히 구체적인 목표 방향으로 이끕니다.

"그룹별" 혁신

이 논문은 **그룹별 서브셋 업데이트 (Group-Wise Subset Update)**라는 교묘한 트릭도 제안합니다.

모델이 100 개의 서로 다른 섹션 (레이어) 을 가진 거대한 오케스트라라고 상상해 보세요.

  • 구식 "글로벌" 방법: 특정 곡을 위해 최고의 음악가를 뽑고 싶다면, 오케스트라의 모든 섹션에 대해 동일한 10 명의 음악가를 뽑을지도 모릅니다. 하지만 바이올린 섹션은 드럼 섹션과 다른 음악가들이 필요할지도 모릅니다!
  • 새로운 "그룹별" 방법: 이 논문은 오케스트라의 각 섹션이 자신의 최고의 음악가를 선택하도록 제안합니다. 바이올린은 자신의 데이터 서브셋을 선택하고, 드럼은 자신의 것을 선택합니다. 이를 통해 모델은 훨씬 더 유연하고 정밀해지며, "일률적"인 실수를 피할 수 있습니다.

이것이 중요한 이유 (트레이드오프)

이 논문은 편향 (Bias) (너무 경직되어 목표를 놓치는 것) 과 분산 (Variance) (너무 격렬하고 불안정한 것) 사이의 균형이 있음을 설명합니다.

  • 일반 데이터를 무시하면, 모델은 너무 적은 정보로 학습하려 하기 때문에 미친 듯이 움직입니다 (높은 분산).
  • 모델에게 일반 데이터에만 매달리게 하면, 그것은 결코 구체적인 기술을 배우지 못합니다 (높은 편향).
  • Dr. Post-Training은 절묘한 지점을 찾습니다. 일반 데이터를 안정화 힘으로 사용하여 모델이 균형을 잃지 않으면서도 구체적인 기술을 배우도록 합니다.

속도 내기 (시스템 부분)

"잠깐, 목표에 대해 모든 데이터 조각을 하나씩 확인하는 것은 엄청나게 느리고 메모리를 많이 차지할 것 같은데?"라고 생각할 수 있습니다.

저자들도 동의합니다. 그들은 이를 빠르게 만들기 위해 많은 시간을 들여 시스템 엔진을 구축했습니다. 거대한 양의 임시 데이터를 저장할 필요 없이 모든 계산을 단일 패스 (한 번의 순방향 및 역방향 패스) 로 수행하는 방법을 알아냈습니다. 그들은 본질적으로 필요한 도구만 메모리에 유지하고 나머지는 즉시 치워두는 "스마트 스케줄러"를 구축하여 이 새로운 방법이 훈련 과정을 크게 지연시키지 않도록 했습니다.

결과

저자들은 이 방법을 세 가지 다른 유형의 AI 훈련 작업에 대해 테스트했습니다:

  1. SFT (지도 미세 조정): 모델이 지시를 따르도록 가르치는 것.
  2. RLHF (인간 피드백 강화 학습): 모델이 도움이 되고 해가 없도록 가르치는 것.
  3. RLVR (검증 가능한 보상 강화 학습): 모델이 수학 문제를 해결하도록 가르치는 것.

모든 경우에서, 그들의 새로운 방법 (특히 "그룹별" 버전) 은 이전의 최선 방법들보다 더 잘 수행되었습니다. 표준 훈련과 거의 동일한 양의 컴퓨터 메모리와 시간을 사용하면서도 더 빠르고 정확하게 구체적인 작업을 학습했습니다.

간단히 말해: AI 에게 가르칠 완벽한 몇 개의 예시를 찾으려 노력하는 대신, 이 방법은 일반 지식의 전체 도서관을 안전망으로 사용하여 AI 가 절벽에서 떨어지지 않도록 구체적인 목표 방향으로 이끕니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →