Compute Aligned Training: Optimizing for Test Time Inference
본 논문은 새로운 손실 함수를 도출하여 대규모 언어 모델의 학습 목표를 테스트 시간 추론 전략과 정렬시키는 "컴퓨팅 정렬 학습"이라는 새로운 프레임워크를 소개함으로써, 표준 SFT 및 RL 접근 방식에 비해 성능 확장성을 크게 개선합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
특정 유형의 최종 시험을 위해 학생을 훈련한다고 상상해 보세요.
기존 방식 (표준 훈련):
전통적으로 AI 모델 (에세이를 쓰거나 수학 문제를 푸는 모델 등) 을 가르칠 때, 우리는 모든 숙제를 개별적으로 채점하는 엄격한 교사처럼 행동합니다. 학생이 문제를 맞히면 "잘했어!"라고 말하고 틀리면 "다시 해봐"라고 말합니다. 우리는 학생이 매번 첫 번째 답변을 완벽하게 맞추기를 원합니다.
문제는 이것이 실제 시험을 대비하게 하지 못한다는 점입니다. 현실 세계에서는 모델에게 하나의 답변만 요구하지 않습니다. 우리는 모델에게 여러 가지 다른 답변을 생성하도록 요청합니다 (예: 학생에게 에세이 초안 10 개를 작성하도록 요청하는 것) 그리고 그중 가장 좋은 것을 선택하거나 가장 흔한 것에 투표합니다.
만약 학생이 첫 번째 초안을 완벽하게 작성하도록 훈련된다면, 그들은 너무 자신감을 갖게 되어 새로운 아이디어를 탐구하는 것을 멈출 수 있습니다. 그들은 "안전한" 사고 방식에 갇히게 됩니다. 나중에 10 개의 초안을 생성하도록 요청하면, 그들은 같은 "안전한" 답변의 약간 다른 버전 10 개만 작성할 수 있으며, 그중 어느 것도 당신이 필요로 했던 brillant하고 창의적인 해결책이 아닐 수 있습니다.
새로운 방식 (컴퓨팅 정렬 훈련 - CAT):
이 논문의 저자들은 컴퓨팅 정렬 훈련 (Compute Aligned Training, CAT) 이라는 새로운 훈련 방법을 제안합니다. 단일 숙제에 대해 학생을 채점하는 대신, 실제 시험 형식에서 그들이 얼마나 잘 수행할 것인지에 따라 학생을 채점합니다.
다음은 몇 가지 비유를 통해 작동 방식을 설명한 것입니다:
1. "Pass@N" 비유 (로또 티켓)
시험에서 한 문제당 N 개의 로또 티켓 (예: 64 장) 을 구매할 수 있다고 상상해 보세요. 64 장 중 어떤 티켓이 당첨 번호라면 승리합니다.
- 표준 훈련: 학생이 이미 한 장의 티켓으로 50% 의 승률을 가지고 있다면, 교사는 그들을 90% 나 99% 까지 끌어올리도록 계속 압박합니다. 하지만 64 장 티켓 로또에서는 50% 확률을 가진 상태에서 티켓을 더 구매하면 어차피 승리가 보장됩니다. 교사는 쉬운 문제에서 "좋은" 학생을 "완벽한" 학생으로 만들기 위해 에너지를 낭비하고, 학생이 1% 확률로 있는 어려운 문제를 무시합니다.
- CAT 훈련: 교사는 "이 학생은 이미 64 장 티켓으로 승리할 가능성이 높다. 이 쉬운 문제는 더 이상 열심히 채점하지 않겠다"고 깨닫습니다. 대신, 모든 에너지를 학생이 현재 실패하고 있는 어려운 문제에 집중합니다. 그들은 학생이 특정 티켓 하나를 완벽하게 만들려고 노력하는 대신, 64 장 티켓 중 적어도 하나가 당첨되도록 확률을 분산시키는 법을 가르칩니다.
2. "다수결 투표" 비유 (선거)
시험에서 모델에게 10 개의 답변을 생성하도록 요청하고, 반에서 가장 인기 있는 것을 투표한다고 상상해 보세요.
- 표준 훈련: 교사는 학생의 첫 번째 답변이 절대적으로 가장 인기 있는 답변이 되도록 노력합니다. 이미 압도적으로 승리하고 있더라도 말입니다. 이는 이미 90% 의 표를 얻고 있는 후보에게 교사가 계속 더 열심히 캠페인하라고 말하는 것과 같아 시간 낭비입니다.
- CAT 훈련: 교사는 "터닝 포인트"를 봅니다. 학생의 답변이 현재 작은 차이로 패배하고 있다면, 교사는 그들이 결승선을 넘을 수 있도록 큰 도움을 줍니다. 학생이 이미 comfortably 승리하고 있다면, 교사는 추가 점수를 주지 않습니다. 이는 모델이 약간의 추가 노력으로 표심을 바꿀 수 있는 "전장" 문제에 집중하도록 강제합니다.
3. "최고의 N 개 (Best-of-N)" 비유 (재능 쇼)
모델이 10 개의 노래를 생성하고, 그중 단 하나만 최고의 노래로 남긴다고 상상해 보세요.
- 표준 훈련: 교사는 평균적인 노래가 좋게 들리도록 노력합니다. 이는 결코 나쁘지 않지만 결코 놀랍지도 않은 안전하고 지루한, "중도"적인 음악을 낳습니다.
- CAT 훈련: 교사는 모델에게 "9 개의 노래가 끔찍해도 10 번째 노래가 걸작이라면 괜찮다"고 말합니다. 이는 모델이 위험을 감수하고 기발하고 분산이 큰 아이디어를 시도하도록 장려합니다. 실패는 걸러내고 승자를 남기는 "검색" 과정 (가장 좋은 것을 선택하는 것) 을 알고 있기 때문에 다양한 출력물을 생산하는 법을 배웁니다.
그들은 실제로 무엇을 했나요?
연구자들은 이 아이디어를 세 가지 구체적인 방식으로 테스트했습니다:
- 수학 문제: 그들은 AI 모델이 수학 문제를 풀도록 훈련했습니다. "Pass@N"(여러 답변을 생성하고 올바른 것을 선택) 을 위해 CAT 를 사용하여 모델을 준비시켰을 때, 표준 방법과 비교하여 모델들이 어려운 문제를 훨씬 더 잘 해결했습니다.
- 투표: 그들은 모델이 "다수결 투표"를 위한 답변을 생성하도록 훈련했습니다. 다시 한번, CAT 모델은 투표 전략이 적용되었을 때 더 좋은 성과를 거두었습니다.
- 단백질 설계: 그들은 심지어 단백질을 설계하는 (생명의 구성 요소) 완전히 다른 유형의 AI 에 대해서도 이를 테스트했습니다. AI 가 많은 나쁜 것들 사이에서 희귀하고 고품질의 단백질 구조를 찾아야 하는 시나리오에서, CAT 로 훈련된 모델들은 표준 모델들보다 "대박" 단백질을 찾는 데 훨씬 더 뛰어났습니다.
결론
이 논문은 모델을 훈련시키는 방식이 모델을 사용하는 방식과 일치해야 한다고 주장합니다.
만약 모델이 여러 옵션을 생성하고 그중 가장 좋은 것을 선택하는 데 사용될 계획이라면, 첫 번째 시도에서 완벽하도록 훈련해서는 안 됩니다. 대신, 가장 좋은 옵션이 발견될 가능성이 높은 옵션 풀을 생성하는 데 능하도록 훈련해야 합니다.
저자들은 이를 "컴퓨팅 정렬 훈련 (Compute Aligned Training)"이라고 부릅니다. 이는 훈련 과정을 시험 시간에 사용되는 "컴퓨팅"(추가적인 사고력) 과 정렬시키기 때문입니다. 더 강력한 컴퓨터나 더 많은 훈련 시간이 필요하지 않고도 더 좋은 결과를 얻는 방법입니다. 모델이 실제로 어떻게 사용될 것인지에 맞춰 게임의 규칙을 바꾸기만 하면 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.