Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation
이 논문은 온폴리시 자기 증류(on-policy self-distillation)에서 특권적 토큰 가능도(privileged token likelihood)의 변화가 반드시 유효한 결과 신용(outcome credit)을 구성하는 것은 아니라고 주장하며, 형식적 분석과 실증적 실험을 통해 이러한 신호가 결과 전용 제어(outcome-only controls)에 비해 더 나은 행동을 추적하거나 원하는 행동을 강화하는 데 종종 실패함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 까다로운 수학 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 당신이 문제를 보여주자, 로봇은 단계별로 자신의 생각을 타이핑하기 시작합니다. 맨 마지막에 도달하면, 당신은 로봇이 정답을 맞혔는지 틀렸는지를 아주 쉽게 알 수 있습니다. 하지만 중간 단계들은 어떨까요? 로봇가 세 번째 단계에서 멋진 수를 두었을까요, 아니면 다섯 번째 단계에서 비틀거렸을까요? 인공지능의 세계에서 이것은 거대한 미스터리입니다. 우리는 최종 결과는 알지만, 로봇이 쓴 구체적인 단어들(또는 "토큰") 중 어떤 것이 영웅이었고 어떤 것이 악당이었는지는 알지 못합니다.
이를 해결하기 위해, 연구자들은 "특권적 자기 증류(privileged self-distillation)"라고 불리는 영리한 기술을 시도해 왔습니다. 이것은 마치 학생이 시험을 본 직동, 자신이 무엇을 했어야 했는지 정확히 설명해 주는 참조 시트를 받는 것과 같습니다. 그 후 학생은 자신의 답안을 읽고, 참조 시트를 읽으며, 자신이 쓴 단어 중 어떤 것이 좋았고 어떤 것이 나빴는지 파악하려고 노력합니다. 목표는 "좋은" 단어에는 보상을 주고 "나쁜" 단어에는 벌을 줌으로써 로봇이 더 빠르게 똑똑해지도록 하는 것입니다. 하지만 여기 함정이 있습니다. 결과가 나온 후에 어떤 단어가 좋아 보인다고 해서, 그 단어가 실제로 그 결과에 도달하는 데 도움이 되었다는 뜻은 아닙니다. 그것은 단지 사후 확신을 가지고 되돌아볼 때 듣기 좋게 들리는 단어일 뿐일 수도 있습니다.
Salesforce AI Research의 이 논문은 이 "참조 시트" 방식이 실제로 작동하는 것인지, 아니면 그저 선생님을 속이는 마술인지 확인하기 위해 교실에 나타난 회의적인 탐정 그룹과 같습니다. 그들은 이 방식이 실제로 올바른 교훈을 얻고 있는 것인지, 아니면 잘못된 것을 암기하고 있는 것인지 확인하기 위해 엄격한 실험을 설계했습니다.
거대한 "사후 확신" 강탈 사건
연구진은 200억 개의 파라미터를 가진 AI 모델(매우 똑똑한 로봇)과 AIME 2025라는 어려운 수학 문제 세트를 사용하여 "특권적 자기 증류" 방법을 궁극적인 테스트에 부치기로 했습니다. 그들의 목표는 이 교수법이 실제로 유용한지 아니면 시간 낭비인지를 결정하는 세 가지 특정 질문에 답하는 것이었습니다.
질문 1: "좋은 단어" 탐지기는 실제로 올바른 단어를 찾아내는가?
탐정이 범인을 찾으려고 한다고 상상해 보세요. 만약 탐정이 용의자를 지목한다면, 그 용의자에게 실제로 동기가 있습니까? 연구진은 AI의 "점수"(한 단어가 얼마나 좋았는지 나타내는 숫자)가 실제로 정답과 일치하는지 확인했습니다. 그들은 점수가 기본적으로 추측에 불과하다는 것을 발견했습니다. 수천 건의 수학 시도를 조사했을 때, 이 점수는 정답과 오답을 구분하는 데 있어 동전 던지기보다 약간 나은 수준에 불과했습니다. 사실, 답변의 길이를 조절한 후에는, 점수가 정답보다 오답을 약간 더 선호하는 것으로 나타났습니다! 이는 마치 선생님이 시험을 채점한 후, 글씨체가 예쁘다는 이유로 틀린 답을 적은 학생에게 금메달을 주는 것과 같습니다.
질문 2: 로봇은 스스로 성적표를 작성했는가?
이것은 교묘한 부분입니다. 많은 실험에서 AI는 답을 생성하고, 그 후 동일한 AI(또는 그 버전)가 그 답에 대한 비평을 작성합니다. 연구진은 이것이 자기 찬양의 순환이 될 것을 우려했습니다. 만약 당신이 자신의 성적표를 직접 쓴다면, 자신에게 너무 관대할 수 있습니다. 이를 해결하기 위해 그들은 "교차 적합(cross-fitting)" 방식을 시도했습니다: 즉, AI가 동일한 문제에 대한 다른 AI의 답에 대해 비평을 쓰게 만든 것입니다. 이렇게 하면 순환이 깨집니다. 하지만 이 수정 조치에도 불구하고, 점수는 여전히 어떤 답이 정답인지 신뢰성 있게 예측하지 못했습니다. 피드백은 이전만큼이나 혼란스러웠습니다. 풀이 과정에 대해 멋진 이야기를 쓸 수 있다고 해서 그 풀이가 실제로 훌륭하다는 뜻은 아니라는 것이 드러났습니다.
질문 3: 로봇이 이 점수로부터 배우려고 할 때 어떤 일이 발생하는가?
마지막으로, 그들은 물었습니다: 설령 점수가 이상하더라도, 로봇이 실제로 개선하기 위해 그 점수를 사용하려고 할 때 어떤 일이 벌어질까요? 그들은 다섯 가지 버전의 "토큰 크레딧(token credit)" 방식을 사용하여 로봇을 훈련시켰고, 이를 단순히 정답/오답만을 학습한 로봇과 비교했습니다. 결과는 "토큰 크레딧" 지지자들에게 엄청난 실망을 안겨주었습니다. 이 화려한 토큰 점수를 사용하려 했던 모든 로봇은 단순히 최종 정답/오답 피드백만 받은 로봇보다 성능이 떨어졌습니다.
- 단순한 로봇은 약 **64.2%**의 정답률을 기록했습니다.
- 화려한 토큰 점수를 사용한 로봇들은 **24.2%**에서 33.9% 사이의 정답률만을 기록했습니다.
이는 마치 모든 생각의 단계를 분석하려 했던 로봇은 혼란에 빠져 문제를 푸는 법 자체를 잊어버린 반면, 최종 결과만 바라본 로봇은 계속해서 발전한 것과 같습니다.
결론
이 논문은 "토큰 가능성 점수(token likelihood score)"—즉, 참조 시트 때문에 어떤 단어가 더 옳다고 말하는 숫자—가 자동으로 가치 있는 것은 아니다라고 결론짓습니다. 결과가 나온 후에 어떤 단어가 더 확률이 높아 보인다고 해서, 그 단어가 해결책의 핵심이었다는 뜻은 아닙니다.
연구진은 다음을 발견했습니다:
- 점수는 성공을 추적하지 못했습니다; 그것은 기본적으로 무작위 소음이었습니다.
- 피드백이 동일한 답에서 왔든 다른 답에서 왔든 문제는 마법처럼 해결되지 않았습니다.
- 이러한 점수를 사용하여 모델을 훈련시키는 것은 오히려 모델을 악화시켜, 정답으로부터 멀어지게 만들었습니다.
요약하자면, 이 논문은 우리가 "사후에 좋아 보이는 것"이 "실제로 도움이 되는 것"이라고 단순히 가정해서는 안 된다고 주장합니다. AI 모델에게 모든 단어에 대해 공로를 돌리기 전에, 우리는 세 가지를 확인해야 합니다: 점수가 실제로 결과와 일치하는가? 피드백이 공정하고 독립적인가? 그리고 훈련이 실제로 모델을 더 똑똑하게 만드는가? 이 특정 실험에서 그 대답은 모두 단호한 "아니오"였습니다. 개별 단어에 공로를 돌리는 화려한 방법은 실패했고, 최종 답안만 확인하는 고전적인 방식이 명백한 승자였습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.