← 최신 논문
🤖 machine learning

On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity

이 논문은 샘플링된 데모를 활용한 온-폴리시 자기 증류(on-policy self-distillation)가 강력한 pass@1 정확도를 달리는 반면, 누적되는 피드백을 통해 기존 모델의 편향을 증폭시킴으로써 의도치 않게 출력 다양성을 감소시키고 pass@k 성능을 평탄화하며, 궁극적으로 분포 외(out-of-distribution) 태스크를 위한 다양한 전략을 생성하는 모델의 능력을 제한한다는 점을 밝히고 있다.

원저자: Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "에코 체임버(Echo Chamber)" 효과

당신이 미로를 푸는 법을 배우려고 노력하고 있다고 상상해 보세요. 당신에게는 선생님이 한 명 있는데, 이 선생님은 사실 당신의 약간 더 나이 많은 버전일 뿐입니다.

표준적인 학습 설정(이를 **강화 학습(Reinforcement Learning, RL)**이라고 부릅니다)에서는, 당신이 미로에서 어떤 올바른 경로라도 찾아내면, 선생님은 "잘했어!"라고 말하며 보상을 줍니다. 당신이 길고 구불구불한 경치 좋은 길로 갔는지, 아니면 짧고 직선적인 고속도로로 갔는지는 중요하지 않습니다. 출구에 도착하기만 하면 똑같은 하이파이브를 받게 됩니다. 이는 당신이 다양한 경로를 시도하도록 독려합니다.

이 논문에서 연구하는 **샘플링된 데몬스트레이션을 활용한 자기 증류(Self-Distillation with Sampled Demonstrations, SDSD)**라는 방법에서는 선생님이 다르게 작동합니다. 당신이 시작하기 전에, 선생님은 당신(또는 다른 누군가)이 이전에 찾아냈던 특정한 올바른 경로 하나를 선택하여 이렇게 말합니다. "자, 나는 네가 정확히 이 특정 경로와 똑같이 미로를 풀기를 원해."

이 논문은 이 방식이 당신이 정답을 맞히는 데는 매우 효과적이지만, 은밀하게 당신을 게으르고 반복적으로 만든다고 주장합니다. 선생님이 들고 있는 특정 경로를 흉내 낼 때만 칭찬을 해주기 때문에, 당신은 새로운 경로를 탐색하는 것을 멈추게 됩니다.

핵심 문제: "부익부 빈익빈"

저자들은 이 방식의 숨겨진 비용인 **다양성 상실(Loss of Diversity)**을 발견했습니다.

이것은 라디오에서 유행하는 노래와 비슷합니다.

  • 표준 RL: 만약 새로운 노래가 좋다면 DJ는 그 노래를 틀어줍니다. 만약 또 다른 새로운 노래도 좋다면, 그 노래 역시 틀어줍니다. 당신은 히트곡들의 혼합을 듣게 됩니다.
  • 자기 증류 (SDSD): DJ는 이미 가장 많이 나오고 있는 단 하나의 노래를 선택합니다. 그리고 밴드에게 말합니다. "그 노래를 그것과 똑같이 연주하세요."
    • 만약 밴드가 그 히트곡과 아주 조금이라도 비슷하게 연주하면, 선생님은 그것을 좋아하며 강화합니다.
    • 만약 밴드가 완전히 다르지만 여전히 올바른 노래를 연주한다면, 선생님은 그 노래가 자신이 들고 있는 "샘플링된 데몬스트레이션"과 일치하지 않기 때문에 당황하거나 덜 열광합니다.

시간이 흐르면서 밴드는 새로운 것을 연주하는 것을 멈춥니다. 그들은 오직 그 하나의 히트곡만을 변주하여 연주하게 됩니다. 그들은 그 한 곡에 대해서는 믿을 수 없을 정도로 능숙해지지만, 만약 라디오 스테이션에서 다른 장르를 요청하면 실패하게 됩니다.

논문의 발견 (증거)

연구진은 이를 두 가지 주요 사항에 대해 테스트했습니다.

1. "그래프 미로(Graph Maze)" 게임
그들은 AI가 다양한 개념(예: 새, 과일, 모양 등)으로 구성된 그래프를 통해 경로를 찾는 게임을 만들었습니다.

  • 함정: 어떤 경로는 짧고 쉬웠고, 어떤 경로는 길고 어려웠습니다.
  • 결과: SDSD 모델들은 쉬운 경로를 매우 빠르게 찾아내어 높은 점수를 얻었습니다. 하지만 그들은 길고 어려운 경로들은 완전히 무시했습니다.
  • 실패: 연구진이 규칙을 변경했을 때(모든 경로를 길게 만들었을 때), SDSD 모델들은 무너졌습니다. 그들은 "쉬운 경로" 습관에 의존하는 법을 배웠기에 적응할 수 없었습니다. 반면, 다양한 경로를 연습했던 RL 모델들은 새로운 규칙을 쉽게 처리했습니다.

2. 과학 질문
그들은 과학 질문(생물학, 화학, 물리학)에 대해 모델을 테스트했습니다.

  • 지표: 그들은 pass@k를 살펴보았습니다. 이는 "우리가 AI에게 16개의 서로 다른 답을 생성하도록 요청했을 때, 그중 몇 개가 정답인가?"를 묻는 것입니다.
  • 발견: SDSD 모델들은 첫 번째 답을 맞히는 것(pass@1)에는 뛰어났습니다. 하지만 16개의 답을 생성하도록 요청했을 때, 거의 16개 모두가 단지 약간 다르게 쓰였을 뿐 똑같은 답이었습니다.
  • 대조: RL 모델들은 16개의 서로 다른 정답을 생성했습니다. 만약 첫 번째 답이 틀렸더라도, 16번째 답은 맞을 수 있었습니다. SDSD 모델은 백업 플랜(대안)을 제공하지 못했습니다.

왜 이런 일이 발생하는가? ("기울어진" 저울)

논문은 왜 이런 일이 발생하는지 설명하기 위해 무거운 수학적 내용을 사용하지만, 여기서는 쉬운 버전으로 설명하겠습니다.

여러 가지 솔루션을 저울질하는 저울을 상상해 보세요.

  • 표준 RL은 모든 정답을 동등하게 취급합니다. 만약 솔루션 A와 솔루션 B가 둘 다 옳다면, 저울은 균형을 유지합니다.
  • 자기 증류는 저울을 기울게 만듭니다. 이 방식은 "데몬스트레이션"(예시 경로)을 살펴보고 이렇게 묻습니다. "솔루션 A가 예시와 얼마나 닮았는가?" 만약 솔루션 A가 예시와 조금이라도 닮았다면, 저울은 그쪽으로 크게 기울어집니다. 만약 솔루션 B가 다르다면, 저울은 그쪽을 향해 기울어지지 않습니다.

AI는 자신의 "인기 있는" 답변들을 계속해서 예시로 보고 있기 때문에, 저울을 그 인기 있는 답변들 쪽으로 점점 더 기울게 만듭니다. "인기 없는" 하지만 올바른 답변들은 짓눌리게 됩니다. 이것을 **모드 붕괴(Mode Collapse)**라고 하며, AI가 단 하나의 사고방식으로 붕괴되는 현상을 말합니다.

"엔트로피(Entropy)"의 함정

논문은 또한 까다로운 측정 문제도 지적합니다. 보통 과학자들은 AI가 얼마나 다양한 단어를 사용하는지(토큰 엔트로피)를 통해 "다양성"을 측정합니다.

  • 논문은 SDSD 모델이 여전히 동일한 방식으로 생각하면서도(낮은 의미론적 다양성), 다양한 단어를 사용할 수 있음(높은 단어 다양성)을 발견했습니다.
  • 이는 두 사람이 에세이를 쓰는 것과 같습니다. 한 사람은 "고양이"에 대해 쓰고, 다른 사람은 "개"에 대해 씁니다. 그들은 서로 다른 단어를 사용하지만, 만약 두 사람 모두 정확히 똑같은 논점과 구조로 주장한다면, 그들의 사고는 결코 다양하다고 할 수 없습니다. SDSD 모델이 바로 이렇습니다. 그들은 단어는 섞어서 사용하지만, 똑같은 경직된 전략을 고수합니다.

시사점

이 논문은 샘플링된 데몬스트레이션을 활용한 자기 증류가 양날의 검이라고 결론짓습니다.

  • 장점: 이 방식은 모델이 이전에 보았던 문제들에 대해 첫 번째 시도에서 정답을 맞히는 정확도를 높여줍니다.
  • 단점: 모델의 창의적인 사고나 다양한 전략을 시도하는 능력을 파괴합니다. 만약 문제가 약간 변하거나 첫 번째 추측이 틀린다면, 모델은 백업 플랜이 없습니다.

저자들은 우리가 AI의 견고함과 적응성을 원한다면, 단순히 모델이 정답을 얼마나 자주 맞히는지에만 주목해서는 안 된다고 제안합니다. 우리는 모델이 실제로 다양한 접근 방식을 시도하고 있는지, 아니면 그저 똑같은 기술을 반복해서 쓰고 있는 것인지를 반드시 확인해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →