← 최신 논문
🤖 machine learning

Stage-1 Controls the Entropy Regime, Not the Outcome

본 연구는 1단계 웜스타트 방법(SFT 대 OPD)이 시각-언어 모델의 초기 엔트로피 체제과 답변 다양성에는 유의미한 영향을 미치지만, 2단계 강화 학습 이후의 최종 인도메인 성능을 실질적으로 변화시키거나 명확한 다운스트림 이점을 제공하지는 않는다는 점을 입증한다.

원저자: Jianxiong Shen

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jianxiong Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 복잡한 기하학 퍼즐을 풀 수 있도록 스마트 로봇(시각-언어 모델, VLM)을 훈련시키고 있다고 상상해 보세요. 이 논문은 로봇을 **강화 학습(RL)**이라는 고위험 훈련 캠프에 보내기 전에 어떻게 "예열(warm up)"하는 것이 가장 좋은지 조사합니다.

로봇을 예열하는 데는 두 가지 주요 방법이 있습니다:

  1. SFT (지도 미세 조정): 당신은 로봇에게 아주 똑똑한 선생님이 작성한 완벽한 정답이 담긴 교과서를 보여주며 이렇게 말합니다. "이 내용을 토씨 하나 틀리지 말고 그대로 외워."
  2. OPD (온-폴리시 증류): 로봇이 스스로 문제를 풀도록 내버려 두되, 로봇이 막히거나 실수를 할 때마다 똑똑한 선생님이 올바른 다음 단계를 속삭여 줍니다. 로봇은 단순히 최종 정답을 암기하는 것이 아니라, 선생님의 과정을 모방하며 배웁니다.

연구자들은 알고 싶었습니다: 로봇을 예열하는 방식이 최종 결과에 영향을 미칠까요?

다음은 단순한 비유를 사용한 연구 결과의 요약입니다:

1. "최종 점수"는 놀라울 정도로 비슷합니다

최종 시험(기하학 문제 풀이)을 경주라고 생각해 보세요. 연구진은 세 가지 다른 예열 방법을 시도했습니다.

  • 연구 결과: 어떤 예열 방식을 사용하든 로봇은 거의 동일한 지점(정확도 약 53~54%)에서 경주를 마쳤습니다.
  • 비유: 이는 세 명의 서로 다른 주자가 트랙의 약간씩 다른 출발 지점에서 시작하는 것과 같습니다. 결승선에 도달했을 때, 그들은 모두 아주 좁은 구역에 뭉쳐 있습니다. 예열 방식이 누구에게도 마지막까지 지속될 압도적인 유리함을 제공하지는 못했습니다.

2. "망각"의 신화

어떤 사람들은 로봇에게 너무 많은 특정 수학 지식(SFT)을 가르치면, 다른 것들(일반적인 수학 퍼즐 등)을 하는 법을 잊어버릴 것이라고 걱정합니다.

  • 연구 결과: 이는 로봇을 너무 오래 혹은 잘못된 지침으로 훈련했을 때만 발생했습니다. 적절한 시기에 훈련을 멈춘다면, 로봇은 아무것도 잊지 않았습니다.
  • 비유: 이는 특정 역사 시험을 위해 공부하는 것과 같습니다. 만약 10시간 동안 몰아치듯 공부한다면 자신의 이름조차 잊을 수 있습니다. 하지만 딱 1시간만 공부한다면, 시험 내용도 기억하고 자신의 이름도 기억할 것입니다. 문제는 공부 방법이 아니라 공부를 너무 오래 한 것이었습니다.

3. 진짜 차이점: "엔트로피" (로봇의 기분)

이것이 이 논문의 가장 큰 발견입니다. 최종 점수는 비슷했지만, 로봇의 내부 상태는 매우 달랐습니다.

  • SFT 로봇: 이들은 매우 자신감 있고 경직되었습니다. 정답을 알고 있었고 그것을 고수했습니다. 이들의 "엔트로피"(무작위성이나 다양성을 측정하는 척도)는 매우 낮았습니다. 이들은 "정답은 4이고, 나는 절대 5라고 말하지 않을 거야"라고 말하는 로봇과 같았습니다.
  • OPD 로봇: 이들은 호기심 많고 다양성을 유지했습니다. 여러 가지 가능성을 염두에 두었습니다. 이들의 "엔트로피"는 훨씬 높았습니다. 이들은 "정답은 아마 4겠지만, 5나 6도 가능할 수도 있어"라고 말하는 로봇과 같았습니다.
  • 비유: 요리사를 상상해 보세요.
    • SFT 요리사는 오직 하나의 특정 레시피만을 완벽하게 요리하는 로봇입니다.
    • OPD 요리사는 기본 레시피를 알고 있지만, 동시에 선생님의 "소금을 한 꼬집 넣어볼까?" 또는 "향신료를 더 넣어볼까?"와 같은 조언도 기억하는 로봇입니다. OPD 요리사는 더 넓은 메뉴의 아이디어를 가지고 있습니다.

4. "호기심"이 도움이 될까요?

연구자들은 질문했습니다: "그 추가적인 다양성(높은 엔트로피)이 로봇이 더 많은 문제를 푸는 데 도움이 될까요?"

  • 시작 단계 (최종 훈련 전): 네! OPD 로봇(호기심 많은 로봇)은 16번의 기회가 주어진다면 많은 다양한 정답을 만들어낼 수 있었습니다. 옵션을 탐색하는 데 더 뛰어났습니다.
  • 최종 훈련 후 (RL 이후): 아니요. 로봇이 고위험 훈련 캠프를 통과하고 나면, 그 초기 호기심은 사라졌습니다. 경직된 SFT 로봇과 호기심 많은 OPD 로봇 모두 결국 동일한 수의 문제를 해결했습니다.
  • 새로운 퍼즐 (영역 외 문제): 호기심은 로봇이 새로운 유형의 수학 문제를 푸는 데도 도움이 되지 않았습니다. 이 이점은 완전히 사라졌습니다.

결론

이 논문은 예열 방식(SFT vs. OPD)을 선택하는 것이 엄격한 교관유연한 코치 사이에서 선택하는 것과 같다고 결론짓습니다.

  • 무엇을 제어하는가: 그것은 초기 단계 동안 로봇의 "성격"(얼마나 경직되었는지 혹은 유연한지)을 제어합니다.
  • 무엇을 제로 제어하지 못하는가: 그것은 더 높은 최종 점수나 새로운 문제에 대한 더 나은 성능을 보장하지 않습니다.

핵심 요약: 지금 당장 더 다양한 방식으로 생각하는 로봇을 원한다면 유연한 코치(OPD)를 사용하세요. 하지만 그 다양성이 로봇이 훈련을 마친 후 자동으로 더 높은 최종 점수로 이어질 것이라고 기대하지는 마십시오. "예열"은 분위기를 설정하지만, 실제 결과를 결정하는 것은 "훈련 캠프(RL)"입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →