One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context
이 논문은 소프트 프롬프트 특권 컨텍스트를 통한 멀티태스크 온폴리시 증류(Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context)를 소개하며, 이는 고정된 백본 모델과 태스크별 학습 가능한 소프트 프롬프트를 교사로 활용하여 단일 학생 모델이 치명적 망각을 겪거나 전체 가중치 미세 조정을 요구하지 않고도 여러 태스크의 지식을 병렬적으로 효율적으로 흡수할 수 있도록 하는 방법이다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하지만 약간은 덜렁대는 학생에게 복잡한 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 인공지능의 세계에서 이 학생은 '대규모 언어 모델(LLM)'입니다. 이 모델은 인터넷에 있는 거의 모든 것을 읽었으며 이야기를 쓰고, 질문에 답하고, 수학 문제를 풀 수 있는 컴퓨터 프로그램입니다. 하지만 때때로 이 초천재적인 모델들도 막히거나 어처l한 실수를 하곤 합니다. 이를 해결하기 위해 과학자들은 '증류(distillation)'라고 불리는 기술을 사용합니다. 이것은 마치 마스터 셰프(선생님)가 주니어 요리사(학생)를 레시피를 통해 지도하는 것과 같습니다. 학생은 단순히 완성된 요리를 복사하는 것이 아니라, 요리의 결과물이 아닌 요리의 과정, 즉 모든 칼질, 젓기, 맛보기를 관찰하며 배웁니다.
오랫동안 이 AI 학생들을 가르치는 가장 좋은 방법은 선생님이 완벽한 답안을 작성하여 학생에게 보여주는 것이었습니다. 하지만 여기에는 숨겨진 함정이 있었습니다. 선생님이 실제로 단계별로 문제를 풀기보다는, 먼저 답을 추측한 다음 그 답을 정당화하기 위해 이야기를 지어낼 때가 있었던 것입니다. 그러면 학생도 이 나쁜 습관을 배우게 됩니다. 또 다른 방법은 선생님의 지능(내부 가중치) 전체를 변경하여 더 똑똑하게 만드는 것이었지만, 이는 선생님이 새로운 작업에 집중하는 동안 시 쓰기나 대화 같은 다른 일을 하는 법을 잊어버리게 만드는 경우가 많았습니다. 과학자들이 던져온 큰 질문은 이것입니다. 어떻게 하면 올바른 경로를 보여줄 만큼 똑똑하면서도, 기존의 기술을 잊어버리거나 정답지를 훔쳐보며 속임수를 쓰지 않을 만큼 안정적인 선생님을 만들 수 있을까?
이 논문은 PROMPTSD(Prompt-based On-Policy Soft-Distillation)라는 영리한 해결책을 소개합니다. 미국과 싱가포르의 대학들로 구성된 저자 팀은, 선생님과 학생이 거의 동일하지만 선생님의 지시문 앞에 아주 작고 보이지 않는 '마법의 메모'가 붙어 있는 형태의 모델을 제안합니다.
이것이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다. 학생과 선생님이 똑같은 뇌와 성격을 공유하는 쌍둥이라고 상상해 보세요. 보통 학생에게 새로운 기술을 가르치기 위해, 당신은 선생님에게 완전히 새로운 안경을 씌워주거나(뇌를 변경함) 정답이 적힌 치트 시트를 줄 수도 있습니다(정답지를 줌). 두 방법 모두 문제가 있습니다. 새로운 안경은 선생님이 다른 것을 보는 법을 잊게 만들고, 치트 시트는 선생님을 게으르게 만들어 문제를 해결하는 대신 답을 정당화하게 만듭니다.
PROMPTSD는 다르게 행동합니다. 그것은 선생님에게 **소프트 프롬프트(soft prompt)**를 제공합니다. 이것은 "기억해, 이 특정 수학 문제에 대해서는 분수부터 먼저 생각해"라고 적힌 아주 작고 보이지 않는 포스트잇 같은 것입니다. 이 메모는 단어가 아닌 숫자로 이루어져 있으며, 선생님과 학생 사이에서 변하는 유일한 요소입니다. 선생님의 뇌는 얼어붙은 듯 그대로 유지되며 학생과 정확히 일치합니다. 선생님은 정답지를 보고 있는 것이 아니기 때문에, 올바른 경로를 생성하기 위해 실제로 문제를 생각해서 풀어내야만 합니다. 또한 선생님의 뇌가 재작성되지 않았기 때문에, 다른 일을 하는 법을 잊어버리지 않습니다.
연구진은 이 아이디어를 Qwen3-1.7B-Base와 Phi-4-mini-instruct라는 모델로 테스트했습니다. 그들은 이 모델들에게 과학, 도구 사용(계산기나 검색 엔진 등), 생물학, 수학이라는 네 가지 기술을 가르쳤습니다. 그들은 자신들의 '마법의 메모' 선생님이 믿기 힘들 정도로 효과적이라는 것을 발견했습니다. 단일 작업에서 학생은 선생님이 완전히 재학습되었을 때와 마찬가지로 잘 학습했을 뿐만 아니라, 전체 뇌의 100%를 조정해야 하는 전체 재학습과 달리 단 0.05%의 파라미터만을 조정했기 때문에 훨씬 더 빠르게 학습했습니다.
더욱 인상적인 것은, 그들이 학생에게 네 가지 기술을 동시에 가르치려고 시도했다는 점입니다. 보통 한 번에 너무 많은 것을 배우려고 하면 예전에 배운 것을 잊어버리는 문제(캐타스트로픽 포게팅, 파괴적 망각)가 발생합니다. 하지만 PROMPTSD 선생님은 이러한 작은 작업별 메모만을 사용했기 때문에, 학생은 혼란을 겪거나 일반적인 지능을 잃지 않고 네 명의 서로 다른 선생님으로부터 지식을 동시에 흡수할 수 있었습니다. 실제로 Qwen3-1.7B-Base 모델에서 이 멀티태스킹 접근 방식은 평균 점수 56.2를 기록하며 다른 모든 방법을 제치고 승리했습니다.
논문은 몇 가지 흔한 아이디어들을 명시적으로 배제합니다. 단순히 선생님에게 정답을 주는 것(예: "Gold Answer" 선생님)이 오히려 학생에게 해가 된다는 것을 보여줍니다. 왜냐하면 선생님이 답을 도출하는 대신 답을 정당화하기 때문입니다. 또한 선생님을 훨씬 더 크게 만드는 것(예: 4B 또는 8B 파라미터 모델 사용)이 항상 도움이 되는 것은 아니라는 점도 시사합니다. 때로는 올바른 "사고 패턴"을 가진, 학생과 크기가 같은 선생님이 더 낫습니다. 나아가, 강화 학습(시행착오를 통해 배우는 방법)은 학생이 이미 가진 기술을 날카롭게 다듬는 데는 좋지만, 완전히 새로운 지식을 처음부터 가르치는 데는 적합하지 않다는 것을 발견했습니다.
저자들은 실험을 여러 번 수행하고 숫자를 주의 깊게 확인했기 때문에 이 결과에 대해 매우 확신하고 있습니다. 그들은 학생의 사고가 선생님과 얼마나 겹치는지 정확하게 측정했으며, 자신들의 방법이 완벽한 중첩을 만들어냈음을 발견했습니다. 즉, 배울 수 있을 만큼 충분히 겹치되, 새로운 것을 발견할 여지가 없을 정도로 과하게 겹치지는 않는 수준입니다. 또한 그들은 자신들의 방법이 모델을 재학습시켜 일반적인 능력을 잊게 만드는 "SFT 트랩"을 피한다는 것을 증명했습니다.
결론적으로, PROMPTSD는 AI를 가르치는 비결이 반드시 선생님을 더 크게 만들거나 정답을 주는 데 있는 것이 아님을 시사합니다. 대신, 선생님에게 아주 작고 유연한 자극인 '소프트 프롬프트'를 주어, 정체성을 바꾸지 않으면서도 사고를 가이드하는 것이 핵심입니다. 이를 통해 단 한 명의 학생이 여러 명의 서로 다른 선생님으로부터 동시에 배울 수 있으며, 자신의 정체성을 잃지 않고도 다양한 기술의 달인이 될 수 있습니다. 이는 마치 매 과목마다 당신의 귀에 올바른 전략을 속삭여 주는 개인 튜터를 두는 것과 같습니다. 단, 그 튜터는 당신의 뇌를 다시 쓰거나 시험 답안을 훔쳐보게 만들지 않습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.