← 최신 논문
🤖 machine learning

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

이 논문은 동적인 요청별 금지 사항을 준수하도록 모델을 학습시키면서 동시에 일반적인 유용성을 보존하기 위해, 두 개의 동일한 가중치를 가진 교사 모델(하나는 금지 문맥이 있고 다른 하나는 없는 상태) 간의 토큰별 불일치를 활용하여 깨끗한 감독 신호를 생성하는 토큰 선택적 온-폴리시 증류 방법인 DUET을 제안한다.

원저자: Zihan Li, Feifei Li, Wenhui Que

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zihan Li, Feifei Li, Wenhui Que

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 인간과 유사한 텍스트를 생성하고, 문제를 해결하며, 질문에 답할 수 있는 능력을 갖추어 현대 디지털 어시스턴트의 핵심 엔진 역할을 하고 있습니다. 그러나 현실 세계에서 이러한 모델들은 종-종 모델의 뇌 속에 하드코딩된 것이 아니라, 사용되는 순간 지침(instruction)으로 주입되는 엄격하고 가변적인 규칙 아래에서 작동합니다. 어떤 회사는 모델에게 내부 도구를 절대 공개하지 말라고 지시할 수 있고, 어떤 병원은 환자의 이름을 절대 언급하지 말라고 요구할 수 있습니다. 이러한 규칙은 누가 질문하는지, 그리고 상황이 무엇인지에 따라 달라집니다. 개발자들의 과제는 모델이 해롭지 않은 질문에는 답변을 거부할 정도로 지나치게 조심스러워지거나, 규칙을 실수로 어길 정도로 지나치게 자신만만해지지 않도록 하면서, 이러한 특정적이고 일시적인 금지 사항을 준수하도록 가르치는 것입니다. 만약 모델이 이러한 지침을 따르는 데 실패하면 데이터 유출이나 브랜드 안전 사고로 이어질 수 있으며, 반대로 모델이 말하기를 너무 두려워하게 되면 쓸모없는 존재가 되어 버립니다.

텐센트(Tencent)의 연구진은 모델에게 실행 시간 규칙(runtime rules)을 따르도록 가르치는 이 특정한 문제를 해결하기 위해 DUET이라는 새로운 방법을 개발했습니다. 모델을 처음부터 다시 학습시키거나 단순히 좋은 답변과 나쁜 답변의 예시를 보여주는 대신, 그들은 똑같이 생긴 쌍둥이처럼 작동하는 시스템을 만들었습니다. 한쪽 쌍둥이는 자신의 지침에서 금지된 규칙을 보는 반면, 나머지 한쪽 쌍둥이는 동일한 지식과 능력을 갖추고 있음에도 그 규칙을 보지 못합니다. 이 두 "선생님"은 그 외에는 완전히 동일하기 때문에, 이들이 하는 말의 차이는 오직 해당 특정 규칙의 존재 여부에 의해서만 발생해야 합니다. 연구진은 이러한 불일치를 활용하여 모델이 실수를 저지를 가능성이 높은 정확한 지점을 찾아냅니다.

이 과정은 학생 모델이 응답을 생성하는 동안 두 명의 선생님 쌍둥이가 이를 지켜보는 방식으로 진행됩니다. 두 선생님이 다음에 올 단어에 대해 동의할 때, 시스템은 그 대화 부분을 안전하고 중요하지 않다고 가정하여 무시합니다. 하지만 두 선생님이 의견을 달리할 때, 즉 한 명은 비밀을 드러내는 단어를 제안하고 다른 한 명은 안전한 대안을 제안할 때, 시스템은 그 특정 순간을 중요한 학습 기회로 표시합니다. 이를 통해 학생 모델은 규칙이 실제로 중요한 몇 안 되는 단어에만 주의를 집중할 수 있으며, 완벽하게 괜찮은 수천 개의 단어에 노력을 낭비하지 않을 수 있습니다. 그런 다음 학생 모델은 규칙을 무시하는 선생님으로부터는 부드럽게 멀어지도록 밀어내고, 규칙을 준수하는 선생님 쪽으로는 끌어당김으로써, 유용함과 준수 사이의 경계를 항해하는 법을 효과적으로 배우게 됩니다.

이 접근 방식은 모델을 대화 전체에 대해 학습시키는 기존 방식의 결함을 해결합니다. 기존 시스템에서는 모델이 긴 답변 중 단 하나의 실수만 하더라도 전체 답변을 나쁜 것으로 취급하는 경우가 많았는데, 이는 모델에게 어떤 단어가 문제인지 혼란을 주었습니다. 불일치를 위반이 발생하는 정확한 토큰, 즉 단어 단위로 격리함으로써, 이 새로운 방법은 훨씬 더 깨끗한 신호를 제공합니다. 연구진은 이를 개인 정보 보호, 안전 가이드라인 준수, 비즈니스 도구 정의 준수 등 다양한 작업에 대해 테스트했습니다. 그 결과, 이 이중 선생님 방식(dual-teacher method)으로 학습된 모델은 정당한 질문에 대해서는 여전히 유용성을 유지하면서도, 규칙을 위반하는 요청에 대해서는 거절하는 능력이 현저히 향잡다는 것을 발견했습니다.

결과는 이 새로운 방법이 15억 개의 파라미터를 가진 작은 모델부터 80억 개의 파라미터를 가진 큰 모델에 이르기까지 다양한 크기의 모델 전반에서 기존 기술보다 뛰어난 성능을 보였음을 나타냈습니다. 테스트에서 모델들은 위반 요청에 대해 72%에서 85% 이상의 준수율을 달성하여 규칙을 어기는 것을 성공적으로 거부하는 동시에, 정상적인 질문에 대해서는 올바르게 답변하는 능력을 88%에서 93% 사이로 유지하며 높은 수준의 유용성을 보였습니다. 결정적으로, 모델들은 일반적인 지능을 잃지 않았으며, 수학 및 논리 퍼즐에서도 이전과 같이 우수한 성능을 유지했습니다. 이 연구는 두 개의 동일한 모델을 사용하여 규칙이 중요한 정확한 지점을 찾아냄으로써, 개발자들이 방대한 양의 새로운 데이터 없이도 핵심 역량을 잃지 않으면서 복잡하고 변화하는 지침을 항해할 수 있는 안전하고 유용한 AI 어시스턴트를 만들 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →