← 최신 논문
🤖 AI

A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification

본 논문은 클래스별 재균형(per-class rebalancing)을 통해 무해한 프롬프트에 대한 오탐지를 유의미하게 줄이면서, 적대적 텍스트에 대해 더 큰 GPU 지향형 가드 모델의 성능과 일치하도록 작은 CPU 효율적 안전 분류기를 학습시키는 재현 가능하고 라이선스를 고려한 지식 증류 레시피를 제시한다.

원저자: Edson Rodrigues da Cruz Filho, Paulo Ricardo Ferreira Neves, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielse
게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Edson Rodrigues da Cruz Filho, Paulo Ricardo Ferreira Neves, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielsen Dias, Marccello Wilson Perez Berto, Gustavo Voltani Von Atzingen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 글을 쓰고, 추론하며, 대화할 수 있는 강력한 도구이지만, 본질적으로 안전한 것은 아닙니다. 필터가 없다면 이들은 유해한 지침, 혐오 표현 또는 위험한 조언을 생성할 수도 있습니다. 이를 방지하기 위해 개발자들은 이러한 모델 앞에 안전 계층, 즉 문지기 역할을 하는 전용 시스템을 배치합니다. 이 문지기는 모든 메시지를 읽고 정책 위반 여부를 결정합니다. 현재 가장 뛰어난 문지기들은 매우 거대한 컴퓨터 프로그램으로, 이를 빠르게 실행하려면 특수하고 값비싼 그래픽 하드웨어가 필요합니다. 만약 표준 컴퓨터 프로세서에서 실행하려고 하면, 질문 하나에 답하는 데 몇 초가 걸릴 정도로 매우 느려집니다. 이는 일반적이고 저렴한 하드웨어에서 실행되어야 하거나 즉각적인 응답이 필요한 많은 애플리케이션에 문제를 일으킵니다. 연구진들이 던진 질문은, 위험을 감지하는 능력을 잃지 않으면서 이 거대한 안전 시스템을 일반 컴퓨터에 적합한 크기로 줄이는 것이 가능한가 하는 것이었습니다.

한 연구팀은 더 작은 안전 시스템을 훈련하는 새로운 방법을 개발함으로써 이 문제를 해결하고자 했습니다. 그들은 정확도가 높다고 신뢰할 수 있는 매우 크고 강력한 안전 모델로부터 시작했습니다. 이 거대한 모델은 교사 역할을 하며, 약 97,000개의 서로 다른 프롬프트 모음을 읽고 이를 물리적 폭력, 혐오 표현, 위험한 조언과 같은 7가지 특정 유해 카테고리로 분류했습니다. 연구진은 이 교사의 판단을 모방하도록 훨씬 더 작은 모델 군단을 훈련시켰습니다. 이 작은 모델들은 표준 컴퓨터 프로세서에서 실행될 수 있을 만큼 가볍도록 설계되었습니다. 연구진은 훈련 데이터가 상업적 제품에 법적으로 사용 가능한지 확인하기 위해 주의를 기울였으며, 데이터를 공용 소프트웨어에 사용할 수 있는 그룹과 연구용으로만 예약된 그룹의 두 가지로 분리했습니다. 이를 통해 법적 제한이 성능 측면에서 정확히 어느 정도의 비용을 치르게 하는지 측정할 수 있었습니다.

결과는 작은 모델들이 효과적인 안전 파수꾼이 될 수 있음을 보여주었습니다. 시스템을 속이기 위해 설계된 까다로운 적대적 텍스트를 대상으로 테스트했을 때, 가장 작은 생성형 모델은 거대한 교사와 대등한 성능을 보이며 위험을 감지하는 능력을 일치시켰습니다. 더욱 놀라운 점은, 작은 생성형 모델이 오탐(false alarms)을 피하는 데 더 뛰어났다는 것입니다. 거대한 교사는 때때로 무해한 메시지를 실수로 차단하기도 했지만, 작은 생성형 모델은 이러한 오류를 더 적게 범하며, 안전한 프롬프트를 위험하다고 잘못 표시하는 비율이 거대한 교사의 4.8%에 비해 약 3.8%에 불과했습니다. 그러나 인코더나 얕은 신경망과 같은 다른 작은 모델들은 오탐을 피하는 데 있어 교사보다 오히려 성능이 떨어졌습니다. 하지만 가장 효율적인 해결책은 생성형 모델이 아니라 분류를 위해 특별히 설계된 시스템인 특화된 인코더였습니다. 이 인코더는 표준 컴퓨터에서 요청을 약 24밀리초 만에 처리할 수 있어, 인간 사용자에게 거의 즉각적인 것처럼 느껴지게 했습니다. 반면, 거대한 교사는 동일한 하드웨어에서 동일한 작업을 수행하는 데 몇 초가 걸렸습니다.

이 연구는 이러한 시스템의 한계가 컴퓨터 모델의 크기가 아니라, 그들이 해결하려는 문제의 정의 때문이라는 점도 밝혀냈습니다. 연구진은 아주 작은 모델부터 거대한 교사에 이르기까지 모든 모델이 '위험한 조언'이라는 특정 카테고리에서 똑같이 어려움을 겪는다는 것을 발견했습니다. 모델이 수백만 개의 파라미터를 가졌든 수십억 개의 파라미터를 가졌든, 유익한 조언과 해를 끼칠 수 있는 조언을 구분하는 데 자주 실패했습니다. 이는 어려움이 컴퓨팅 파워의 문제가 아니라 카테고리가 어떻게 정의되느냐에 달려 있음을 시사합니다. 연구진은 대부분의 실세계 애플리케ong에 가장 적합한 접근 방식은 이러한 증류된 작은 모델들을 사용하는 것이라고 결론지었습니다. 이 모델들은 무엇이 해로운지에 대한 정의가 명확하고 일관된다면, 일상적인 하드웨어에서도 안전 계층을 실행 가능하게 만드는 속도와 정확성의 균형을 제공합니다. 이 연구는 값비싼 특수 장비에 의존하지 않고도 더 안전하고, 빠르며, 접근 가능한 인공지능 시스템을 구축하기 위한 실질적인 가이드 역할을 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →