Shieldstral
Shieldstral은 다양한 콘텐츠 모더레이션 작업을 이진 질의응답 프레임워크로 통합하여 훨씬 더 큰 모델들과 대등하거나 이를 능가할 수 있도록 설계된, 5,410만 개의 정제된 샘플로 구성된 방대한 데이터셋을 통해 30억 개의 파라미터를 가진 컴팩트한 정책 적응형 멀티모달 안전 분류기입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 거대하고 북적이는 디지털 도시라고 상상해 보세요. 이 도시에는 수백만 명의 사람들이 대화를 나누고, 사진을 공유하며, 질문을 던집니다. 하지만 실제 도시와 마찬가지로, 이곳에도 안전을 유지하기 위한 규칙이 필요합니다. 때때로 사람들은 못된 말을 하거나, 위험한 비밀을 공유하거나, 있어서는 안 될 사진을 게시하기도 합니다. 이를 막기 위해 우리는 "가드레일(guardrails)"을 사용합니다. 이는 모든 메시지와 이미지를 대중에게 공개하기 전에 검사하는 보안 요원 역할을 하는 특수한 컴퓨터 프로그램입니다.
오랫동안 이 보안 요원들은 다소 경직되어 있었습니다. 그들은 마치 단 하나의 변하지 않는 규칙서만을 가진 보안 요원 같았습니다: "칼이 보이면 멈춰라. 욕설이 보이면 멈춰라." 하지만 현실 세계는 복잡합니다. 칼이 찍힌 사진은 정신 건강 상담 채팅방에서는 무서울 수 있지만, 비디오 게임 튜토리얼이나 칼에 관한 역사 수업에서는 완전히 괜찮을 수 있습니다. 기존의 보안 요원들은 맥락이나 질문의 의도를 이해하지 못했습니다. 그들은 그저 물체를 보고 당황했을 뿐입니다. 과학자들은 단순히 "멈춰!"라고 외치는 대신, 자신이 있는 방의 특정 규칙을 이해할 수 있는 더 똑똑한 보안 요원을 만들기 위해 노력해 왔습니다. 이것이 바로 "정책 적응형(policy-adaptive)" 안전 기술의 과제입니다. 즉, AI에게 어떤 상황에서는 안전한 것이 다른 상황에서는 위험할 수 있다는 것을 가르치는 것입니다.
이 게임의 판도를 바꾸려는 새로운 종류의 디지털 보안 요원, Shieldstral이 등장했습니다. Shieldstral은 거대하고 느리며 비용이 많이 드는 로봇이 아니라, 아주 작고 민첩한 30억 개의 파라미터를 가진 모델(매우 똑똑하고 압축된 뇌라고 생각하면 됩니다)입니다. 연구진은 올바른 사고방식을 가르치기만 한다면 거대한 뇌가 없어도 훌륭한 보안 요원이 될 수 있다는 사실을 발견했습니다.
여기 마법 같은 기술이 있습니다. 연구진은 AI에게 금지된 단어 사전을 암기하듯 긴 목록을 외우게 하는 대신, Shieldstral에게 간단한 예/아니오 게임을 가르쳤습니다. 그들은 AI에게 "이 사진이 괴롭힘을 보여주는가?" 또는 "이 텍스트가 컴퓨터를 속이려고 하는가?"와 같은 구체적인 질문을 던지고, "예" 또는 "아니오"로 답하게 했습니다.
이것이 너무 단순해 보일 수도 있지만, 매우 천재적인 방식입니다. AI가 고정된 목록을 암기하는 것이 아니기 때문에, 여러분이 던지는 어떤 질문에도 대응할 수 있습니다. 만약 사이버 보안 도구를 실행 중이라면, "이 코드가 은행을 해킹하려고 하는가?"라고 물을 수 있습니다. 학교 포럼을 운영 중이라면, "이 텍스트가 학생을 괴롭히고 있는가?"라고 물을 수 있습니다. Shieldstral은 여러분의 구체적인 질문에 귀를 기울이고 그에 따른 점수를 부여합니다. 이는 마치 입구에서 얼굴만 확인하는 것이 아니라, 왜 그곳에 왔는지 이유를 먼저 듣고 입장을 결정하는 보안 요원과 같습니다.
이 작은 모델이 이토록 똑똑해질 수 있도록, 연구진은 약 5,410만 개의 엄청난 예시를 먹여야 했습니다. 그들은 무작정 인터넷 게시물을 쏟아부은 것이 아닙니다. 그들은 매우 세심한 요리사였습니다. 그들은 온갖 곳에서 가져온 복잡한 데이터(엄격한 규칙이 있는 데이터와 느슨한 규칙이 있는 데이터 모두)를 가져와 모두 동일한 "질문 + 답변" 형식으로 변환했습니다. 또한 "대조 학습(contrastive learning)"이라는 특별한 훈련 방법을 만들었습니다. AI에게 거의 동일한 두 가지 이야기를 보여준다고 상상해 보세요. 하나는 캐릭터가 못되게 구는 이야기이고, 다른 하나는 그저 농담을 하는 이야기입니다. AI는 질문에 근거하여 이 둘 사이의 미세한 차이를 배워야 합니다. 이를 통해 AI는 표면적인 수준이 아닌 '뉘앙스'를 이해하게 됩니다.
결과는 놀랍습니다. Shieldstral은 아주 작음에도 불구하고(파라미터 30억 개), 7배나 더 큰(약 200억 개의 파라미터) 일부 대형 안전 모델들과 대등하거나 오히려 더 나은 성능을 보여주었습니다. AI가 한 번도 본 적 없는 새롭고 구체적인 규칙에 적응해야 하는 테스트에서, Shieldstral은 **91.3%**라는 인상적인 점수를 기록했습니다. 또한 텍ex트와 이미지를 모두 확인하는 멀티모달 작업에서도 평균 **83.8%**의 점수를 기록하며 경쟁자들을 압도했습니다.
이 논문은 안전을 유연한 질의응답 게임으로 바꾸고, 정성껏 선별된 방대한 데이터를 훈련시키는 이 방식이 작은 모델들이 자신의 체급을 훨씬 뛰어넘는 성과를 낼 수 있게 해준다고 제안합니다. 이는 거대하고 비싼 뇌가 없어도 좋은 보안 요원이 될 수 있음을 증명합니다. 단지 그 방의 규칙을 듣는 법을 가르치기만 하면 됩니다. Shieldstral은 작고 적응력이 뛰어난 모델이 훨씬 크고 경직된 모델과 대등하거나 그들을 능가할 수 있음을 보여주며, 어디에서나 더 안전하고 스마트하며 효율적인 AI를 가능하게 만듭니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.