A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts
본 논문은 기존 언어 모델 안전성 벤치마크의 혼동 문제를 해결하기 위해 실행 가능한 악성 소프트웨어 요청과 해로운 보안 지식 쿼리를 엄격하게 구분하는 합의 기반 라벨링 분류 프레임워크와 검증된 1,554 개의 프롬프트로 구성된 "CODE" 뱅크를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
보안 요원이 나쁜 사람들을 막는 데 얼마나 뛰어난지 테스트해 보려고 한다고 상상해 보세요. 당신은 보안 요원에게 줄 요청 목록을 가지고 있습니다. 어떤 요청은 보안 요원에게 장전된 총을 건네며 "이 사람을 쏘아라"라고 말하는 것과 같습니다. 다른 요청은 보안 요원에게 교과서를 건네며 "총이 어떻게 작동하고 어떻게 조준하는지 설명해 달라"고 말하는 것과 같습니다.
오랫동안 AI 안전성을 테스트해 온 연구자들은 이러한 두 가지 유형의 요청을 하나의 큰 더미에 섞어 왔습니다. 그들은 AI 에게 "바이러스를 작성해 달라"(장전된 총) 고 요청하고 "바이러스가 어떻게 퍼지는지 설명해 달라"(교과서) 고 요청한 뒤, AI 가 "아니오"라고 말한 횟수만 세었습니다.
이 논문의 저자인 리처드 J. 영 (Richard J. Young) 과 그레고리 D. 무디 (Gregory D. Moody) 는 이러한 테스트 방식이 엉망이라고 말합니다. 만약 AI 가 바이러스 작성은 거절하지만 교과서 설명은 기꺼이 하거나 그 반대의 경우라면, 단순한 "아니오" 횟수만으로는 AI 의 두뇌 내부에서 실제로 무슨 일이 일어나고 있는지 알 수 없습니다. 이는 총알을 막는 보안 요원의 능력을 측정할 때, 총알에 관한 정보를 읽는 것을 막는 능력까지 함께 세는 것과 같습니다. 보안 요원이 무기를 막는 데 능숙한지, 아니면 단순히 정보를 막는 데 능숙한지 구분할 수 없습니다.
핵심 아이디어: "무기"와 "지식" 분리
이 문제를 해결하기 위해 연구자들은 새로운 도구를 만들었습니다: **검증된 프롬프트 뱅크 (Validated Prompt Bank)**입니다. 이는 철저하게 정리되고 이중으로 확인된 서류 캐비닛과 같습니다. 그들은 네 가지 기존 테스트 목록에서 수천 개의 질문을 가져와 두 개의 명확한 서랍으로 분류했습니다.
- "무기" 서랍: 이 서랍에는 AI 에게 실제로 위험한 무언가를 만들게 하는 프롬프트가 들어 있습니다. 예를 들어 컴퓨터에서 실행 가능한 맬웨어나 스크립트 같은 것입니다. 이는 "실행 가능한 무기"들입니다.
- "지식" 서랍: 이 서랍에는 AI 에게 실제로 코드를 작성하지 않고 위험한 것들을 설명하게 하는 프롬프트가 들어 있습니다. 예를 들어 바이러스가 어떻게 작동하는지나 시스템을 해킹하는 방법을 설명하는 것들입니다.
서류 캐비닛 구축 방법
그들은 단순히 서류를 직접 분류한 것이 아니라, 분류가 정확했는지 확실히 하고 싶어 했습니다. 그래서 다섯 개의 서로 다른 AI 판정단으로 구성된 "배심원단"을 구성했습니다. 이 판정단들은 Anthropic, OpenAI, Google, Zhipu AI, Alibaba 등 다섯 개의 서로 다른 기술 기업에서 온 AI 들입니다.
한 가지 요청을 다섯 명의 서로 다른 전문가가 살펴본다고 상상해 보세요. 그들은 모두 투표해야 합니다: "이것은 무기 요청인가, 아니면 단순히 정보 요청인가?"
- 다섯 명 중 최소 세 명이 동의하면 그것이 최종 답변이 됩니다.
- 그들은 그들의 작업을 Fleiss' 라는 통계 도구를 사용하여 얼마나 일치했는지 확인했습니다. 그 결과는 "거의 완벽"한 일치 (1.0 점 중 0.876 점) 였습니다. 이는 분류가 매우 신뢰할 수 있음을 의미합니다.
결과: 정제되고 검증된 목록
17,000 개 이상의 원래 요청을 분류하고 중복되거나 혼란스러운 것들을 필터링한 결과, 그들은 순수하게 "무기"(악성 코드) 요청에 관한 1,554 개의 프롬프트로 구성된 정제되고 검증된 목록을 얻었습니다. 또한 나중에 비교를 위해 사용할 "지식"에 관한 388 개의 프롬프트 목록도 별도로 보관했습니다.
왜 이것이 중요한가
이 논문 이전에는 연구자가 AI 가 안전한지 테스트하고 싶다면, 스스로 엉망진창인 질문 더미를 만들어야 했고, 어떤 것이 "무기"이고 어떤 것이 "지식"인지 추측해야 했습니다. 이는 모든 연구가 약간씩 다르게 진행되어 결과 비교를 어렵게 만들었습니다.
이 논문은 표준화되고 사전 분류된 질문 세트를 제공합니다. 이제 연구자들은 "우리는 AI 를 이 특정 1,554 개의 무기 요청으로 테스트했다"라고 말할 수 있으며, 다른 모든 사람들은 그 의미가 정확히 무엇인지 알게 됩니다. 이는 추측을 배제하고 서로 다른 AI 모델이 위험한 요청을 어떻게 처리하는지에 대한 공정하고 직접적인 비교를 가능하게 합니다.
중요한 안전 주의사항
저자들은 매우 명확하게 밝힙니다: 그들은 새로운 바이러스나 위험한 코드를 만들지 않았습니다. 그들은 다른 학술 연구에서 기존에 존재하던 질문들만 가져와 분류했을 뿐입니다. 이 도구의 목표는 AI 가 어디서 실패하는지 정확히 이해함으로써 AI 를 더 안전하게 만드는 데 연구자들을 돕는 것이지, 누구에게나 공격을 구축하는 것을 돕는 것이 아닙니다. 데이터는 "게이트드 (gated)" 시스템 뒤에 잠겨 있어, 안전성 연구를 수행하는 검증된 연구자만이 질문의 실제 텍스트에 접근할 수 있습니다.
요약하자면, 이 논문은 AI 안전성을 측정하는 더 나은, 더 깨끗한 자를 만들었습니다. "나쁜 일을 하라"는 요청과 "나쁜 일에 대해 말하라"는 요청을 분리하여 정확하게 측정할 수 있도록 한 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.