Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)
본 논문은 코딩 LLM 거부를 평가하는 데 사용된 13 가지 악성 코드 프롬프트 코퍼스에 대한 체계적 검토를 제시하여 인간 주석 기준, 교차 코퍼스 비교 가능성, 그리고 분류 체계 표준화에서의 중요한 방법론적 격차를 식별하고 향후 데이터셋 구축을 위한 통합 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 초지능적인 로봇(대형 언어 모델 또는 LLM 이라고 함) 을 좋은 시민으로 가르치려 노력하는 세상을 상상해 보세요. 구체적으로 우리는 다음과 같은 것을 알고 싶습니다: 누군가 이 로봇들에게 컴퓨터 바이러스나 사기를 작성해 달라고 요청하면, 그들은 "아니요"라고 말할까요?
이를 테스트하기 위해 연구자들은 로봇을 속이기 위한 "시험지"(프롬프트 데이터셋) 를 만들어 왔습니다. 이 논문은 2023 년에서 2025 년 사이에 만들어진 13 가지 서로 다른 시험지에 대한 방대한 성적표 검토 보고서입니다. 저자인 리처드 영 (Richard Young) 과 그레고리 무디 (Gregory Moody) 는 이 모든 시험지를 어떻게 구성했는지, 얼마나 공정한지, 그리고 실제로 무엇을 측정했는지 살펴보았습니다.
다음은 그들의 발견 사항을 간단한 비유를 사용하여 정리한 내용입니다:
1. 문제: 모두가 서로 다른 자를 사용하고 있습니다
13 명의 서로 다른 사람의 키를 재려고 상상해 보세요. 하지만 여기에는 함정이 있습니다:
- A 사람은 인치 단위의 자로 측정됩니다.
- B 사람은 센티미터 단위의 줄자로 측정됩니다.
- C 사람은 벽에 도달하기 위해 몇 걸음을 떼는지로 측정됩니다.
- D 사람은 완전히 다른 사람이 측정합니다.
이 논문은 AI 안전 테스트에서도 정확히 이런 일이 발생하고 있다고 주장합니다. AdvBench, CyberSecEval, RedCode등 13 가지 시험지 각각은 다음과 같이 다르게 구성되었습니다:
- 서로 다른 질문: 어떤 것은 직접 코드를 요청하고, 어떤 것은 복잡한 이야기를 통해 코드를 요청하며, 어떤 것은 AI 에게 해커처럼 행동하라고 하고, 다른 것은 실수를 할 수도 있는 도움이 되는 조수처럼 행동하라고 요청합니다.
- 서로 다른 채점자: 어떤 시험지는 저자 혼자 채점하고, 어떤 것은 다른 AI 봇이 채점하며, 어떤 것은 코드를 샌드박스에서 실행시켜 폭발하는지 확인하여 채점합니다.
- 서로 다른 규칙: 어떤 시험지는 "바이러스"로 간주되는 것에 대해 엄격한 규칙을 가지고 있고, 다른 것은 모호합니다.
결과: 한 시험지에서의 "거부율"(AI 가 "아니요"라고 말한 빈도) 을 단순히 가져와서 다른 시험지와 비교할 수 없습니다. 이는 스프린터의 기록과 수영 선수의 기록을 비교하여 규칙을 고려하지 않은 채 하나가 더 "빠르다"고 선언하는 것과 같습니다.
2. 세 가지 큰 누락된 요소
저자들은 어떤 13 개의 시험지도 엄격한 과학적 연구에서 기대할 세 가지 중요한 안전 기능이 포함되어 있지 않다고 발견했습니다:
- AI 를 보정할 "인간 심사관" 부재: 대부분의 시험지는 답변을 채점하기 위해 다른 AI 봇을 사용합니다. 하지만 이 논문은 이러한 AI 채점자들이 실제로 옳은지 알 수 없다고 지적합니다. 이는 로봇이 수학 시험을 채점할 때 로봇의 채점 키가 올바른지 확인하는 인간 교사가 전혀 없는 것과 같습니다. 13 개의 논문 중 어느 것도 서로 다른 인간 심사관이 동일한 답변에 동의할 수 있음을 증명하는 통계적 방법인 "플리스 카파 (Fleiss'kappa)"점수를 가지고 있지 않았습니다.
- "잠긴 문"(제한적 접근) 부재: 이러한 시험지에는 악성 소프트웨어 (멀웨어) 를 만드는 방법에 대한 지침이 포함되어 있습니다. 그럼에도 불구하고 13 개 모두 완전히 공개되어 있습니다. 나쁜 의도를 가진 사람이라도 누구나 다운로드할 수 있습니다. 이는 폭탄 제조 레시피 요리책을 출판하여 공원 벤치에 두고 누구나 주울 수 있게 하는 것과 같습니다.
- "회수 정책"(삭제) 부재: 만약 이러한 시험지에不应该 있는 위험한 프롬프트가 발견되거나, AI 가 그것으로부터 학습하여 실제 바이러스를 만들기 시작하면, 저자에게 연락하여 삭제할 수 있는 공식적인 방법이 없습니다. 어떤 논문에도 유해한 콘텐츠를 제거할 책임이 있는 특정 사람이나 "삭제 정책"이 명시되어 있지 않았습니다.
3. 교실의 "빈 자리"
저자들은 어떤 종류의 "함정 질문"이 존재하는지 보여주기 위해 지도 (분류 체계) 를 만들었습니다. 그들은 연구자들이 모두 같은 몇 개의 자리에 앉아 있고, 많은 다른 자리들은 비어 있음을 발견했습니다:
- 혼잡한 자리: 대부분의 시험지는 단일하고 직접적인 문장으로 코드를 요청합니다 (예: "바이러스를 작성하세요").
- 빈 자리: 매우 few 개의 시험지가 다음과 같은 복잡한 시나리오를 테스트합니다:
- 긴 대화 (멀티턴) 를 통해 AI 에게 서서히 바이러스를 만들도록 요청하는 것.
- AI 에게 컴퓨터를 제어하는 자율 에이전트처럼 행동하도록 요청하는 것.
- 소프트웨어뿐만 아니라 스마트 냉장고나 자동차 칩과 같은 하드웨어를 공격하는 코드를 요청하는 것.
"자리"가 고르지 않기 때문에 데이터가 왜곡되었습니다. 우리는 AI 가 단순한 요청을 어떻게 처리하는지에 대해서는 많이 알고 있지만, 복잡하고 다단계 공격을 어떻게 처리하는지에 대해서는 거의 알지 못합니다.
4. 권장 사항: 교실을 어떻게 고칠 것인가
이 논문은 미래에 더 나은 "시험지"를 구축하려면 새로운 체크리스트를 따라야 한다고 제안합니다:
- 규칙 사전 등록: 시험을 만들기 전에 정확히 무엇을 테스트할지 미리 기록하여 중간에 규칙을 바꾸지 않도록 합니다.
- 인간 심사관 패널 사용: 하나의 AI 만으로 채점하지 말고, "거부"를 무엇으로 간주할지 동의하는 다양한 그룹의 인간 (또는 인간과 다양한 AI 의 혼합) 을 사용하세요.
- 동의 점수 보고: 심사관들이 실제로 서로 동의했음을 보여주는 통계를 게시하세요.
- 표준 사전 사용: 모든 사람이 동일한 범주를 계산하도록 "나쁜 것"(멀웨어 유형) 의 단일 목록에 동의하세요.
- 문 잠그기: 시험에 위험한 지침이 포함되어 있다면, 악의적인 행위자가 쉽게 다운로드하지 못하도록 접근을 어렵게 하세요 (연구자 신청서 요구).
- 수호자 지정: 시험이 해를 끼칠 경우 이를 제거할 책임이 있는 특정 사람을 지정하세요.
요약
이 논문은 새로운 실험을 수행한 것이 아닌 "체계적 검토"입니다. 대신, 도서관 사서가 "안전 테스트"라는 13 권의 서로 다른 책이 있는 방에 들어와 모두 열어본 후 다음과 같은 사실을 깨달은 것과 같습니다: "우리는 모두 고장 난 자로 서로 다른 것을 측정하고 있으며, 이러한 책의 위험한 부분을 누구나 찾을 수 있도록 공개된 곳에 방치하고 있습니다."
저자들은 커뮤니티가 이러한 테스트를 고립적으로 구축하는 것을 멈추고, AI 가 실제로 나쁜 일을 하지 않으려 거절하는지 측정하는 표준적이고 안전하며 공정한 방법에 대해 합의할 것을 호소하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.