← 최신 논문
💻 computer science

LLM-Safety Evaluations Lack Robustness

본 논문은 현재 대규모 언어 모델 안전성 연구가 평가 파이프라인 전반에 걸친 상당한 노이즈와 불일치로 인해 저해받고 있다고 주장하며, 향후 공격 및 방어 평가의 견고성, 공정성, 비교 가능성을 제고하기 위한 체계적인 지침을 제안한다.

원저자: Tim Beyer, Sophie Xhonneux, Simon Geisler, Gauthier Gidel, Leo Schwinn, Stephan Günnemann

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tim Beyer, Sophie Xhonneux, Simon Geisler, Gauthier Gidel, Leo Schwinn, Stephan Günnemann

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 명의 새로운 경비원 중 누가 침입자를 막는 데 더 뛰어난지 판단하려고 한다고 상상해 보세요. 경비원들에게 일련의 '교묘한 질문'을 보내서 실수로 나쁜 사람을 들여보내는지 확인하는 테스트를 설계한다고 가정해 봅시다.

이 논문은 대형 언어 모델 (LLM) 의 안전성을 평가하는 현재의 방식이 바로 그 경비원들을 평가하는 데 고장 나고 일관성이 없으며 poorly 설계된 테스트를 사용하는 것과 같다고 주장합니다. 테스트 자체가 결함이 있기 때문에 누가 더 나은 경비원인지 진정으로 알 수 없으며, AI 를 더 안전하게 만드는 진전이 막히고 있습니다.

다음은 이 논문의 주요 내용을 간단한 비유로 정리한 것입니다:

1. 테스트 질문이 너무 작고 반복적입니다 (데이터셋)

도둑을 찾아내는 경비원의 능력을 테스트한다고 상상해 보세요. 1,000 가지의 서로 다른 도둑을 보여주는 대신, 50 장의 사진만 보여주는데 그중 40 장은 완전히 똑같다면요.

  • 문제점: 논문은 현재의 안전성 테스트가 매우 작은 '나쁜 프롬프트' 목록 (종종 100~500 개) 을 사용한다고 말합니다. 목록이 너무 작기 때문에 결과에는 '노이즈'(무작위 운) 가 가득합니다. 50 장의 사진으로 구성된 약간 다른 목록으로 같은 경비원을 테스트하면 점수가 극적으로 변할 수 있어, 실제로 안전한지 알 수 없게 됩니다.
  • '부분 표본 추출' 문제: 때로는 연구자들이 거대한 질문 목록을 가지고 있지만 테스트할 때 아주 작고 무작위인 소량만 선택합니다. 이는 100 문항 시험에서 3 문항만으로 학생의 성적을 매기는 것과 같습니다. 이는 모두 다른 작은 버전의 테스트를 치르기 때문에 서로 다른 학생들을 공정하게 비교하기 어렵게 만듭니다.
  • '영어 전용' 맹점: 대부분의 테스트는 영어로만 이루어집니다. 하지만 경비원이 영어만 할 줄 안다면 스페인어 테스트에서는 실패할 수 있습니다. 논문은 안전성에 대한 지식이 언어에 따라 달라지는 경우가 많으므로 영어로만 테스트하는 것은 잘못된 안도감을 준다고 지적합니다.

2. 게임의 규칙이 혼란스럽습니다 (알고리즘)

두 명의 경비원을 테스트하는데, 한 명은 손전등을 사용할 수 있게 허용하고 다른 한 명은 어둠 속에서 일하게 한다고 상상해 보세요. 또는 한 명은 빠르게 가는 스톱워치로 테스트하고 다른 한 명은 느리게 가는 스톱워치로 테스트하는 경우입니다.

  • 숨겨진 설정: 논문은 테스트 수행 방식의 아주 작고 보이지 않는 세부 사항들이 결과를 극적으로 바꾼다고 지적합니다. 예를 들어, 컴퓨터가 단어 사이의 '공백'을 처리하는 방식이나 어떤 '채팅 템플릿'을 사용하는지에 따라 경비원의 성공률이 14% 이상 변할 수 있습니다.
  • '목표' 함정: 많은 공격 시도는 AI 가 "물론, 여기 방법이 있습니다..."와 같은 특정 구절을 말하도록 강요하여 AI 가 규칙을 위반했음을 증명하려 합니다. 하지만 AI 가 대신 "물론입니다!"라고 말하도록 훈련되었다면, AI 가 안전해서가 아니라 공격자가 잘못된 '열쇠'를 사용했기 때문에 공격이 실패한 것입니다. 이는 AI 를 실제보다 더 안전하게 보이게 만듭니다.
  • 불공정한 비교: 일부 연구자들은 무제한의 컴퓨팅 파워로 공격 방법을 테스트하는 반면, 다른 이들은 매우 제한된 파워로 테스트합니다. 이를 비교하는 것은 출발선에서 앞서 달리는 단거리 선수와 전문 운동 선수가 경주를 하는 것을 비교하는 것과 같습니다.

3. 판사들은 편향되어 있고 일관성이 없습니다 (평가)

경비원이 교묘한 질문에 답한 후, '판사'가 "실패했는가?"를 결정해야 합니다.

  • 분열된 배심원: AI 안전성을 위한 단일 '대법원'은 없습니다. 어떤 연구자들은 하나의 AI 로 답을 평가하고, 다른 이들은 다른 AI 를 사용하며, 어떤 이들은 인간을 사용합니다. 이러한 '판사'들은 종종 서로 의견이 다릅니다. 한 판사는 응답이 안전하다고 말하는데, 다른 판사는 정답이 완전히 동일함에도 위험하다고 말할 수 있습니다.
  • '탐욕스러운' 실수: 대부분의 테스트는 AI 가 가장 가능성 높은 단일 답변을 내놓도록 강요합니다 (마치 가장 먼저 떠오르는 것만 고르는 로봇처럼). 하지만 현실 세계에서는 AI 가 기분이나 질문 횟수에 따라 다른 말을 할 수 있는 사람과 같습니다. '가장 가능성 높은' 답변만 테스트함으로써, AI 가 '생각'하는 방식이 다를 때 실수로 위험한 것을 말할 수 있는 경우를 놓치게 됩니다.
  • '과도한 거절' 맹점: 안전한 경비원은 나쁜 사람을 막는 것뿐만 아니라 좋은 사람도 막지 않아야 합니다. 경비원이 의심스러워 보인다는 이유로 무해한 사람을 들여보내지 않는다면, 이는 '과도한 거절'이라는 문제입니다. 논문은 대부분의 테스트가 이를 무시한다고 말합니다. 그들은 경비원이 나쁜 사람을 막는지만 확인하고, 좋은 사람들에게 너무 불쾌하게 대하는지는 확인하지 않습니다.

'반대 의견' (왜 상황이 이런지)

논문은 또한 다른 쪽의 의견도 경청합니다. 일부 연구자들은 다음과 같이 주장합니다:

  • 작은 테스트가 더 저렴합니다: 큰 테스트는 많은 시간과 비용이 듭니다. 작은 테스트는 연구자들이 새로운 아이디어를 빠르게 시도할 수 있게 합니다.
  • 완벽은 불가능합니다: 언어는 messy 합니다. 인간 대화의 모든 뉘앙스를 이해하는 완벽한 '판사'는 결코 갖지 못할 것입니다. 우리는 단지 우리가 가진 최고의 도구를 계속 개선해야 할 뿐입니다.
  • 진전은 어쨌든 일어납니다: 테스트가 messy 하더라도 이 분야는 여전히 전진하고 있습니다. 점수판이 완벽하지 않더라도 새로운 아이디어가 발견되고 있습니다.

해결책: 더 나은 규칙집

저자들은 테스트를 중단해야 한다고 말하는 것이 아닙니다. 모두가 동일한 규칙에 따라 플레이할 수 있도록 규칙집을 고쳐야 한다고 말합니다. 그들은 다음과 같이 제안합니다:

  1. 더 크고 더 나은 질문 목록 사용: 결과가 단순히 운이 아니도록 합니다.
  2. 설정 표준화: 모두가 동일한 '손전등'과 '스톱워치'를 사용하도록 합니다.
  3. 여러 판사 사용 및 인간 검증: 편향을 잡기 위해 여러 판사를 사용하고 인간이 결과를 이중 확인합니다.
  4. 양쪽 모두 테스트: AI 가 나쁜 사람을 막는지 그리고 좋은 사람을 들여보내는지 모두 확인합니다.

요약하자면: 이 논문은 현재 우리가 AI 의 안전성을 측정할 때, 길이가 스스로 변하는 자를 사용하고 있다고 주장합니다. 자를 고치지 않는 한, 우리가 실제로 진전을 이루고 있는지 확신할 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →