← 최신 논문
🤖 AI

What AI Red-Team Evaluations Can and Cannot Prove

이 논문은 현재의 벤치마크가 고빈도 위해에 대해서는 안전성을 효과적으로 인증할 수 있지만, 내재적인 통계적 한계로 인해 희귀하고 치명적인 위험에 대한 안전성을 입증하는 데에는 근본적으로 불충분함을 입증하며, AI 레드팀 평가를 위한 계산 가능한 '증거적 천장(evidential ceiling)'을 설정한다.

원저자: Bandana Kaur

게시일 2026-07-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bandana Kaur

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 해결하려는 탐정이라고 상상해 보십시오. "이 새로운 로봇을 실제 세상에 풀어놓아도 안전할까?"라는 미스터리 말입니다. 이를 알아내기 위해, 당신은 단순히 로봇에게 "나는 착해요"라고 말하라고 시키는 대신, 로봇이 못되거나 위험한 말을 하도록 유도하는 레드팀(red-team) 훈련처럼 까다로운 일련의 테스트를 거치게 할 것입니다. 이것이 바로 AI 안전성 평가의 세계입니다. 하지만 여기서 문제가 발생합니다. 로봇이 안전하다고 확신하기 위해 얼마나 많은 속임수를 시도해야 할까요? 만약 10번의 시도 중 모두 통과했다면 그것으로 충분할까요? 만약 로봇이 백만 번 중 단 한 번만 위험한 행동을 한다면 어떻게 될까요?

여기에서 통계학이 등장합니다. 이것을 어두운 방 안의 손전등이라고 생각해 보십시오. 작은 손전등(작은 테스트)은 바닥에 있는 크고 명백한 돌(빈번한 실수)은 쉽게 보여줄 수 있습니다. 하지만 만약 그 위험이 아주 가끔 나타나는, 거의 보이지 않는 미세한 먼지라면, 동일한 작은 손전등은 그 먼지가 존재하더라도 완전히 놓쳐버릴 수 있습니다. 과학자들은 오랫동안 이러한 AI "안전 테스트"가 실제로 유용한지, 아니면 그저 시간 낭비인지에 대해 논쟁해 왔습니다. 어떤 이들은 그것이 아무것도 증명하지 못한다고 말하고, 다른 이들은 그것이 모든 것을 증명한다고 말합니다. 이 논문은 매우 구체적인 작업을 수행함으로써 이 논쟁을 종결시키고자 합니다. 바로 서로 다른 크기의 먼지를 보기 위해 손전등이 얼마나 밝아야 하는지를 정확히 계산하는 것입니다.

APIsec Research Labs의 반다나 카우르(Bandana Kaur)가 작성한 이 논문은, 안전 테스트가 쓸모없는 것은 아니지만 마법의 지팡이도 아니라고 주장합니다. 테스트에는 엄연한 한계가 있으며, 그 한계는 의견의 문제가 아니라 수학의 문제입니다. 저자는 "증거적 천장(evidential ceiling)"이라는 개념을 사용합니다. 물을 담을 수 있는 용량이 정해진 양동이가 있다고 상상해 보십시오. 만약 당신이 누출이 '작다'는 것을 증명하려 한다면, 깨끗한 테스트 결과(실패 사례가 0인 경우)로 채워진 가득 찬 양동이는 매우 설득력이 있습니다. 하지만 만약 당신이 누출이 '극도로 미미하다'는 것(예: 드물게 발생하는 치명적인 실패)을 증명하려 한다면, 동일한 양동이는 확신을 줄 만큼 충분한 증거를 포착하기에는 너무 작을 수 있습니다.

이 논문의 주요 발견은 계산 가능한 "교차점(crossing point)"이 존재한다는 것입니다. 만약 특정 유형의 해악이 충분히 자주 발생한다면(예: 1%의 확률로), 약 520개의 프롬프트로 구성된 표준 테스트는 "좋아, 이 모델은 배포하기에 충분히 안전해 보인다"라고 말하기에 충분합니다. 사실, 520번의 테스트를 실행하여 문제가 하나도 발견되지 않았다면, 이는 단 하나의 문제라도 발견되는 것보다 더 강력한 증거가 됩니다. 이것은 깨끗한 방을 찾는 것과 같습니다. 만약 세균이 도처에 있을 것이라고 예상했는데 방이 깨끗하다면, 그것은 엄청난 놀라움이며 무언가가 제대로 작동하고 있음을 증명하는 것입니다.

하지만 논문은 희귀한 사건들에 대해 명확한 선을 긋습니다. 만약 해로운 행동이 극도로 드물다면(예: 0.001% 미만의 확률로 발생), 합리적인 예산 범위 내에서 아무리 많은 프롬프트를 시도하더라도 "깨끗한 결과(zero failures)"는 거의 아무것도 알려주지 못합니다. 수학적으로 볼 때, 이러한 희귀하고 치명적인 위험에 대해서는 깨끗한 테스트 결과가 약한 증거가 됩니다. 이 영역에서는 단 한 번의 관찰된 실패가 오히려 깨끗한 테스트보다 더 많은 정보를 제공하는데, 왜냐하면 깨끗한 테스트 결과는 그저 운이 좋았던 것일 수도 있기 때문입니다. 논문은 이러한 희귀한 사건들에 대해 현재의 공개 벤치마크들이 "수 자릿수(orders of magnitude)만큼 부족하다"라고 계산했습니다. 즉, 안전을 증명하기에는 수천 배나 작다는 의미입니다.

저자는 또한 이러한 테스트가 구축되는 방식도 중요하다고 지적합니다. 만약 테스트 질문들이 모두 매우 유사하다면(예: 같은 질문을 약간씩 다른 단어로 바꾸어 묻는 경우), 그것은 마치 건더기 더미에서 바늘을 찾으면서 방의 한 구석만 확인하는 것과 같습니다. 논문은 현재의 테스트들이 종종 서로 밀집되어 있어, 서류상에 보이는 것보다 효과가 떨어진다고 제안합니다. 더욱이, 논문은 단순히 테스트를 "더 많이" 하는 것이 답이 아니라는 점을 강조합니다. 대신, 우리는 더 똑똑한 테스트, 즉 안전한 모델과 안전하지 않은 모델을 더 잘 구별해 낼 수 있는 테스트가 필요합니다. 만약 어떤 테스트가 나쁜 모델을 90% 확률로 속일 수 있고 좋은 모델은 10% 확률로만 속인다면, 그것은 강력한 도구가 됩니다. 하지만 두 모델을 똑같이 속인다면, 그것은 아무리 여러 번 실행하더라도 무용지물입니다.

결론적으로, 이 논문은 AI 연구소들이 결과를 보고하는 방식에 대한 새로운 규칙을 제안합니다. 단순히 "우리는 500번의 테스트를 실행했고 나쁜 것을 발견하지 못했다"라고 말하는 대신, 그들의 테스트가 무엇을 증명할 수 있는지를 정확하게 보고해야 합니다. 해악의 비율이 높다면 안전하다고 주장할 수 있습니다. 하지만 해악의 비율이 낮고 희귀하다면, 자신들의 테스트가 안전을 증명할 수 없었음을 인정하고 다른 종류의 증거가 필요함을 밝혀야 합니다. 이 논문은 테스트를 중단하라고 말하는 것이 아닙니다. 다만 우리의 테스트가 수학적으로 증명할 수 없는 것을 증명할 수 있다고 가장하는 것을 멈추라고 말하는 것입니다. 그것은 정직함에 대한 촉구입니다. 자신의 손전등의 한계를 알고, 방의 한 구석만 비추고 있으면서 방 전체가 보인다고 주장하지 마십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →