← 최신 논문
🤖 AI

NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims

이 정책 제안서는 NeurIPS 가 최첨단 AI 안전 주장에 대해 재현성 기준을 의무화해야 한다고 주장하며, 공개되지 않은 산출물로 인해 가장 중대한 안전 주장이 가장 검증하기 어려운 현재의 '증거 역전' 현상을 해결하기 위한 3 단계 공개 프레임워크를 제안합니다.

원저자: Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어떤 회사가 엄청나게 강력한 새로운 기계를 만든다고 상상해 보세요. 그들이 그 기계를 대중에게 판매하기 전에 "걱정하지 마세요, 이 기계는 안전합니다. 누구에게도 해를 끼치지 않을 것입니다"라는 보고서를 발표한다고 가정해 봅시다.

이 논문이 지적하는 문제는 바로 회사가 기계의 테스트 방법을 보여주기 위해 거절하는 경우가 많다는 점입니다. 그들은 최종 점수(예: "99% 안전!")만 제공하지만, 테스트 질문, 채점 규칙, 그리고 기계의 설정은 숨깁니다. 그들은 "우리를 믿으세요, 우리가 확인했습니다"라고 말합니다.

이 논문의 저자들은 NeurIPS 컨퍼런스(컴퓨터 과학자들의 주요 모임)가 규칙을 바꿔야 한다고 주장합니다. 그들의 말은 다음과 같습니다: "초강력 AI 에 대한 안전성 주장을 발표하고 싶다면, 그것을 입증해야 합니다. 당신의 작업을 보여줄 수 없다면, 그 큰 주장을 할 수 없습니다."

간단한 비유를 사용하여 그들의 제안 내용을 다음과 같이 정리해 보겠습니다:

1. 문제: "증거의 역전"

일반적으로 과학에서 주장이 크고 중요할수록, 그것을 뒷받침할 증거가 더 많이 필요합니다.

  • 일반 과학: 과학자가 "새로운 행성을 발견했습니다"라고 말한다면, 다른 사람들도 볼 수 있도록 망원경 데이터를 보여줘야 합니다.
  • AI 안전성 (문제): 회사가 "이 AI 는 전력망을 운영하는 데 충분히 안전합니다"라고 말한다면, 그들은 종종 데이터를 숨깁니다.

저자들은 이를 **"증거의 역전 (Evidential Inversion)"**이라고 부릅니다. 이는 마술사가 자신의 트릭이 무해하다고 주장하면서도 카드 덱을 아무도 보지 못하게 하는 것과 같습니다. 이 논문은 이것이 단순히 투명성 부족이 아니라 과학의 실패라고 주장합니다.

2. 해결책: 3 단계 "신호등" 시스템

저자들은 때로는 "카드"(테스트 데이터) 를 보여주는 것이 위험할 수 있음을 알고 있습니다. 보안 시스템을 어떻게 무너뜨리는지 정확히 보여주면, 나쁜 행위자들이 그 방법을 배울 수 있기 때문입니다.

그래서 그들은 얼마나 많은 정보를 공유해야 하는지에 대한 3 단계 시스템(신호등과 유사) 을 제안합니다:

  • 🟢 1 단계 (초록불 - 공개):

    • 시기: 테스트 데이터를 모두에게 보여도 안전한 경우.
    • 규칙: AI 에게 물어본 질문, 사용한 코드, 그리고 결과를 모두 공개해야 합니다. 누구나 테스트를 다시 실행할 수 있습니다.
    • 결과: 완전한 신뢰. 주장이 완전히 뒷받침됩니다.
  • 🟡 2 단계 (노란불 - 통제):

    • 시기: 데이터를 공개하는 것이 위험한 경우 (예: 해킹 방법을 가르치는 경우) 이지만, 신뢰할 수 있는 전문가라면 안전하게 볼 수 있는 경우.
    • 규칙: 데이터를 대중에게 공개하지 않습니다. 대신 비밀 유지가 보장된 독립적인 전문가 패널(사적인 보안 허가 수준) 에게 넘깁니다. 그들은 비공개로 작업을 검토한 후 "승인" 또는 "거부"를 결정합니다.
    • 결과: 주장은 뒷받침되지만, "우리는 이를 비공개로 확인했으나 원본 데이터는 볼 수 없습니다"라는 주의 사항이 붙습니다.
  • 🔴 3 단계 (빨간불 - 제한):

    • 시기: 비밀 패널조차 데이터를 볼 수 없을 정도로 위험한 경우 (예: 테스트에 생물학적 무기 시뮬레이션이 포함된 경우).
    • 규칙: 논문을 작성할 수는 있지만, AI 가 "배포하기에 안전하다"는 큰 주장은 할 수 없습니다. "우리는 이를 테스트해 보았으나 데이터가 너무 민감합니다"라고만 말할 수 있습니다.
    • 결과: 주장이 "적절하게 조정"됩니다. 이 논문을 이용해 AI 를 세계에 배포하는 것을 정당화할 수 없습니다.

3. "주장 인벤토리"(영수증)

회사들이 속임수를 쓰지 않도록 하기 위해, 이 논문은 저자들이 작성해야 하는 새로운 양식인 **주장 인벤토리 (Claim Inventory)**를 제안합니다.

  • 이는 마치 매장에서 받는 영수증과 같습니다.
  • 저자는 자신이 내는 모든 안전성 주장을 나열해야 합니다.
  • 각 주장 옆에는 다음 중 하나를 체크해야 합니다: "데이터를 보여줬나요? 비밀 패널의 검사를 받았나요? 아니면 너무 위험해서 보여줄 수 없나요?"
  • 만약 "너무 위험하다"를 체크했지만 좋은 이유가 없다면, 논문은 거절되거나 주장이 약화됩니다.

4. 왜 NeurIPS 인가?

저자들이 NeurIPS 를 선택한 이유는 그것이 AI 연구의 "올림픽"이기 때문입니다.

  • 현재 기업들은 NeurIPS 에서 안전성 보고서를 발표하는 것을 좋아합니다. 이는 그들의 주장에 과학적 정통성을 부여하기 때문입니다. 이는 대중과 정부가 그들을 신뢰하게 만듭니다.
  • 이 논문은 다음과 같이 주장합니다: "금메달 (NeurIPS 에의 게재) 을 원한다면 규칙을 따라야 합니다. 안전하다고 말하는 것만으로는 부족합니다. 공개적으로 또는 신뢰할 수 있는 심판에게 증명해야 합니다."

5. 속임수 방지 방법

저자들은 일부 회사가 시스템을 악용할 것 (예: 데이터를 숨기기 위해 "너무 위험하다"고 주장하는 경우) 을 예상합니다.

  • 해결책: 그들은 **연방 심사 시스템 (Federated Review System)**을 제안합니다. 다양한 "보안 허가"(다른 국가의 안전 기관이나 독립 실험실과 유사) 그룹을 상상해 보세요. 회사가 NeurIPS 에는 데이터가 너무 민감하다고 말하면, 이 그룹의 중립적 전문가가 이를 확인합니다.
  • 만약 전문가가 "아니요, 이는 실제로 그렇게 위험하지 않습니다. 보여줘야 합니다"라고 말하면, 회사는 데이터를 보여줘야 합니다. 만약 거부하면 논문은 거절됩니다.

요약

이 논문은 AI 커뮤니티에 대한 행동 촉구입니다: 안전성의 증거로 "우리를 믿으세요"를 받아들이지 마십시오.

강력한 AI 가 안전하다고 주장한다면, 다음 중 하나를 해야 합니다:

  1. 모든 사람에게 당신의 작업을 보여주세요.
  2. 신뢰할 수 있는 독립적인 심판이 비공개로 당신의 작업을 검토하게 하세요.
  3. 둘 다 할 수 없다면, 안전함을 입증하지 못했다고 인정하고, AI 를 배포하는 것을 정당화하기 위해 논문을 사용하지 마세요.

목표는 AI 개발을 막는 것이 아닙니다. 우리가 "이것은 안전하다"고 말할 때, 실제로 그것을 증명할 영수증이 있는지 확인하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →